연락처 정보
 기간 14 시간

코스 개요

AIOps 소개

  • AIOps란 무엇이며, 왜 중요한가
  • 전통적인 모니터링과 AIOps 기반 관찰 가능성 비교
  • AIOps 아키텍처 및 핵심 구성 요소

운영 데이터 수집 및 정규화

  • 관찰 가능성 데이터 유형: 메트릭, 로그, 트레이스
  • 다양한 소스(서버, 컨테이너, 클라우드)로부터 데이터 수집
  • 에이전트 및 익스포터(Prometheus, Beats, Fluentd) 활용

데이터 상관성 분석 및 이상 탐지

  • 시계열 상관성 분석 및 통계적 방법
  • ML 모델 활용한 이상 탐지
  • 분산 시스템 내 이상 징후(Incident) 탐지

알림 및 노이즈 감소

  • 지능형 알림 규칙 및 임계값 설계
  • 알림 억제, 중복 제거, 알림 그룹화
  • Alertmanager, Slack, PagerDuty, Opsgenie와의 연동

근본 원인 분석(RCA) 및 시각화

  • 대시보드를 활용한 메트릭 시각화 및 추세 감지
  • RCA를 위한 이벤트 및 타임라인 탐색
  • 분산 트레이싱 도구를 활용한 레이어 간 이슈 추적

자동화 및 복구(Remediation)

  • 이상 징후 발생 시 자동 스크립트 또는 워크플로 트리거링
  • ITSM 시스템(ServiceNow, Jira)과의 연동
  • 사용 사례: 자가 치유(Self-healing), 스케일링, 트래픽 재라우팅

오픈소스 및 상용 AIOps 플랫폼

  • 도구 개요: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
  • AIOps 플랫폼 선정 기준
  • 선정된 스택에 대한 데모 및 실습

요약 및 다음 단계

요건

  • IT 운영 및 시스템 모니터링 개념에 대한 이해
  • 모니터링 도구 또는 대시보드 사용 경험
  • 기본 로그 및 메트릭 포맷에 대한 숙지

대상 수강생

  • 인프라 및 애플리케이션을 관리하는 운영 팀
  • 사이트 신뢰성 엔지니어(SRE)
  • IT 모니터링 및 관찰 가능성(Observability) 팀

참가자 수


참가자별 가격

예정된 코스

관련 카테고리