문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
기간 14 시간
코스 개요
AIOps 소개
- AIOps란 무엇이며, 왜 중요한가
- 전통적인 모니터링과 AIOps 기반 관찰 가능성 비교
- AIOps 아키텍처 및 핵심 구성 요소
운영 데이터 수집 및 정규화
- 관찰 가능성 데이터 유형: 메트릭, 로그, 트레이스
- 다양한 소스(서버, 컨테이너, 클라우드)로부터 데이터 수집
- 에이전트 및 익스포터(Prometheus, Beats, Fluentd) 활용
데이터 상관성 분석 및 이상 탐지
- 시계열 상관성 분석 및 통계적 방법
- ML 모델 활용한 이상 탐지
- 분산 시스템 내 이상 징후(Incident) 탐지
알림 및 노이즈 감소
- 지능형 알림 규칙 및 임계값 설계
- 알림 억제, 중복 제거, 알림 그룹화
- Alertmanager, Slack, PagerDuty, Opsgenie와의 연동
근본 원인 분석(RCA) 및 시각화
- 대시보드를 활용한 메트릭 시각화 및 추세 감지
- RCA를 위한 이벤트 및 타임라인 탐색
- 분산 트레이싱 도구를 활용한 레이어 간 이슈 추적
자동화 및 복구(Remediation)
- 이상 징후 발생 시 자동 스크립트 또는 워크플로 트리거링
- ITSM 시스템(ServiceNow, Jira)과의 연동
- 사용 사례: 자가 치유(Self-healing), 스케일링, 트래픽 재라우팅
오픈소스 및 상용 AIOps 플랫폼
- 도구 개요: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- AIOps 플랫폼 선정 기준
- 선정된 스택에 대한 데모 및 실습
요약 및 다음 단계
요건
- IT 운영 및 시스템 모니터링 개념에 대한 이해
- 모니터링 도구 또는 대시보드 사용 경험
- 기본 로그 및 메트릭 포맷에 대한 숙지
대상 수강생
- 인프라 및 애플리케이션을 관리하는 운영 팀
- 사이트 신뢰성 엔지니어(SRE)
- IT 모니터링 및 관찰 가능성(Observability) 팀