문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
AIOps 개요 소개
- AIOps란 무엇이며 왜 중요한가?
- 기존 모니터링 방식과 AIOps 기반 관측 가능성의 차이점
- AIOps 아키텍처 및 주요 구성 요소 설명
운영 데이터 수집 및 표준화 방법
- 관측 가능성에 활용되는 지표, 로그, 트레이스 등의 데이터 유형
- 서버, 컨테이너 및 클라우드 환경에서 다수의 데이터 소스를 통합하는 방법
- Prometheus, Beats, Fluentd와 같은 에이전트 및 익스포터 활용법
데이터 상관관계 분석 및 이상 징후 탐지 기법
- 시계열 데이터 간의 상호 관계 파악과 통계적 분석 방법
- 머신러닝 모델을 활용한 이상 현상 탐지 기법
- 분산형 시스템 전반에서 발생하는 장애 패턴의 인식 방법
알림 관리 및 노이즈 제어 방안
- 지능형 알림 규칙 설계와 임계값 조정 방법
- 중복된 경고 무시, 묶음 처리 및 불필요한 정보 제거 기법
- Alertmanager, Slack, PagerDuty, Opsgenie와 같은 외부 시스템과의 연동 방법
근본 원인 분석 및 시각화 도구 활용법
- 대시보드를 통해 지표 추세 파악 및 모니터링 방법
- 이벤트 기록과 시간축을 활용한 근본 원인 분석 접근법
- 분산 트레이싱 도구를 이용해 시스템 각 계층의 문제 추적 방법
자동화 및 사후 복구 처리 기법
- 장애 발생 시 스크립트 또는 워크플로우가 자동으로 실행되도록 구성하는 방법
- ServiceNow, Jira와 같은 ITSM 시스템과의 통합 접근법
- 자가 복구 기능 구현, 부하 분산 및 트래픽 재경로화 등의 실제 활용 사례
주요 오픈소스 및 상용 AIOps 플랫폼 소개
- Prometheus, Grafana, ELK, Moogsoft, Dynatrace 등 대표적인 도구 설명
- AIOps 플랫폼을 선정할 때 고려해야 할 평가 기준들
- 선택한 도구들을 활용한 실습 및 데모 시연
강의 요약 및 향후 발전 방향 안내
요건
- IT 운영 및 시스템 모니터링 개념에 대한 기본 이해
- 다양한 모니터링 도구 또는 대시보드 사용 경험
- 로그 파일 및 지표 데이터 형식에 대한 기초적인 지식
대상 그룹
- 인프라 및 애플리케이션 운영을 담당하는 팀
- 사이트 신뢰성 엔지니어(SRE)
- IT 모니터링 및 관측 가능성 관련 업무를 수행하는 팀
14 시간