문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
기간 14 시간
코스 개요
예측형 AIOps 입문
- IT 운영에서의 예측 분석 개요
- 예측용 데이터 소스(로그, 메트릭, 이벤트)
- 시계열 예측 및 이상 패턴의 주요 개념
장애 예측 모델 설계
- 과거 장애 및 시스템 행동 라벨링
- 모델 선택 및 훈련(예: LSTM, Random Forest, AutoML)
- 모델 성능 평가 및 오탐(False Positive) 처리
데이터 수집 및 특징 공학(Feature Engineering)
- 모델 입력을 위한 로그 및 메트릭 데이터 수집 및 정렬
- 구조화 및 비구조화 데이터로부터 특징 추출
- 운영 파이프라인의 노이즈 및 누락 데이터 처리
근본 원인 분석(RCA) 자동화
- 서비스 및 인프라의 그래프 기반 상관관계 분석
- 이벤트 체인에서 ML을 활용한 가능성 높은 근본 원인 추론
- 토폴로지 인식 대시보드를 활용한 RCA 시각화
복구 및 워크플로우 자동화
- 자동화 플랫폼과의 통합(예: Ansible, Rundeck)
- 롤백, 재시작, 트래픽 리디렉션 트리거
- 자동 개입에 대한 감사 및 문서화
지능형 AIOps 파이프라인 확장
- 가시성을 위한 MLOps: 재훈련 및 모델 버전 관리
- 분산 노드 전반에 걸친 실시간 예측 실행
- 프로덕션 환경에서의 AIOps 배포 모범 사례
사례 연구 및 실전 적용
- 예측형 AIOps 모델을 활용한 실제 장애 데이터 분석
- 합성 데이터 및 프로덕션 데이터로 RCA 파이프라인 배포
- 업계 사용 사례 검토: 클라우드 장애, 마이크로서비스 불안정성, 네트워크 저하
요약 및 다음 단계
요건
- Prometheus나 ELK와 같은 모니터링 시스템에 대한 경험
- Python 및 기초 머신러닝에 대한 실무 지식
- 장애 관리 워크플로우에 대한 숙지
수강 대상자
- 시니어 사이트 리얼리티 엔지니어(SRE)
- IT 자동화 아키텍트
- DevOps 및 가시성(관측 가능성) 플랫폼 리드