문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
예측형 AIOps 소개
- IT 운영 분야에서의 예측 분석 개요
- 예측을 위한 데이터 원본(로그, 지표, 이벤트)
- 시계열 예측 및 이상 패턴과 관련된 핵심 개념
사고 예측 모델 설계 방법
- 과거의 사고 기록 및 시스템 동작 패턴에 대한 레이블링
- LSTM, Random Forest, AutoML 등 적합한 모델 선택 및 학습
- 모델 성능 평가와 오탐지 관리 방안
데이터 수집 및 특성 추출 기법
- 모델 입력값으로 활용하기 위해 로그와 지표 데이터를 통합하고 정렬하는 방법
- 구조화된 데이터와 비구조화된 데이터에서 유용한 특성 추출
- 운영 파이프라인 내의 노이즈 및 결측값 처리 기법
근본 원인 분석(RCA) 자동화 구현
- 서비스와 인프라 간 상관관계를 그래프 기반으로 연동하는 방법
- 이벤트 흐름을 통해 가능한 근본 원인을 추론하기 위한 머신러닝 활용
- 인프라 구조를 고려한 시각화 대시보드를 통한 RCA 표현
복구 절차 및 워크플로우 자동화 전략
- Ansible, Rundeck와 같은 자동화 플랫폼과의 연동 방법
- 시스템 롤백, 재시작 또는 트래픽 경로 변경 등 자동화 작업 실행
- 자동으로 수행된 조치 사항에 대한 감사 및 기록 관리
지능형 AIOps 파이프라인의 확장 방안
- 관측 가능성 유지를 위한 MLOps 체계: 모델 재학습 및 버전 관리
- 분산 환경에서 실시간 예측 서비스 운영 기법
- 실제 운영 환경에 AIOps 솔루션을 도입할 때의 모범 사례
사례 연구 및 실무 적용 예시
- 실제 발생했던 사고 데이터를 활용해 예측형 AIOps 모델을 분석하는 방법
- 가상 및 실제 생산 환경의 데이터로 RCA 파이프라인 구현하기
- 클라우드 장애, 마이크로서비스 불안정성, 네트워크 성능 저하 등 산업별 활용 사례 검토
요약 및 향후 실행 방향
요건
- Prometheus나 ELK와 같은 모니터링 시스템 사용 경험
- Python 활용 능력 및 기초적인 머신러닝 지식
- 사고 관리 워크플로우에 대한 이해도
수강 대상
- 시니어급 사이트 신뢰성 엔지니어(SRE)
- IT 자동화 설계자
- DevOps 및 관측 가능성 플랫폼 책임자
14 시간