연락처 정보

코스 개요

예측형 AIOps 소개

  • IT 운영 분야에서의 예측 분석 개요
  • 예측을 위한 데이터 원본(로그, 지표, 이벤트)
  • 시계열 예측 및 이상 패턴과 관련된 핵심 개념

사고 예측 모델 설계 방법

  • 과거의 사고 기록 및 시스템 동작 패턴에 대한 레이블링
  • LSTM, Random Forest, AutoML 등 적합한 모델 선택 및 학습
  • 모델 성능 평가와 오탐지 관리 방안

데이터 수집 및 특성 추출 기법

  • 모델 입력값으로 활용하기 위해 로그와 지표 데이터를 통합하고 정렬하는 방법
  • 구조화된 데이터와 비구조화된 데이터에서 유용한 특성 추출
  • 운영 파이프라인 내의 노이즈 및 결측값 처리 기법

근본 원인 분석(RCA) 자동화 구현

  • 서비스와 인프라 간 상관관계를 그래프 기반으로 연동하는 방법
  • 이벤트 흐름을 통해 가능한 근본 원인을 추론하기 위한 머신러닝 활용
  • 인프라 구조를 고려한 시각화 대시보드를 통한 RCA 표현

복구 절차 및 워크플로우 자동화 전략

  • Ansible, Rundeck와 같은 자동화 플랫폼과의 연동 방법
  • 시스템 롤백, 재시작 또는 트래픽 경로 변경 등 자동화 작업 실행
  • 자동으로 수행된 조치 사항에 대한 감사 및 기록 관리

지능형 AIOps 파이프라인의 확장 방안

  • 관측 가능성 유지를 위한 MLOps 체계: 모델 재학습 및 버전 관리
  • 분산 환경에서 실시간 예측 서비스 운영 기법
  • 실제 운영 환경에 AIOps 솔루션을 도입할 때의 모범 사례

사례 연구 및 실무 적용 예시

  • 실제 발생했던 사고 데이터를 활용해 예측형 AIOps 모델을 분석하는 방법
  • 가상 및 실제 생산 환경의 데이터로 RCA 파이프라인 구현하기
  • 클라우드 장애, 마이크로서비스 불안정성, 네트워크 성능 저하 등 산업별 활용 사례 검토

요약 및 향후 실행 방향

요건

  • Prometheus나 ELK와 같은 모니터링 시스템 사용 경험
  • Python 활용 능력 및 기초적인 머신러닝 지식
  • 사고 관리 워크플로우에 대한 이해도

수강 대상

  • 시니어급 사이트 신뢰성 엔지니어(SRE)
  • IT 자동화 설계자
  • DevOps 및 관측 가능성 플랫폼 책임자
 14 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리