연락처 정보
 기간 14 시간

코스 개요

예측형 AIOps 입문

  • IT 운영에서의 예측 분석 개요
  • 예측용 데이터 소스(로그, 메트릭, 이벤트)
  • 시계열 예측 및 이상 패턴의 주요 개념

장애 예측 모델 설계

  • 과거 장애 및 시스템 행동 라벨링
  • 모델 선택 및 훈련(예: LSTM, Random Forest, AutoML)
  • 모델 성능 평가 및 오탐(False Positive) 처리

데이터 수집 및 특징 공학(Feature Engineering)

  • 모델 입력을 위한 로그 및 메트릭 데이터 수집 및 정렬
  • 구조화 및 비구조화 데이터로부터 특징 추출
  • 운영 파이프라인의 노이즈 및 누락 데이터 처리

근본 원인 분석(RCA) 자동화

  • 서비스 및 인프라의 그래프 기반 상관관계 분석
  • 이벤트 체인에서 ML을 활용한 가능성 높은 근본 원인 추론
  • 토폴로지 인식 대시보드를 활용한 RCA 시각화

복구 및 워크플로우 자동화

  • 자동화 플랫폼과의 통합(예: Ansible, Rundeck)
  • 롤백, 재시작, 트래픽 리디렉션 트리거
  • 자동 개입에 대한 감사 및 문서화

지능형 AIOps 파이프라인 확장

  • 가시성을 위한 MLOps: 재훈련 및 모델 버전 관리
  • 분산 노드 전반에 걸친 실시간 예측 실행
  • 프로덕션 환경에서의 AIOps 배포 모범 사례

사례 연구 및 실전 적용

  • 예측형 AIOps 모델을 활용한 실제 장애 데이터 분석
  • 합성 데이터 및 프로덕션 데이터로 RCA 파이프라인 배포
  • 업계 사용 사례 검토: 클라우드 장애, 마이크로서비스 불안정성, 네트워크 저하

요약 및 다음 단계

요건

  • Prometheus나 ELK와 같은 모니터링 시스템에 대한 경험
  • Python 및 기초 머신러닝에 대한 실무 지식
  • 장애 관리 워크플로우에 대한 숙지

수강 대상자

  • 시니어 사이트 리얼리티 엔지니어(SRE)
  • IT 자동화 아키텍트
  • DevOps 및 가시성(관측 가능성) 플랫폼 리드

참가자 수


참가자별 가격

예정된 코스

관련 카테고리