연락처 정보

코스 개요

AIOps 개요 소개

  • AIOps란 무엇이며 왜 중요한가?
  • 기존 모니터링 방식과 AIOps 기반 관측 가능성의 차이점
  • AIOps 아키텍처 및 주요 구성 요소 설명

운영 데이터 수집 및 표준화 방법

  • 관측 가능성에 활용되는 지표, 로그, 트레이스 등의 데이터 유형
  • 서버, 컨테이너 및 클라우드 환경에서 다수의 데이터 소스를 통합하는 방법
  • Prometheus, Beats, Fluentd와 같은 에이전트 및 익스포터 활용법

데이터 상관관계 분석 및 이상 징후 탐지 기법

  • 시계열 데이터 간의 상호 관계 파악과 통계적 분석 방법
  • 머신러닝 모델을 활용한 이상 현상 탐지 기법
  • 분산형 시스템 전반에서 발생하는 장애 패턴의 인식 방법

알림 관리 및 노이즈 제어 방안

  • 지능형 알림 규칙 설계와 임계값 조정 방법
  • 중복된 경고 무시, 묶음 처리 및 불필요한 정보 제거 기법
  • Alertmanager, Slack, PagerDuty, Opsgenie와 같은 외부 시스템과의 연동 방법

근본 원인 분석 및 시각화 도구 활용법

  • 대시보드를 통해 지표 추세 파악 및 모니터링 방법
  • 이벤트 기록과 시간축을 활용한 근본 원인 분석 접근법
  • 분산 트레이싱 도구를 이용해 시스템 각 계층의 문제 추적 방법

자동화 및 사후 복구 처리 기법

  • 장애 발생 시 스크립트 또는 워크플로우가 자동으로 실행되도록 구성하는 방법
  • ServiceNow, Jira와 같은 ITSM 시스템과의 통합 접근법
  • 자가 복구 기능 구현, 부하 분산 및 트래픽 재경로화 등의 실제 활용 사례

주요 오픈소스 및 상용 AIOps 플랫폼 소개

  • Prometheus, Grafana, ELK, Moogsoft, Dynatrace 등 대표적인 도구 설명
  • AIOps 플랫폼을 선정할 때 고려해야 할 평가 기준들
  • 선택한 도구들을 활용한 실습 및 데모 시연

강의 요약 및 향후 발전 방향 안내

요건

  • IT 운영 및 시스템 모니터링 개념에 대한 기본 이해
  • 다양한 모니터링 도구 또는 대시보드 사용 경험
  • 로그 파일 및 지표 데이터 형식에 대한 기초적인 지식

대상 그룹

  • 인프라 및 애플리케이션 운영을 담당하는 팀
  • 사이트 신뢰성 엔지니어(SRE)
  • IT 모니터링 및 관측 가능성 관련 업무를 수행하는 팀
 14 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리