연락처 정보

코스 개요

AI 기반 관측 가능성의 현재 모습

  • 대시보드 중심에서 대화형 환경으로: AI 보조형 관측 가능성으로의 전환
  • 요약, 추론 및 패턴 인식 기능을 포함한 LLM의 관측 관련 역량 정리
  • 기존 관측 체계에 AI 기술 통합을 위한 아키텍처 설계 기법

자연어를 활용한 텔레메트리 데이터 조회

  • 자연어 문장을 모니터링 쿼리 형식(PromQL)으로 변환하기
  • Elasticsearch, OpenSearch 및 Loki 로그 저장소에 대한 자연어 기반 조회
  • 구조화된 텔레메트리 데이터용 SQL 문 생성 기능 개발
  • 도구 활용 능력과 맥락 인식 기능을 갖춘 쿼리 보조 에이전트 구현

LLM 기반 로그 분석 방법

  • LLM 활용 자동화된 로그 파싱 및 데이터 구성
  • 임베딩 유사도를 활용한 대규모 로그 스트림 내 이상 탐지
  • 대규모 로그 집합에서 패턴과 그룹화 자동 발견
  • 원시 로그 시퀀스로부터 인간이 읽기 쉬운 설명 생성하기

지능형 알림 처리 및 사고 정보 보강

  • 의미론적 분석을 통한 알림 상관관계 판단과 중복 제거
  • 기존 운영 매뉴얼, 과거 사례 및 기술 문서를 바탕으로 한 자동화된 맥락 수집
  • 내용 분석 및 팀별 전문 분야에 맞춘 스마트 알림 라우팅 방식
  • AI 기반 노이즈 억제 기능을 통한 과도한 알림 감소

AI 보조형 근본 원인 분석 체계

  • 여러 텔레메트리 데이터 소스를 종합해 가설 생성하기
  • 메트릭, 로그 및 트레이스 간의 증거 상호 연결 구조화
  • 대화형 AI 진단 세션을 통한 안내식 문제 해결 과정
  • 점진적 조사 방식을 적용하는 근본 원인 분석 에이전트 개발

자동화된 사고 대응 및 커뮤니케이션 방법

  • 텔레메트리 데이터를 바탕으로 한 자동 사고 요약문 및 상황 업데이트 작성
  • 시간 축 기반 재구성을 통한 자동화된 사후 보고서 초안 생성
  • 기술 전문가와 경영진 각각의 관점에 맞춘 의사소통 자료 제작
  • 운영 매뉴얼 추천 및 사고 해결을 위한 자동화된 권장 조치 제공

관측 가능성 분야의 머신러닝 응용

  • 용량 계획 수립 및 이상 예측을 위한 시계열 데이터 전망 기법
  • 메트릭 분석을 위해 제로샷 학습 방식의 대규모 언어 모델 활용
  • 임베딩 기술을 통한 서비스 간 관계 파악 및 네트워크 토폴로지 탐색
  • 관측 가능성 파이프라인 내에서 경량 머신러닝 모델의 학습 및 배포 방법

실제 적용 시 고려사항과 윤리적 문제점

  • 실시간 AI 관측 환경 구축 시 지연 시간 및 비용 최적화 방안
  • 민감한 텔레메트리 데이터가 LLM을 통해 유출되지 않도록 보호하는 방법
  • AI 진단 결과를 검증하기 위해 운영자 개입이 필수적인 시점 판단
  • MTTD, MTTR 및 당직 경험 지표 등 실제 효과 측정법 정리

요건

  • Prometheus, Grafana, Datadog 또는 OpenTelemetry와 같은 관측 가능성 도구 사용 경험
  • 로그 관리 및 메트릭 개념에 대한 이해
  • 데이터 처리를 위한 기본적인 Python 스크립팅 능력

대상 수강생

  • AI 기술을 접목한 도구를 도입하고자 하는 SRE 및 관측 가능성 전문가
  • 차세대 모니터링 파이프라인 개발에 참여하는 플랫폼 엔지니어
  • 사고 대응 워크플로우에 LLM 통합 방안을 검토 중인 DevOps 리더
 14 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리