연락처 정보

코스 개요

텐센트 허위안 프로덕션 환경 기초 지식

  • 텐센트 허위안 모델 서비스 적용 시나리오 소개
  • 대형 모델 및 MoE 모델 운영의 특성 분석
  • 지연 시간, 처리량, 비용 측면에서 자주 발생하는 병목 현상 파악
  • 인퍼런스 워크로드에 적합한 서비스 수준 목표 설정 방법

배포 아키텍처 및 인퍼런스 흐름 이해하기

  • 프로덕션 인퍼런스 시스템의 핵심 구성 요소 소개
  • 컨테이너 기반, 온프레미스 및 클라우드 배포 방식 간 선택 가이드라인 제시
  • 모델 로딩 프로세스와 요청 라우팅 체계, GPU 할당 원리 설명
  • 신뢰성과 운영 편의성을 동시에 고려한 시스템 설계 전략 안내

실무 중심 지연 시간 최적화 기법

  • TensorRT와 같은 인퍼런스 엔진 활용 방법론 및 적용 예시
  • KV 캐시의 개념과 이를 실제로 튜닝하는 절차 설명
  • 시스템 시작 시간, 워밍업 기간 및 응답 대기 시간 단축 방안
  • 첫 토큰 생성까지 걸리는 시간 측정법과 토큰 생산 속도 평가 방법

처리량 향상, 배치 전략 및 GPU 활용 극대화

  • 연속형 배치 처리와 요청 묶음 처리의 최적 설계 원칙
  • 동시 실행 가능한 작업 수 관리와 큐 동작 방식 이해하기
  • 사용자 체감 품질 저하 없이 GPU 자원 활용률을 높이는 핵심 방법
  • 장문 컨텍스트 및 다양한 종류의 요청을 효과적으로 처리하는 기술

양자화와 비용 관리 전략

  • 프로덕션 환경에서 양자화 도입 시 얻는 실질적 장점 설명
  • FP16, INT8 등 다양한 정밀도 수준 선택에 따른 성능 및 비용 차이 분석
  • 모델 품질 유지와 지연 시간 단축, 인프라 비용 절감 간 균형점 찾기 방법
  • 간단하면서도 실무 활용 가능한 비용 최적화 체크리스트 제작 요령

운영 관리 및 모니터링, 시스템 준비도 검토

  • 인퍼런스 서비스 자체 확장이 트리거되는 기준값 설정법 소개
  • 지연 시간, 처리량 수치, 캐시 활용률 및 GPU 상태를 지속적으로 추적하는 방안
  • 로그 관리, 알림 체계 구축, 장애 대응 기본 원칙 안내
  • 참고 예제 배포 사례 검토 후 현실적인 개선 계획 수립하기 방법

요건

  • 대규모 언어 모델 배포 및 인퍼런스 워크플로우에 대한 기본적인 이해가 필요합니다.
  • 컨테이너 기술, 클라우드 혹은 온프레미스 인프라 및 API 기반 서비스 활용 경험도 필수적입니다.
  • Python 또는 시스템 엔지니어링 관련 실무 지식 또한 갖추고 계셔야 합니다.

대상 참가자

  • LLM을 프로덕션 환경에 도입하고자 하는 머신러닝 엔지니어들
  • GPU 기반 인퍼런스 서비스 운영을 책임지는 플랫폼 엔지니어들
  • 확장 가능한 AI 서비스 플랫폼 설계를 담당하는 솔루션 아키텍트들
 14 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리