연락처 정보
 기간 21 시간

코스 개요

Ollama 확장 소개

  • Ollama의 아키텍처 및 확장 고려 사항
  • 다중 사용자 배포 시 공통 병목 현상
  • 인프라 준비를 위한 모범 사례

리소스 할당 및 GPU 최적화

  • 효율적인 CPU/GPU 활용 전략
  • 메모리 및 대역폭 고려 사항
  • 컨테이너 수준 리소스 제약 사항

컨테이너 및 Kubernetes를 통한 배포

  • Docker를 사용한 Ollama 컨테이너화
  • Kubernetes 클러스터에서 Ollama 실행
  • 로드 밸런싱 및 서비스 디스커버리

자동 스케일링 및 배치 처리

  • Ollama를 위한 자동 스케일링 정책 설계
  • 처리량 최적화를 위한 배치 추론 기법
  • 지연 시간과 처리량의 트레이드오프

지연 시간 최적화

  • 추론 성능 프로파일링
  • 캐싱 전략 및 모델 웜업
  • I/O 및 통신 오버헤드 감소

모니터링 및 가시성

  • Prometheus를 이용한 지표 통합
  • Grafana를 이용한 대시보드 구축
  • Ollama 인프라를 위한 경보 및 장애 대응

비용 관리 및 확장 전략

  • 비용 인식 기반 GPU 할당
  • 클라우드 vs 온프레미스 배포 고려 사항
  • 지속 가능한 확장을 위한 전략

요약 및 다음 단계

요건

  • Linux 시스템 관리 경험
  • 컨테이너화 및 오케스트레이션에 대한 이해
  • 기계 학습 모델 배포에 대한 친숙함

대상 고객

  • DevOps 엔지니어
  • ML 인프라 팀
  • 사이트 리야빌리티 엔지니어

참가자 수


참가자별 가격

예정된 코스

관련 카테고리