연락처 정보

코스 개요

Ollama 확장을 위한 기초 개념

  • Ollama의 아키텍처 및 확장 관련 고려사항
  • 다중 사용자 환경에서 발생하는 일반적인 병목 현상
  • 인프라 준비를 위한 모범 사례들

리소스 할당 및 GPU 최적화

  • CPU/GPU 활용도 극대화 전략
  • 메모리와 대역폭 측면의 고려사항
  • 컨테이너 레벨에서의 리소스 제한 설정

컨테이너 및 Kubernetes를 활용한 배포

  • Docker를 이용한 Ollama 컨테이너화 방법
  • Kubernetes 클러스터 내에서 Ollama 운영하기
  • 부하 분산 및 서비스 탐색 기능 활용법

자동 확장과 배치 처리

  • Ollama 환경에 적합한 자동 확장 정책 설계
  • 처리량 최적화를 위한 배치 추론 기법들
  • 지연 시간과 처리량 사이의 균형점 찾기

지연 시간 최적화 방안

  • 추론 성능 측정 및 프로파일링 방법
  • 캐싱 전략과 모델 사전 준비 기법
  • I/O 작업 및 통신 오버헤드 감소 방안

모니터링 및 가시성 확보 방법

  • Prometheus를 활용한 메트릭 수집법
  • Grafana로 대시보드 구축하기
  • Ollama 인프라에 대한 경고 설정 및 장애 대응 절차

비용 관리와 지속 가능한 확장 전략

  • 비용 고려형 GPU 할당 방식
  • 클라우드와 온프레미스 환경 배포 간의 차이점 비교
  • 장기적 관점에서 지속 가능한 확장 전략들

요약 및 향후 진행 방향

요건

  • Linux 시스템 관리 경험
  • 컨테이너화 및 오케스트레이션에 대한 이해
  • 머신러닝 모델 배포 관련 지식

수강 대상

  • DevOps 엔지니어
  • 머신러닝 인프라 팀
  • 사이트 안정성 엔지니어
 21 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리