연락처 정보

코스 개요

AI 주권 및 LLM의 로컬 배포

  • 클라우드 기반 LLM의 위험 요소: 데이터 보관, 입력값 활용을 통한 학습, 외국 법적 관할 문제 등.
  • Ollama 아키텍처 개요: 모델 서버, 레지스트리, OpenAI 호환형 API의 구성 방식.
  • vLLM, llama.cpp, Text Generation Inference와의 비교 분석.
  • Llama, Mistral, Qwen, Gemma 각각에 대한 라이선스 조건 설명.

설치 및 하드웨어 구성 방법

  • CUDA 및 ROCm 지원 기능을 갖춘 Linux 환경에서 Ollama 설치 방법.
  • GPU 없이도 CPU 기반으로 실행 가능한 방법과 AVX/AVX2 최적화에 대해서도 안내합니다.
  • Docker를 활용한 배포 방식 및 지속형 볼륨 매핑 기술 설명.
  • 멀티 GPU 환경에서의 VRAM 할당 전략 소개.

모델 관리 기술

  • Ollama 레지스트리에서 모델을 다운로드하는 방법: 예시로 ollama pull llama3 명령어 사용법.
  • HuggingFace와 TheBloke에서 제공하는 GGUF 형식의 모델 가져오기 과정.
  • Q4_K_M, Q5_K_M, Q8_0 등 각 양자화 수준의 장단점에 대한 비교.
  • 다수의 모델을 동시에 로드할 수 있는 범위와 그 제한 사항 설명.

커스텀 Modelfile 작성법

  • Modelfile 구문의 구성 요소: FROM, PARAMETER, SYSTEM, TEMPLATE 등 정리.
  • 온도 값(Temperature), top_p, 반복 제한값(Repeat Penalty) 조정 방법.
  • 특정 역할에 맞춘 시스템 프롬프트 기획 및 설계 시 고려사항.
  • 직접 작성한 커스텀 모델을 로컬 레지스트리에 등록하는 절차 안내.

API 연동 전략

  • OpenAI 호환형 /v1/chat/completions 엔드포인트 사용법 설명.
  • 실시간 응답 처리 및 JSON 형식의 출력 관리 기술.
  • LangChain, LlamaIndex 등 외부 도구와 자체 애플리케이션과 연동하는 방법.
  • 역방향 프록시를 통한 인증 체계 설정 및 요청 수 제한 정책 구성법.

성능 최적화 기법

  • 컨텍스트 창 크기 조절과 KV 캐시 관리 방안 설명.
  • 배치 인퍼런스 처리 및 여러 요청을 병렬로 수행하는 전략 소개.
  • CPU 스레드 할당 방법 및 NUMA 아키텍처와의 연계 고려사항.
  • GPU 사용률 및 메모리 부하 상태를 실시간으로 모니터링하는 방법.

보안 및 규정 준수 방안

  • 모델 제공용 엔드포인트의 네트워크 격리 전략 설명.
  • 입력값 필터링과 출력 내용에 대한 검증 체계 구성법.
  • 프롬프트와 응답 데이터를 기록하는 감사 로그 처리 과정.
  • 모델의 유래 파악 및 무결성 확인을 위한 해시 검증 절차 안내.

요건

  • Linux 및 컨테이너 관리 관련 중급 수준의 지식이 필요합니다.
  • 머신러닝 및 트랜스포머 모델에 대한 기본적인 이해가 요구됩니다.
  • REST API와 JSON에 익숙해져야 합니다.

대상 수강생

  • 클라우드 기반 LLM API를 대체하고자 하는 AI 엔지니어 및 개발자입니다.
  • 데이터 보안 문제로 인해 클라우드 모델 사용이 어려운 기업들입니다.
  • 외부 네트워크와 차단된 환경에서 언어 모델을 활용해야 하는 정부 및 방위 산업 관계자들도 포함됩니다.
 14 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리