문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
AI 주권 및 LLM의 로컬 배포
- 클라우드 기반 LLM의 위험 요소: 데이터 보관, 입력값 활용을 통한 학습, 외국 법적 관할 문제 등.
- Ollama 아키텍처 개요: 모델 서버, 레지스트리, OpenAI 호환형 API의 구성 방식.
- vLLM, llama.cpp, Text Generation Inference와의 비교 분석.
- Llama, Mistral, Qwen, Gemma 각각에 대한 라이선스 조건 설명.
설치 및 하드웨어 구성 방법
- CUDA 및 ROCm 지원 기능을 갖춘 Linux 환경에서 Ollama 설치 방법.
- GPU 없이도 CPU 기반으로 실행 가능한 방법과 AVX/AVX2 최적화에 대해서도 안내합니다.
- Docker를 활용한 배포 방식 및 지속형 볼륨 매핑 기술 설명.
- 멀티 GPU 환경에서의 VRAM 할당 전략 소개.
모델 관리 기술
- Ollama 레지스트리에서 모델을 다운로드하는 방법: 예시로 ollama pull llama3 명령어 사용법.
- HuggingFace와 TheBloke에서 제공하는 GGUF 형식의 모델 가져오기 과정.
- Q4_K_M, Q5_K_M, Q8_0 등 각 양자화 수준의 장단점에 대한 비교.
- 다수의 모델을 동시에 로드할 수 있는 범위와 그 제한 사항 설명.
커스텀 Modelfile 작성법
- Modelfile 구문의 구성 요소: FROM, PARAMETER, SYSTEM, TEMPLATE 등 정리.
- 온도 값(Temperature), top_p, 반복 제한값(Repeat Penalty) 조정 방법.
- 특정 역할에 맞춘 시스템 프롬프트 기획 및 설계 시 고려사항.
- 직접 작성한 커스텀 모델을 로컬 레지스트리에 등록하는 절차 안내.
API 연동 전략
- OpenAI 호환형 /v1/chat/completions 엔드포인트 사용법 설명.
- 실시간 응답 처리 및 JSON 형식의 출력 관리 기술.
- LangChain, LlamaIndex 등 외부 도구와 자체 애플리케이션과 연동하는 방법.
- 역방향 프록시를 통한 인증 체계 설정 및 요청 수 제한 정책 구성법.
성능 최적화 기법
- 컨텍스트 창 크기 조절과 KV 캐시 관리 방안 설명.
- 배치 인퍼런스 처리 및 여러 요청을 병렬로 수행하는 전략 소개.
- CPU 스레드 할당 방법 및 NUMA 아키텍처와의 연계 고려사항.
- GPU 사용률 및 메모리 부하 상태를 실시간으로 모니터링하는 방법.
보안 및 규정 준수 방안
- 모델 제공용 엔드포인트의 네트워크 격리 전략 설명.
- 입력값 필터링과 출력 내용에 대한 검증 체계 구성법.
- 프롬프트와 응답 데이터를 기록하는 감사 로그 처리 과정.
- 모델의 유래 파악 및 무결성 확인을 위한 해시 검증 절차 안내.
요건
- Linux 및 컨테이너 관리 관련 중급 수준의 지식이 필요합니다.
- 머신러닝 및 트랜스포머 모델에 대한 기본적인 이해가 요구됩니다.
- REST API와 JSON에 익숙해져야 합니다.
대상 수강생
- 클라우드 기반 LLM API를 대체하고자 하는 AI 엔지니어 및 개발자입니다.
- 데이터 보안 문제로 인해 클라우드 모델 사용이 어려운 기업들입니다.
- 외부 네트워크와 차단된 환경에서 언어 모델을 활용해야 하는 정부 및 방위 산업 관계자들도 포함됩니다.
14 시간