문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
기간 21 시간
코스 개요
멀티모달 AI와 Ollama 소개
- 멀티모달 학습 개요
- 비전-언어 통합의 주요 과제
- Ollama의 기능 및 아키텍처
Ollama 환경 설정
- Ollama 설치 및 구성
- 로컬 모델 배포 작업
- Ollama의 Python 및 Jupyter 통합
멀티모달 입력 처리
- 텍스트 및 이미지 통합
- 오디오 및 구조화 데이터 도입
- 전처리 파이프라인 설계
문서 이해 애플리케이션
- PDF 및 이미지에서 구조화 정보 추출
- OCR과 언어 모델 결합
- 지능형 문서 분석 워크플로 구축
시각적 질의응답 (VQA)
- VQA 데이터셋 및 벤치마크 설정
- 멀티모달 모델 훈련 및 평가
- 인터랙티브 VQA 애플리케이션 구축
멀티모달 에이전트 설계
- 멀티모달 추론을 활용한 에이전트 설계 원칙
- 인지, 언어, 행동 결합
- 실제 사용 사례를 위한 에이전트 배포
고급 통합 및 최적화
- Ollama을 사용한 멀티모달 모델 정밀 조정
- 추론 성능 최적화
- 확장성 및 배포 고려 사항
요약 및 다음 단계
요건
- 기계 학습 개념에 대한 탄탄한 이해
- PyTorch 또는 TensorFlow와 같은 딥러닝 프레임워크 사용 경험
- 자연어 처리(NLP) 및 컴퓨터 비전에 대한 지식
대상 수강생
- 기계 학습 엔지니어
- AI 연구자
- 비전 및 텍스트 워크플로 통합을 담당하는 제품 개발자