연락처 정보
 기간 21 시간

코스 개요

멀티모달 AI와 Ollama 소개

  • 멀티모달 학습 개요
  • 비전-언어 통합의 주요 과제
  • Ollama의 기능 및 아키텍처

Ollama 환경 설정

  • Ollama 설치 및 구성
  • 로컬 모델 배포 작업
  • Ollama의 Python 및 Jupyter 통합

멀티모달 입력 처리

  • 텍스트 및 이미지 통합
  • 오디오 및 구조화 데이터 도입
  • 전처리 파이프라인 설계

문서 이해 애플리케이션

  • PDF 및 이미지에서 구조화 정보 추출
  • OCR과 언어 모델 결합
  • 지능형 문서 분석 워크플로 구축

시각적 질의응답 (VQA)

  • VQA 데이터셋 및 벤치마크 설정
  • 멀티모달 모델 훈련 및 평가
  • 인터랙티브 VQA 애플리케이션 구축

멀티모달 에이전트 설계

  • 멀티모달 추론을 활용한 에이전트 설계 원칙
  • 인지, 언어, 행동 결합
  • 실제 사용 사례를 위한 에이전트 배포

고급 통합 및 최적화

  • Ollama을 사용한 멀티모달 모델 정밀 조정
  • 추론 성능 최적화
  • 확장성 및 배포 고려 사항

요약 및 다음 단계

요건

  • 기계 학습 개념에 대한 탄탄한 이해
  • PyTorch 또는 TensorFlow와 같은 딥러닝 프레임워크 사용 경험
  • 자연어 처리(NLP) 및 컴퓨터 비전에 대한 지식

대상 수강생

  • 기계 학습 엔지니어
  • AI 연구자
  • 비전 및 텍스트 워크플로 통합을 담당하는 제품 개발자

참가자 수


참가자별 가격

예정된 코스

관련 카테고리