연락처 정보

코스 개요

멀티모달 AI와 Ollama 개요

  • 멀티모달 학습의 기본 개념 설명
  • 시각-언어 통합에서 발생하는 주요 과제들
  • Ollama의 기능 및 아키텍처 소개

Ollama 환경 설정 방법

  • Ollama 설치 및 구성 절차 안내
  • 로컬 모델 배포 방식에 대한 실습
  • Python 및 Jupyter와 Ollama의 연동 방법

멀티모달 입력 데이터 다루기

  • 텍스트와 이미지의 통합 처리
  • 오디오 및 구조화된 데이터 추가 활용
  • 전처리 파이프라인 설계 전략

문서 이해 애플리케이션 개발

  • PDF 및 이미지로부터 구조화된 정보 추출 방법
  • OCR 기술과 언어 모델의 결합 방식
  • 지능형 문서 분석 시스템 구축 절차

시각적 질의응답(VQA) 기술

  • VQA 데이터셋 및 평가 기준 활용법
  • 멀티모달 모델의 학습 및 성능 검증 절차
  • 인터랙티브 VQA 애플리케이션 개발 실무

멀티모달 에이전트 설계법

  • 여러 모달리티에서 추론이 가능한 에이전트의 설계 원칙
  • 지각, 언어 처리 및 행동 결정 기능의 통합 접근법
  • 실제 현장 적용을 위한 에이전트 배포 전략

고급 통합 및 최적화 기법

  • Ollama를 활용한 멀티모달 모델 미세 조정 기술
  • 추론 속도 향상을 위한 최적화 전략
  • 시스템 확장성 및 배포 시 고려사항 정리

요약 및 향후 학습 방향 안내

요건

  • 머신러닝 개념에 대한 탄탄한 이해
  • PyTorch 또는 TensorFlow와 같은 딥러닝 프레임워크 활용 경험
  • 자연어 처리 및 컴퓨터 비전 분야에 대한 기본 지식

대상 수강생

  • 머신러닝 엔지니어
  • AI 연구자
  • 시각 정보 및 텍스트 처리 워크플로우를 통합하고자 하는 제품 개발자
 21 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리