연락처 정보

코스 개요

비전-언어 모델 개요

  • VLM의 기본 원리 및 멀티모달 AI에서의 역할
  • 주요 아키텍처: CLIP, Flamingo, BLIP 등
  • 활용 사례: 검색 시스템, 캡션 생성, 자율주행 시스템, 콘텐츠 분석 등

미세조정 환경 준비 방법

  • OpenCLIP 및 기타 VLM 라이브러리 설치 방법
  • 이미지-텍스트 쌍 형태의 데이터셋 포맷 구성
  • 시각 및 언어 입력 데이터를 전처리하는 과정

CLIP 및 유사 모델 미세조정 방법

  • 대비 손실 함수와 공동 임베딩 공간의 원리
  • 실습: 자체 데이터셋을 이용한 CLIP 미세조정 과정
  • 특정 도메인 또는 다국어 데이터 처리 방안

고급 미세조정 기법

  • 효율성 증진을 위한 LoRA 및 어댑터 기반 최적화 방법
  • 프롬프트 튜닝 및 시각 프롬프트 적용 기술
  • 제로샷 방식과 미세조정 후 평가 결과 간의 차이점 비교

평가 및 성능 측정 방법

  • VLM 평가 지표: 검색 정확도, BLEU, CIDEr, 재현률 등
  • 시각-텍스트 간 상호연관성 분석 기법
  • 임베딩 공간의 시각화 및 오분류 사례 분석 방법

실제 활용을 위한 배포 전략

  • TorchScript, ONNX 등을 이용한 모델 인퍼런스 내보내기 방법
  • VLM 모델을 기존 시스템 파이프라인이나 API와 연동하는 방식
  • 자원 활용 효율성 및 모델 확장 전략 고려사항

실제 사례 분석 및 응용 시나리오

  • 미디어 콘텐츠 분석 및 필터링 적용 사례
  • 전자상거래 및 디지털 라이브러리 내 검색 시스템 구현 예시
  • 로봇 공학 및 자율주행 시스템에서의 멀티모달 상호작용 응용 방안

요약 및 향후 발전 방향 제시

요건

  • 비전 및 자연어 처리를 위한 딥러닝 지식
  • PyTorch 및 트랜스포머 기반 모델 활용 경험
  • 멀티모달 모델 아키텍처에 대한 이해

대상 수강생

  • 컴퓨터 비전 엔지니어
  • AI 개발자
 14 시간

참가자 수


참가자별 가격

예정된 코스

관련 카테고리