문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
Gemini 3의 멀티모달 기능 소개
- 텍스트, 이미지, 음성, 영상 처리 능력 설명
- 모델 선택 방법 및 각 엔드포인트의 특징 설명
- 멀티모달 추론을 위한 핵심 개념 소개
텍스트 및 구조화된 입력값 다루기
- 텍스트 생성 시 유용한 프롬프트 활용 전략
- 메타데이터, 컨텍스트 창 및 임베딩 기법 설명
- 텍스트를 기반으로 한 멀티모달 작업의 조율 방법
이미지 이해 및 시각적 워크플로우 구축
- Gemini 3을 활용한 이미지 분석 및 해석 방법
- 시각적 검색 기능 및 태깅 도구 개발 기법
- 이미지-텍스트 간 상호작용을 구현하는 방법
음성 입력 처리 기법
- 음성 인식 및 전사 작업 수행 방식
- 오디오 이벤트 감지 및 해석 기술
- 텍스트 및 시각 데이터와 음성 정보를 통합하는 방법
영상 분석 및 장면 인식 기법
- 프레임 단위 및 연속적인 영상 데이터 해석 방법
- 요약본 생성 및 주요 장면 추출 도구 개발 기법
- 영상 기반 자동화 시스템 및 콘텐츠 처리 워크플로우 구축 방법
멀티모달 애플리케이션 아키텍처 설계
- 다양한 입력 데이터 유형을 하나의 파이프라인에 통합하는 방안
- 지연 시간, 비용 및 컴퓨팅 자원 측면에서의 고려사항
- 확장 가능한 멀티모달 시스템 구축을 위한 모범 사례
멀티모달 프로토타입 개발 실습
- 멀티모달 기능을 갖춘 프로토타입을 직접 제작해보는 과정
- 프롬프트 엔지니어링을 통한 빠른 반복 개발 기법
- 사용자 경험 흐름을 점검하고 개선하는 방법
멀티모달 솔루션 배포 전략
- 배포 방안 및 환경 설정 절차
- 실제 운영 환경에서의 성능 모니터링 방법
- 보안 및 규제 준수를 위한 주요 고려사항
요약 및 향후 발전 방향 안내
요건
- 최신 AI 개념에 대한 이해
- Python 또는 JavaScript 활용 경험
- REST API 사용법에 대한 기본 지식
수강 대상
- 디자이너
- 콘텐츠 제작자
- 기술 기반 제품 개발팀 구성원
14 시간
회원 평가 (1)
프레젠테이션에서의 흐름, 분위기 및 주제
Lukasz Kowalczyk - Allegro Sp. z o.o.
코스 - Google Gemini AI for Data Analysis
기계 번역됨