문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
기간 14 시간
코스 개요
Gemini 3의 멀티모달성 소개
- 텍스트, 이미지, 오디오, 비디오에 걸친 기능
- 모델 선택 및 엔드포인트 개요
- 멀티모달 추론의 핵심 개념
텍스트 및 구조화된 입력 작업
- 텍스트 생성을 위한 프롬프팅 전략
- 메타데이터, 컨텍스트 윈도우 및 임베딩
- 텍스트 기반 멀티모달 태스크 오케스트레이션
이미지 이해 및 시각적 워크플로우
- Gemini 3를 활용한 이미지 분석 및 해석
- 시각 검색 및 태그 도구 제작
- 이미지-텍스트 및 텍스트-이미지 상호작용 구축
오디오 입력 처리
- 음성 인식 및 전사 워크플로우
- 오디오 이벤트 감지 및 해석
- 오디오를 텍스트 및 시각 입력과 통합하기
비디오 인텔리전스 및 장면 분석
- 프레임 단위 및 연속 비디오 추론
- 요약 및 하이라이트 추출 도구 제작
- 비디오 기반 자동화 및 콘텐츠 워크플로우
멀티모달 애플리케이션 아키텍처 설계
- 단일 파이프라인에서 여러 입력 유형 결합
- 레이턴시, 비용 및 컴퓨트 고려사항
- 확장 가능한 멀티모달 시스템에 대한 모범 사례
멀티모달 애플리케이션 프로토타이핑
- 멀티모달 프로토타입 손소리는 제작
- 프롬프트 엔지니어링을 통한 빠른 반복
- 사용자 경험 플로우 테스트 및 개선
멀티모달 솔루션 배포
- 배포 전략 및 환경 설정
- 실전 성능 모니터링
- 보안 및 컴플라이언스 고려사항
요약 및 다음 단계
요건
- 최신 AI 개념에 대한 이해
- Python 또는 JavaScript 경험
- REST API에 대한 숙지
대상 독자
- 디자이너
- 콘텐츠 크리에이터
- 기술 제품 팀
회원 평가 (1)
프레젠테이션에서의 흐름, 분위기 및 주제
Lukasz Kowalczyk - Allegro Sp. z o.o.
코스 - Google Gemini AI for Data Analysis
기계 번역됨