연락처 정보
 기간 14 시간

코스 개요

음성 인식 기술 개요

  • 음성 인식의 역사와 발전 과정
  • 음향 모델, 언어 모델 및 디코딩
  • 최신 아키텍처: RNN, 트랜스포머 및 Whisper

오디오 전처리 및 전사 기초

  • 오디오 형식 및 샘플레이트 처리
  • 오디오 클리닝, 트리밍 및 분할
  • 오디오에서 텍스트 생성: 실시간 vs 배치

Whisper 및 기타 API 실습

  • OpenAI Whisper 설치 및 사용법
  • 전사를 위한 클라우드 API(Google, Azure) 호출
  • 성능, 레이턴시 및 비용 비교

언어, 악센트 및 도메인 적응

  • 다국어 및 다양한 악센트 대응
  • 사용자 정의 어휘 및 노이즈 허용 범위 설정
  • 법률, 의료 또는 기술 관련 용어 처리

출력 포맷팅 및 통합

  • 타임스탬프, 구두점 및 화자 라벨 추가
  • 텍스트, SRT 또는 JSON 형식으로 내보내기
  • 전사 결과를 앱이나 데이터베이스에 통합

사용 사례 구현 랩

  • 회의, 인터뷰 또는 팟캐스트 전사 처리
  • 음성-텍스트 명령 시스템 구축
  • 비디오/오디오 스트림의 실시간 자막 생성

평가, 한계 및 윤리

  • 정확도 지표 및 모델 벤치마킹
  • 음성 모델의 편향 및 형평성
  • 프라이버시 및 규정 준수 사항

요약 및 향후 방향

요건

  • 일반 AI 및 머신러닝 개념에 대한 이해
  • 오디오 또는 미디어 파일 형식 및 도구 관련 지식

대상 청중

  • 음성 데이터를 다루는 데이터 사이언티스트 및 AI 엔지니어
  • 전사 기반 애플리케이션을 개발하는 소프트웨어 개발자
  • 자동화를 위해 음성 인식을 탐구하는 조직

참가자 수


참가자별 가격

예정된 코스

관련 카테고리