prismBETA
← 개발자 브리핑
2026-08-24 · 05 / 07

Gemini 3.5 Transcribe API 공개, WER 2.6%

Google이 실시간·녹음 음성을 정제된 텍스트로 바꾸는 Gemini 3.5 Transcribe를 Gemini API로 공개함. 스트리밍 WER 4.0%, 비스트리밍 2.6%이며 필러 제거·자기수정 처리·자동 서식·맞춤 어휘·화자 분리·단어 단위 타임스탬프를 지원함. 실시간은 Live API(gemini-3.5-transcribe-live), 녹음은 Interactions API(gemini-3.5-transcribe)로 나뉘고, 함수 호출로 이미지 생성·파일 분석 같은 작업을 다른 Gemini 모델에 위임할 수 있음.

기존 음성 인식 모델은 배경 소음, 복잡한 전문 용어, 말더듬 정리에서 약했다. Gemini 3.5 Transcribe는 원시 오디오를 바로 정확하고 서식이 잡힌 텍스트로 바꾸며, "화요일에—아니 수요일에 만나자" 같은 자기수정과 '음/어' 필러 제거, 우편번호·주문 ID 같은 영숫자 개체 인식을 처리한다.

개발 워크플로에는 두 API로 들어온다. 실시간 양방향 스트리밍은 Live API의 gemini-3.5-transcribe-live로 1초 미만 지연을, 녹음·회의·콜 로그 처리는 Interactions API의 gemini-3.5-transcribe로 화자 분리와 단어 단위 타임스탬프를 제공한다. Artificial Analysis 측정 기준 평균 WER은 스트리밍 4.0%, 비스트리밍 2.6%다. 함수 호출로 복잡한 작업을 다른 Gemini 모델에 위임할 수 있어(현재 macOS 앱), 음성 에이전트·실시간 자막·통화 후 분석 파이프라인에 그대로 꽂을 수 있다.

투표
음성-텍스트, 실무에 붙여봤어요?
이 글이 도움이 되셨나요?
매주 월요일 아침 갱신 · 요약은 AI가 생성하며 출처 원문을 확인하세요.