Gemini-3.5-Transcribe

개요

Gemini 3.5 Transcribe는 실시간 음성 대화의 정확하고 지능적인 트랜스크립션을 위해 설계된 Google의 최신 음성-텍스트 변환 모델입니다.

주요 내용

* 정확성 및 지능형 처리: 배경 소음, 전문 용어, 발화 끊김 등 기존 모델의 한계를 극복하고, 자연스러운 음성 스타일을 캡처하여 의도를 더 잘 이해하고 사용자 지정 어휘를 인식합니다.
* 실시간 스트리밍 및 사전 녹음 처리:
* Live API (gemini-3.5-transcribe-live): 서브세컨드 레이턴시를 갖춘 지속적이고 양방향 스트리밍을 통해 상호작용적인 음성 애플리케이션을 지원합니다.
* Interactions API (gemini-3.5-transcribe): 화자 속성 및 단어 수준 타임스탬프를 포함하여 녹음된 오디오, 회의, 통화 기록 등을 트랜스크라이브합니다.
* 스마트 트랜스크립션 기능: 자체 수정 처리, 불필요한 간투사 제거, 자동 텍스트 서식 지정 등을 수행합니다.
* Function Calling: 이미지 생성, 파일 분석 등 복잡한 작업을 다른 Gemini 모델에 위임할 수 있습니다.
* 향상된 정확도 지표: Artificial Analysis 기준 스트리밍 4.0%, 비스트리밍 2.6%의 평균 단어 오류율(WER)을 기록하며, 노이즈가 많은 실제 환경에서도 우수한 성능을 보입니다. FLEURS 벤치마크에서도 스트리밍 모드 5.50%, 비스트리밍 모드 5.04%의 WER을 달성했습니다.
* 사용자 지정 어휘 및 다국어 지원: 특수 전문 용어와 고유 철자를 인식하며, 85개 이상의 언어를 자동으로 감지하고 지역 억양 및 방언을 처리합니다.
* 다중 화자 식별: 최대 3명의 화자 음성을 타임스탬프와 함께 정확하게 속성 할당합니다 (3명 초과 지원은 실험적).
* 다양한 제품 및 플랫폼 통합: Gemini 앱, Android의 Rambler 기능, Google AI Studio, Gemini Enterprise Agent Platform 등에서 활용 가능하며, Gboard, Antigravity, Chrome 등에서도 점진적으로 지원될 예정입니다.
* 개발자 지원: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel 등 다양한 개발자 플랫폼과 연동되어 고성능 음성 기반 인터페이스 구축을 지원합니다.

시사점

Gemini 3.5 Transcribe는 개발자와 최종 사용자 모두에게 더욱 자연스럽고 직관적인 음성 인터페이스 경험을 제공하며, 다양한 애플리케이션 및 워크플로우에서 음성 기반 상호작용의 정확성과 효율성을 크게 향상시킬 것으로 기대됩니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions