Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text

개요

Google이 발표한 Gemini 3.5 Transcribe는 음성 입력 시 "음"이나 수정 사항을 편집하여 다듬어진 AI 텍스트를 출력하는 음성-텍스트 변환 AI 모델입니다.

주요 내용

  • Gemini 3.5 Transcribe는 기존의 Chirp 3 음성-텍스트 엔진보다 약 70% 더 빠르며, 음성에서 최종 전사 텍스트까지의 오류율은 5.5%로 감소했습니다. (Chirp 3의 오류율은 7.32% 측정)
  • "음", "어"와 같은 간섭음 및 말실수를 편집하고, 사용자가 자신을 수정하는 내용을 실시간으로 편집합니다.
  • 사용자 정의 어휘를 참조하여 전문 용어를 처리할 수 있습니다.
  • 85개 언어를 지원하며, 사전 녹음된 오디오에서는 최대 3명의 화자를 인식합니다.
  • AI가 발언의 요지를 정확하게 파악하는 데 의존하며, AI가 말하는 단어를 변경할 수 있다는 점은 모든 상황에 적합하지 않을 수 있습니다.

시사점

Gemini 3.5 Transcribe는 음성 입력의 효율성과 정확성을 향상시켜 Google 생태계 전반의 사용자 경험을 개선할 잠재력을 가지고 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions