OpenAI releases new voice models for more natural live conversations

개요

OpenAI가 발표한 GPT-Live-1 및 GPT-Live-1 mini는 기존 모델 대비 자연스러운 대화와 향상된 턴 테이킹 능력을 특징으로 하는 새로운 대화형 음성 모델이다.

주요 내용

  • GPT-Live-1 및 GPT-Live-1 mini 출시: 실시간 대화처럼 자연스러운 음성 경험을 제공하며, 사용자의 자연스러운 끼어들기를 가능하게 하는 풀-듀플렉스(full-duplex) 모델이다.
  • 향상된 기능: 이전 모델의 음성-텍스트 변환, 대규모 언어 모델 응답 생성, 텍스트-음성 변환 단계를 통합하여 응답 지연 및 사용자 말 끊김 문제를 해결했다.
  • 최신 텍스트 모델 연동: GPT-5.5와 같은 최신 텍스트 모델과 연동하여 검색, 추론, 에이전트(agentic) 기능 수행 중에도 대화를 지속할 수 있다.
  • 시각적 정보 제공 가능: 최신 GPT 모델 접근성을 바탕으로 대화 맥락을 파악하여 일부 정보를 시각적 형식으로 제시할 수 있다.
  • 긴 대화 지원: 30~40분 이상의 긴 대화가 가능하도록 설계되었으며, 음성을 복잡한 업무를 위한 주 인터페이스로 발전시킬 잠재력을 가진다.
  • 안전 기능 강화: 10대 사용자에게 나이 적합한 응답을 제공하고, 자해 관련 대화 시 관련 정보를 제공하는 등 안전 장치가 포함되어 있다.
  • 다국어 지원 및 개선 필요성: "대부분의 사용 언어"에 최적화되었으나, 실제 데모에서는 힌디어 실시간 번역 시 다소 부자연스러운 억양과 톤이 관찰되었다.
  • ChatGPT 유료 플랜 적용: GPT-Live-1 mini는 ChatGPT의 기본 음성 모드로 대체되며, GPT-Live-1은 유료 플랜 사용자에게 제공된다.

시사점

OpenAI의 새로운 음성 모델은 AI와의 상호작용을 더욱 자연스럽고 능동적으로 만들어, 장기적으로 복잡한 업무 수행을 위한 음성 인터페이스의 가능성을 확장시킨다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions