GPT‑Live

개요

GPT‑Live는 AI와의 대화를 실제 대화와 더 유사하게 만드는 차세대 음성 모델로, 기존의 순차적 또는 턴 기반 방식에서 벗어나 동시 양방향 통신을 가능하게 합니다.

주요 내용

* 풀-듀플렉스 아키텍처: GPT‑Live는 동시에 듣고 말할 수 있는 풀-듀플렉스 아키텍처를 기반으로 하여 "음", "네"와 같은 반응으로 주의를 기울이고, 빠른 주고받기, 또는 사용자가 생각할 시간을 가질 때 조용히 머무르는 등 더 자연스러운 대화 흐름을 제공합니다.
* 첨단 모델 위임: 웹 검색, 심층 추론, 복잡한 작업이 필요한 질문의 경우, GPT‑Live는 백그라운드에서 최신 프론티어 모델(출시 시 GPT-5.5)에 위임하고 준비가 되면 대화로 결과를 가져옵니다. 이 과정에서도 GPT‑Live는 대화를 유지할 수 있습니다.
* 기존 음성 AI의 한계 극복:
* 캐스케이딩 음성 시스템: 여러 모델이 순차적으로 작동하여 정보 손실, 느리고 부자연스러운 응답이 발생했습니다.
* 턴 기반 모델: 단일 모델 내에서 오디오를 처리하고 생성하여 지연 시간을 줄였지만, 여전히 사용자가 말하기를 멈출 때까지 기다려야 하는 경직된 상호작용이 발생했습니다.
* GPT‑Live의 두 가지 주요 아키텍처 변경:
* 지속적인 상호작용: 입력 처리를 출력 생성과 동시에 수행하여 초당 여러 번의 상호작용 결정을 내릴 수 있게 하여, 더 자연스러운 주고받기, 시간 감각 유지, 실시간 번역 기능을 지원합니다.
* 더 깊은 작업으로부터의 분리: GPT‑Live는 지속적인 상호작용을 담당하고, 검색, 추론, 에이전트 기능이 필요한 작업은 GPT-5.5와 같은 다른 모델에 위임하여 대화 흐름을 유지하면서 백그라운드에서 여러 작업을 처리합니다.
* 성능 향상: GPT‑Live‑1 및 GPT‑Live‑1 mini는 GPQA(과학적 추론), BrowseComp(웹 검색), τ³-Voice Telecom(통신 지원) 등의 평가에서 기존 Advanced Voice Mode 대비 선호도, 대화 흐름, 자연스러움 측면에서 통계적으로 유의미한 우위를 보였습니다.
* ChatGPT 경험 개선: GPT‑Live를 통해 ChatGPT 음성 경험이 더욱 지능적이고 자연스러워졌으며, 사용자는 대화를 끊거나, 잠시 멈추거나, AI에게 더 느리게 말하도록 요청할 수 있습니다. 또한, 날씨, 주식 등 시각적 정보를 제공하는 기능도 추가되었습니다.
* 안전성 및 개인 정보 보호: GPT‑Live는 최신 모델의 안전성 발전을 기반으로 하며, 음성에 특화된 전용 안전 훈련과 새로운 안전 장치를 추가했습니다. 특히 자해, 정신 건강, 폭력, 성적 콘텐츠 등 위험 영역에 대한 평가를 강화했으며, 실시간 음성 대화 중에도 안전 장치가 작동하여 위험한 출력을 감지하면 더 안전한 응답으로 유도하거나 대화를 종료할 수 있습니다. 십대 사용자 보호를 위한 추가 보호 기능도 포함되었습니다.
* 배포 및 언어 지원: GPT‑Live는 현재 전 세계 ChatGPT 사용자에게 iOS, Android, ChatGPT.com을 통해 점진적으로 출시되고 있습니다. GPT‑Live‑1은 Go, Plus, Pro 사용자에게 기본으로 제공되며, GPT‑Live‑1 mini는 무료 사용자에게 기본으로 제공됩니다. 일부 언어에서는 비원어민 억양이나 유창성 부족이 있을 수 있으며, 지속적으로 개선 중입니다.

시사점

GPT‑Live는 AI와의 상호작용을 실시간으로 자연스럽고 반응성이 뛰어난 대화로 전환하며, 복잡한 작업 처리를 백그라운드에서 원활하게 수행하는 미래의 진정한 인간-AI 협업을 가능하게 할 잠재력을 가지고 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions