Accelerating GPT-5.6 Sol Ultrafast
개요
Cerebras와 OpenAI는 GPU 대비 데이터 이동 병목 현상을 개선한 Cerebras의 Wafer-Scale Engine 아키텍처를 기반으로 GPT-5.6 Sol 모델을 초고속으로 구동하는 새로운 서비스 티어인 Ultrafast Mode를 공개했다.
주요 내용
* Ultrafast Mode의 성능: GPT-5.6 Sol은 Ultrafast 모드에서 초당 최대 750개의 출력 토큰을 생성하며, 품질 저하 없이 기존 모델 대비 획기적인 속도 향상을 제공한다.
* 기존 모델과의 비교: Ultrafast 모드의 GPT-5.6 Sol은 Fable 5 대비 11배, Opus 4.8 (Fast mode) 대비 5배 빠른 속도를 보여준다.
* Humanity's Last Exam (HLE) 벤치마크: HLE 벤치마크에서 GPT-5.6 Sol Ultrafast는 11시간 11분 만에 2,500개의 모든 질문에 답했으며, Claude Fable 5는 동일한 결과를 얻기 위해 78시간 27분이 소요되어 약 7배 빠른 속도와 유사한 정확도를 달성했다.
* GDP-Val 벤치마크: 경제적으로 가치 있는 지식 노동 작업 성능을 평가하는 GDP-Val 벤치마크에서 Ultrafast는 품질 저하 없이 5.6배의 엔드투엔드 속도 향상을 보였다.
* 고위험 작업에서의 활용: Ultrafast는 실시간 정보 대응이 중요한 웹 서비스 운영, 사이버 공격 탐지 및 대응 등 높은 집중과 빠른 반응이 요구되는 작업에 유용하다.
* Cerebras Wafer-Scale Engine 아키텍처: GPU의 메모리 대역폭 병목 현상을 해결하기 위해 44GB의 SRAM을 칩에 내장하여 모델 가중치를 칩 내부에 유지하고, 모델 레이어 간의 토큰 흐름을 중단 없이 처리하는 방식으로 설계되었다.
* 현재 제공 상태: GPT-5.6 Sol Ultrafast 모드는 현재 제한된 고객 그룹을 대상으로 프리뷰 형태로 제공되며, 용량 증가에 따라 접근 권한이 확대될 예정이다.
시사점
Ultrafast Mode는 AI 모델의 지능과 속도 사이의 상충 관계를 해결하여, 시간 민감도가 높은 업무 및 실시간 대응이 필요한 애플리케이션에서 AI의 활용 범위를 크게 확장하고 생산성을 향상시킬 잠재력을 지닌다.
댓글
GitHub Discussions