GPT-5.6
개요
GPT-5.6 모델군은 플래그십 모델인 Sol, 균형 잡힌 Terra, 가장 비용 효율적인 Luna를 포함하며, 코딩, 지식 노동, 사이버 보안, 과학 등 다양한 분야에서 최첨단 성능을 달성하고 효율성을 높였다.
주요 내용
* GPT-5.6 Sol, Terra, Luna 출시:
* Sol: 지능과 효율성 모두에서 새로운 기준을 제시하며, 이전 및 경쟁 모델보다 적은 토큰과 비용으로 뛰어난 성능을 보인다.
* Terra: 일상적인 업무에 최적화된 균형 잡힌 모델로, GPT-5.5의 최고 성능에 근접하면서 비용은 절감했다.
* Luna: 가장 비용 효율적인 모델로, GPT-5.5 대비 훨씬 낮은 비용으로 유사한 성능을 제공한다.
* 성능 및 효율성 향상:
* Agents' Last Exam에서 GPT-5.6 Sol은 53.6점을 기록하며 Claude Fable 5를 크게 앞섰다.
* Artificial Analysis Intelligence Index에서 Sol은 Fable 5에 근접하는 성능을 보이면서 작업 완료 시간은 61% 단축, 비용은 절반으로 줄였다.
* 코딩 성능 측면에서 Sol은 Artificial Analysis Coding Agent Index에서 80점을 기록하며 Claude Fable 5를 능가하고, 더 적은 토큰, 시간, 비용으로 작업한다.
* 새로운 기능 및 접근 방식:
* ultra: 복잡한 작업을 더 빠르게 완료하기 위해 여러 에이전트를 병렬로 조정하는 최고 성능 설정.
* Programmatic Tool Calling: API에서 경량 프로그램을 작성 및 실행하여 도구를 조정하고 중간 결과를 처리하며, Zero Data Retention (ZDR) 호환성을 제공한다.
* Multi-agent: API의 베타 기능으로, 여러 서브 에이전트를 동시에 실행하고 결과를 종합할 수 있다.
* 디자인 및 지식 작업 능력 강화:
* GPT-5.6 Sol은 높은 수준의 지시만으로도 미적이고 기능적인 인터페이스를 생성하며, 렌더링된 결과를 검토하고 개선하는 능력이 향상되었다.
* Slack, Notion, Microsoft 365, Google Drive 등 다양한 소스에서 가져온 컨텍스트를 바탕으로 전문가 수준의 결과물을 생성한다.
* 프레젠테이션, 문서, 스프레드시트의 품질을 개선했으며, 특히 템플릿과 참조 자료를 따르는 능력이 뛰어나다.
* 사이버 보안 및 과학 연구에서의 발전:
* 사이버 보안 분야에서 GPT-5.6은 ExploitBench, ExploitGym, SEC-Bench Pro 등에서 GPT-5.5 대비 상당한 성능 향상을 보였다.
* 과학 연구 분야에서는 GeneBench Pro, LifeSciBench 등에서 Pareto 개선을 달성하며, 이전 모델보다 적은 토큰과 시간으로 더 나은 결과를 제공한다.
* AI 연구 가속화:
* 내부적으로 GPT-5.6은 연구 시스템 디버깅, 트레이닝 시스템 최적화, 실험 실행 등 AI 연구 개발 전반에 걸쳐 사용되며, 연구자당 일일 평균 출력 토큰 사용량이 GPT-5.5 대비 두 배 이상 증가했다.
* 강화된 안전 장치:
* GPT-5.6은 이전 모델보다 더 견고한 안전 시스템을 갖추고 있으며, 인간 레드팀, 자동화된 테스트, 전문가 조직과의 협력을 통해 광범위한 평가를 거쳤다.
* 모델에 내장된 보호 기능과 실시간 검사, 모니터링, 액세스 제어를 결합하여 합법적인 작업을 광범위하게 제한하지 않으면서 악의적인 사용에 대한 복원력을 강화했다.
* 사이버 보안 및 생물학 분야에서 유해한 위협을 생성할 정도의 능력을 넘어서는 것으로 평가되었으며, 민감한 기능은 검증된 사용자에게만 제공된다.
* 접근성 및 가격:
* GPT-5.6 모델군은 ChatGPT, Codex, OpenAI API를 통해 제공된다.
* 가격은 모델별로 다르며, Sol이 가장 고가이고 Luna가 가장 저렴하다.
* API는 토큰당 가격으로 책정되며, Sol은 입력 5달러/출력 30달러, Terra는 입력 2.50달러/출력 15달러, Luna는 입력 1달러/출력 6달러이다.
시사점
GPT-5.6 모델군의 출시는 AI 기술의 성능, 효율성, 안전성 측면에서 상당한 발전을 이루었음을 보여주며, 다양한 산업 분야에 걸쳐 AI의 적용 범위를 넓히고 실질적인 가치를 창출할 수 있는 잠재력을 시사한다.
댓글
GitHub Discussions