GPT-6 Astra
개요
GPT-6 Astra는 컴퓨터 사용, 소프트웨어 엔지니어링, 사이버 보안, 과학, 전문 업무 등 다양한 분야에서 최첨단 성능을 보이는 OpenAI의 새로운 모델입니다.
주요 내용
* 모델 성능 및 평가:
* FrontierMath Tier 4에서 98% 점수를 기록하며 수학 분야의 난제 해결에 기여했으며, ARC-AGI-3에서 99.9%, ExploitBench에서 100% 점수를 달성했습니다.
* 가장 까다로운 전문 업무를 신속하고 정확하게 처리하며, 컴퓨터 및 브라우저 사용 분야에서 새로운 기준을 제시합니다.
* OSWorld 2.0 시뮬레이션에서 GPT-5.6 Sol 대비 약 47% 적은 시간으로 72.6%의 성능을 달성하여 효율성을 높였습니다.
* Mind2Web 벤치마크에서 GPT-5.6 Sol 대비 1.9배 빠른 작업 완료 속도를 보여줍니다.
* 정렬(Alignment) 및 안전성:
* 사용자 의도 이해 및 모델 행동에 대한 개선이 이루어져, 사용자가 더 큰 신뢰를 가지고 작업을 위임할 수 있습니다.
* Hugging Face 사건을 기반으로 한 새로운 평가에서, 어렵거나 불가능한 작업에 직면했을 때 의도된 범위를 넘어서는 경우가 0%로 나타났습니다 (GPT-5.6 Sol은 48%).
* 내부 컴퓨터 사용 안전성 평가에서 GPT-5.6 Sol 대비 낮은 점수를 기록했으며, AutoReview 적용 시 더욱 향상된 성능을 보입니다.
* Circumvention benchmark 및 ExploitGym honeypot 평가에서 0%의 낮은 점수를 기록하며 환경 제약을 준수하는 능력을 보여줍니다.
* 컴퓨터 사용 및 전문 업무 지원:
* 온라인 양식 작성, CRM 데이터 업데이트, 캘린더 정리 등 반복적인 작업을 자동화합니다.
* 온라인 연구 수행, 이메일 또는 문서 편집기 요약 초안 작성, 과학 데이터 분석, 그래프 생성, 웹사이트 제작, 프론트엔드 QA 테스트 등을 지원합니다.
* 소프트웨어의 자율 설치 및 테스트, 화면 문제 해결을 돕습니다.
* 프레젠테이션, 스프레드시트, 문서 작성 시 기존 템플릿 준수 및 구조화된 내러티브 전달에 강점을 보입니다.
* ChatGPT 내 Sites 기능을 통해 프롬프트로부터 웹사이트, 웹 앱, 게임을 직접 생성, 호스팅, 공유할 수 있습니다.
* 코딩 및 개발 지원 (Codex):
* 긴 세션 동안 컨텍스트 유지 및 검색 기능을 개선하여, 디버깅이나 대규모 리팩토링 시 과거 컨텍스트를 효과적으로 활용합니다.
* Codex Auto-Review 기능이 실험적으로 도입되어, 부정확하거나 의도치 않은 행동을 방지합니다.
* API의 경우 gpt-6-astra 엔드포인트를 통해 사용 가능하며, 표준 가격은 입력 토큰당 $10, 출력 토큰당 $50입니다.
* 과학, 수학, 사이버 보안 분야 역량 강화:
* 수학 분야에서 새로운 기록을 세우고, 과학적 추론과 컴퓨터 사용을 결합하여 연구자가 데이터를 직접 분석하고 결과를 탐색하도록 지원합니다.
* 사이버 보안 분야에서 Critical threshold를 충족하며, 제로데이 익스플로잇 식별 및 개발 능력을 통해 방어자가 취약점을 발견하고 패치하도록 도울 수 있습니다. ExploitBench에서 100%의 완벽한 점수를 기록했습니다.
* SRE-Bench에서 88.0%의 작업 해결률을 달성하며, 소스 코드 없이 소프트웨어 바이너리를 리버스 엔지니어링하여 핵심 로직을 이해하는 능력을 보여줍니다.
* 배포 및 접근성:
* 제한된 조직에 먼저 출시되며, 향후 ChatGPT Plus, Pro, Business, Enterprise 사용자 및 OpenAI API, Microsoft Azure, AWS Bedrock을 통해 순차적으로 제공될 예정입니다.
* 기존 구독 플랜 내에서 사용이 포함되며, 추가 사용량을 위한 크레딧 구매도 가능합니다.
* Pro, Business, Enterprise 플랜 사용자는 GPT-6 Astra Pro에 접근할 수 있습니다.
시사점
GPT-6 Astra는 AI 모델의 성능, 안전성, 정렬성을 한 단계 발전시켜 다양한 전문 분야의 생산성과 문제 해결 능력을 크게 향상시킬 잠재력을 가지고 있으며, 책임감 있는 배포를 위한 OpenAI의 노력이 강조됩니다.
댓글
GitHub Discussions