How a Strands agent took Claude Opus 5 from 30% to 99.95% on ARC-AGI-3

개요

AWS 엔지니어들이 Claude Opus 5 모델과 Strands Agents SDK를 활용하여 ARC-AGI-3 벤치마크에서 99.95%의 RHAE(Relative Human Action Efficiency)를 달성하며 183개 레벨을 모두 완료했다.

주요 내용

* ARC-AGI-3는 AI 시스템이 규칙이나 목표 없이 익숙하지 않은 환경에서 스스로 학습하고 문제를 해결하는 능력을 평가하는 벤치마크이다.
* Claude Opus 5 모델 자체는 ARC-AGI-3에서 30.16%의 성능을 보였으나, Strands 에이전트 하네스 시스템을 통해 Claude Opus 5를 활용한 결과 99.95% RHAE를 달성했다.
* Strands 에이전트 하네스는 에이전트에게 시스템 프롬프트에 초기 게임 지식 없이, 일반적인 레이블(ACTION1, ACTION2, ACTION3)로 제어 기능만 제공한다.
* 에이전트는 게임 로그를 통해 보드를 검사하고, 파일 작업(읽기, 쓰기, 편집), grep, regex, Python 실행 등의 도구를 사용하여 환경을 이해하고 전략을 개발한다.
* 에이전트의 모든 상호작용 기록은 파일 로그에 저장되며, 이를 통해 에이전트는 자체적으로 컨텍스트 엔지니어링을 수행하고 유용한 정보를 추출한다.
* PRO-LONG 연구 결과를 바탕으로 에이전트에게 Python 실행 권한을 부여하는 것이 성능 향상에 큰 영향을 미쳤다. Strands 에이전트는 734개의 자체 스크립트를 작성하여 게임 메커니즘을 분석하고 학습했다.
* RHAE는 에이전트가 게임을 해결하는 데 소요하는 액션 수를 인간의 기본값과 비교하여 학습 효율성을 측정하는 지표로, 183개 레벨 중 160개 레벨에서 인간 기본값과 같거나 더 나은 성능을 보였다.
* Strands 하네스의 코드는 오픈 소스로 공개되어 있어, 장기적인 목표를 달성하는 에이전트 시스템 설계에 대한 인사이트를 얻을 수 있다.

시사점

AI 모델의 성능은 단순히 모델 자체뿐만 아니라, 외부 기록 관리, 쿼리 도구 제공, 자체 코드 생성 능력 부여, 그리고 활성 컨텍스트 관리를 통한 에이전트 시스템의 설계에 의해 크게 향상될 수 있다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions