ARC-AGI Leaderboard

개요

ARC-AGI Leaderboard는 AI 에이전트가 새로운 환경에 즉각적으로 적응하는 능력을 측정하는 ARC-AGI-3를 중심으로, 성능과 비용 효율성 간의 관계를 시각화한다.

주요 내용

  • ARC-AGI의 진화: 초기 버전(ARC-AGI-1, ARC-AGI-2)은 수동적 유동 지능을 측정했으나, ARC-AGI-3는 AI 에이전트가 실시간으로 새로운 상호작용 환경에 적응하는 능력을 평가한다.
  • 성능과 비용 효율성: 산점도는 작업당 비용(cost-per-task)과 성능 간의 관계를 보여주며, 효율성은 문제 해결 능력뿐만 아니라 최소 자원으로 효율적으로 해결하는 능력임을 강조한다.
  • 데이터 해석:
  • Reasoning Systems Trend Line: 동일한 모델이 다양한 추론 수준에서 어떻게 성능을 개선하는지 보여주며, 추론 시간 증가에 따른 성능의 점근적 행동 변화를 나타낸다.
  • Base LLMs: GPT-4.5, Claude 3.7 등 표준 언어 모델의 단일 추론 성능을 나타내며, 추가적인 추론 강화 없이 모델의 원시 성능을 보여준다.
  • Kaggle Systems: Kaggle 챌린지의 경쟁 등급 제출 결과로, 120개 평가 작업에 대해 5달러의 컴퓨팅 예산과 같은 엄격한 제약 조건 하에서 운영되며, ARC Prize를 위해 특별히 설계된 효율적인 방법을 나타낸다.
  • 검증 정책: 상세한 테스트 정책에 따라 검증이 이루어진다.
  • 리더보드 정보:
  • 실행에 10,000달러 미만이 소요된 시스템만 표시된다.
  • 전체 테스트 출력을 생성하지 못한 모델의 남은 작업은 잘못된 것으로 표시된다.
  • "preview"로 표시된 결과는 비공식이며 불완전한 테스트에 기반할 수 있다.
  • ARC-AGI-2 점수는 부분 테스트 결과 및 o1-pro 가격을 기반으로 추정되었다.
  • Gemini 3 Pro 가격을 기반으로 잠정 비용이 추정되었으며, 모델 출시 후 재테스트될 예정이다.

시사점

ARC-AGI Leaderboard는 AI 에이전트의 문제 해결 능력과 더불어 실제 환경에서의 효율성 및 비용 최적화 능력을 평가하는 중요한 지표를 제공한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions