Nvidia just showed that the harness, not the AI model, is now the real hero
개요
Nvidia의 새로운 연구는 AI 모델 자체보다 AI 모델을 감싸는 소프트웨어인 '하네스(harness)'가 장기 작업 수행에 더 중요함을 시사합니다.
주요 내용
- 하네스의 중요성: AI 모델을 특정 작업을 수행하는 에이전트(agent)로 만들기 위해서는 모델 자체뿐만 아니라 도구, 메모리 관리, 규칙 등을 포함하는 하네스가 핵심적인 역할을 합니다.
- ARC-AGI-3 벤치마크 성능 향상: Nvidia 연구팀은 메모리 관리가 잘 되고 '감독관(supervisor)' 컴포넌트가 포함된 커스텀 하네스를 사용하여 Claude Opus 5 모델이 복잡한 추론 벤치마크인 ARC-AGI-3에서 100%의 점수를 달성했습니다. 이는 하네스 없이 같은 모델을 사용했을 때의 30% 점수와 대조됩니다.
- 하네스의 구성 요소: 에이전트 시스템은 모델, 모델을 감싸는 하네스, 그리고 모델이 접근하는 도구, 런타임, 라이브러리로 구성됩니다.
- 장기 작업 수행의 어려움: AI가 여러 결정을 연속적으로 내려야 하는 장기 작업은 방해받지 않고 목표를 달성하는 것이 중요하며, 모델이 길을 잃거나 오류를 생성하는 경우가 많습니다.
- 감독관 컴포넌트의 역할: 감독관 에이전트는 주요 에이전트가 잘못된 방향으로 가거나 이미 탐색한 경로를 다시 탐색할 때 이를 바로잡아주는 역할을 합니다.
- 오픈 하네스의 장점: 오픈 하네스는 사용자가 정확도를 높이기 위해 더 많은 설정을 제어할 수 있도록 하여 AI 에이전트 시스템에 대한 통제권을 강화합니다.
시사점
AI 에이전트 시스템의 성능을 최적화하기 위해서는 AI 모델 자체의 선택뿐만 아니라, 메모리 관리, 도구 통합, 감독 기능 등을 포함하는 하네스의 설계와 구현이 결정적으로 중요하며, 오픈 하네스는 AI 에이전트 생태계의 발전과 보안 강화에 기여할 수 있습니다.
원문을 불러오는 중...
댓글
GitHub Discussions