What's the largest software project AI can complete on its own?
개요
MirrorCode는 AI 모델이 원본 소스 코드 없이 전체 프로그램을 처음부터 끝까지 재구현하는 장기 코딩 과제를 테스트하기 위해 METR와 공동 개발된 벤치마크입니다.
주요 내용
- MirrorCode는 25개의 다양한 컴퓨팅 영역(Unix 유틸리티, 데이터 직렬화 및 쿼리 도구, 생물정보학, 인터프리터, 정적 분석, 암호화, 압축)을 아우르는 목표 프로그램을 포함합니다.
- 기존 벤치마크와 달리, MirrorCode는 AI 모델이 상당한 컴퓨팅 자원을 사용할 수 있도록 충분한 추론 예산을 제공하며, 일부 작업은 인간이 완료하는 데 몇 주가 걸리는 반면 AI는 며칠 또는 몇 시간 내에 완료할 수 있습니다.
- AI 모델은 인터넷 접근, 원본 코드베이스 접근, 부정행위 방지를 위한 샌드박스 환경에서 작업하며, 개발 중에 볼 수 없는 엔드투엔드 테스트를 통과해야 합니다.
- Claude Opus 4.7은 약 16,000줄의 Go 코드와 40개 이상의 명령으로 구성된 생물정보학 툴킷인 gotree를 14시간 만에 재구현했으며, 이는 인간에게 2-17주가 소요될 작업입니다.
- 데이터 오염 가능성(AI 모델이 사전 훈련 중에 원본 코드를 본 경우)이 존재하지만, MirrorCode는 일부 기억 상실 스크린을 통과한 프로그램은 성공적으로 재구현했으며, 기억 상실 증거를 보인 프로그램은 재구현에 실패했습니다.
- MirrorCode 리더보드는 중간(Medium) 및 대형(Large) 버킷의 15개 목표 프로그램을 두 가지 구현 언어로 평가하며, 각 시도당 100억 토큰의 예산이 할당됩니다.
- MirrorCode 벤치마크와 25개의 목표 프로그램 중 22개가 오픈 소스로 공개되어 있으며, 나머지 3개는 비공개 테스트 세트로 유지됩니다.
시사점
MirrorCode는 AI 모델이 복잡한 장기 코딩 과제를 어느 정도 수행할 수 있음을 보여주지만, 데이터 오염 가능성과 완벽한 100% 완료율에 대한 지속적인 도전 과제를 남깁니다.
원문을 불러오는 중...
댓글
GitHub Discussions