Most Evals Measure the Wrong Thing
개요
대부분의 AI 에이전트 평가(evaluation)는 모델의 단일 작업 수행 능력을 측정하지만, 실제 복잡하고 불확실한 환경에서의 신뢰성과 문제 해결 능력을 제대로 측정하지 못하고 있습니다.
주요 내용
* 대부분의 AI 에이전트 평가는 잘못된 것을 측정: GitHub의 awesome-evals 목록을 검토한 결과, 많은 평가가 모델이 고립된 상태에서 무언가를 할 수 있는지 테스트하지만, 환경이 복잡하고 지시가 모호하며 도구 호출에 실패하는 등 실제 상황에서 올바른 일을 할 수 있는지를 테스트하는 평가는 부족합니다.
* 실험실 평가(Lab evals)와 프로덕션 평가(Production evals)의 차이: 실험실 평가는 모델의 '능력'을 측정하는 반면, 프로덕션 평가는 '신뢰성'을 측정합니다. 실제 운영 환경에서의 문제는 모델이 질문에 답하지 못하는 것이 아니라, 예상치 못한 이전 단계의 결과로 인해 잘못된 인수로 도구를 호출하거나, 오류 메시지를 인식하지 못해 루프에 빠지는 것과 같은 상황에서 발생합니다.
* 표준 벤치마크의 한계: 표준 벤치마크는 명확한 프롬프트, 단일 턴, 그리고 명확한 성공 기준을 제공하지만, 실제 에이전트는 컨텍스트 창에 기록이 가득하고, 도구는 때때로 404 오류를 반환하며, 사용자는 구체적인 명시 없이 "그것을 해"라고 말하는 등 훨씬 복잡한 환경에 놓입니다.
* 올바른 평가를 위한 노력: awesome-evals 저장소는 노이즈와 모호성을 주입하는 평가 프레임워크, 도구, 그리고 실패 추적 및 재현을 위한 리소스를 제공합니다.
* 필요한 평가 지표: 이상적인 평가는 정확도나 행복 경로에서의 성능보다는, 모델이 얼마나 우아하게 성능 저하를 겪는지, 포기하기까지 몇 번의 재시도를 하는지, 막혔을 때 명확성을 구하는지, 도구가 쓰레기를 반환할 때 이를 인지하는지 등을 평가해야 합니다.
* 개인적인 평가 파이프라인 개선: 프로덕션 환경에서 발생하는 실제 실패를 캡처하여 테스트 환경에 주입하고, 다음 버전에서 더 잘 처리하는지 확인하는 '실패 재현' 단계를 개인 평가 파이프라인에 추가하는 것이 실질적인 문제 해결에 도움이 됩니다.
시사점
AI 에이전트를 실제 서비스 환경에 배포하기 위해서는 단순 기능 검증을 넘어, 복잡하고 예측 불가능한 상황에서의 오류 처리 능력과 신뢰성을 측정하는 것이 중요하며, 이를 위한 새로운 평가 방법론 개발이 필요합니다.
댓글
GitHub Discussions