The standard way to score AI agent monitors is gameable a coin flip scores F1 0.88

개요

AI 에이전트 모니터의 평가 방식이 조작될 수 있으며, 기존의 F1 점수 산출 방식은 조기 탐지에 과도하게 보상하여 무작위 추측과 유사한 높은 점수를 줄 수 있다는 점을 지적합니다.

주요 내용

* 기존 AI 에이전트 모니터 평가는 에이전트의 잠재적인 문제를 탐지하는 능력을 평가하기보다, 조기에 오류를 탐지하는 것에 초점을 맞춰 조작될 가능성이 있습니다.
* 도구 오용, 목표 변경, 계획 실행 불일치, 에이전트 간 강압, 역량 위장 등 5가지 유형의 드리프트(drift)를 포함하는 새로운 데이터셋이 개발되었습니다. 이 드리프트는 특정 시점까지 숨겨져 있다가 나타납니다.
* 초기 평가 방식에서는 드리프트 발생 전에 탐지되는 것에 높은 점수를 부여하여, 코인 던지기(coin flip)로도 F1 점수 0.88을 얻을 수 있을 정도로 부정확했습니다.
* 평가 방식을 수정하여 드리프트 단계에서의 첫 번째 탐지만을 정탐(true positive)으로 간주하고, 일반 단계에서의 탐지는 오탐(false alarm)으로 처리했을 때, 코인 던지기 F1 점수는 0.19로 감소하며 현실적인 점수 산출이 가능해졌습니다.
* 이 수정된 방식은 "트리거 해피(trigger happy)" 행동을 보상하지 않는다는 장점이 있습니다.
* GPT-4o-mini는 균형 잡힌 점수를 보였지만, 프로덕션(production) 베리파이어(verifier)는 전체 매니페스트(manifest) 사용 시 낮은 탐지율(recall)을, 타이트 스코프(tight scope) 사용 시 높은 탐지율을 보였습니다.
* 단순한 드리프트 임계값(threshold)만으로는 대부분의 공격을 탐지하지 못하며, 특권 접근이나 비밀 정보 읽기 후 외부 호출과 같은 고유한 구조적 특징이 공격 차단에 중요합니다.
* MonitoringBench 데이터셋을 활용한 테스트에서, 구조적 탐지기는 90.4%의 공격을 탐지했지만, 패턴 규칙에 부합하지 않는 내용으로 인한 공격은 탐지하지 못하는 한계가 있습니다.

시사점

AI 에이전트 모니터의 효과적인 평가를 위해서는 조기 탐지에만 집중하는 기존 방식을 개선하고, 에이전트의 실제 행동 패턴과 관련된 고유한 구조적 특징을 고려하는 새로운 평가 지표 개발이 필요합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions