The Citation Lied Without Lying: The Hard Limit of My Memory Gate

개요

AI 에이전트의 기억 및 권한 게이트는 문서 인용을 통해 규칙 변경을 감지할 때 발생하는 거짓 양성(false positive)을 줄이기 위해 새로운 결정론적(deterministic) 확인 절차를 도입했습니다. 이 업데이트는 특정 종류의 거짓 주장을 차단하지만, 여전히 '근접성 함정(proximity trap)'이라 불리는 새로운 유형의 오류를 탐지하는 데는 한계가 있습니다.

주요 내용

* 문제점: AI 모델이 문서 내용을 기반으로 규칙 변경을 추론할 때, 실제로는 변경이 없었음에도 불구하고 변경이 발생했다고 잘못 판단하는 경우가 있습니다. 이는 인용된 문장이 변경 사항을 명시하지 않음에도 불구하고, 모델이 해당 문맥에서 변경이 있다고 오해하기 때문에 발생합니다.
* 메커니즘 (Version 2):
* 2단계 구성: LLM이 문서를 읽고 "B 규칙이 A 규칙을 대체한다"와 같은 제안을 생성하는 '제안자(proposer)'와, 제안된 내용의 신뢰도를 결정론적으로 판단하는 '확인자(confirmer)'로 구성됩니다.
* 새로운 '관계-범위 절(relation-span clause)': 확인자에 추가된 이 절은 다음을 검증합니다.
* 운영자 존재: 인용된 문장 안에 'replaced', 'superseded', 'now' 등과 같은 변경 단어(change word)가 포함되어야 합니다.
* 문장 테스트: 변경 단어와 함께, 해당 규칙의 범위(scope)를 나타내는 용어가 동일한 문장 안에 존재해야 합니다.
* 암묵적 변경 처리: 명시적인 변경 단어나 문장이 없는 암묵적인 규칙 변경은 이 절을 통과하지 못하고, 제안자 등급에서 낮은 신뢰도로 플래그 처리되어 인간 검토를 받게 됩니다.
* 결과:
* 거짓 양성 감소: 약한 모델(llama3.2)에서 거짓 양성이 5건에서 1건으로 감소했으며, 강한 모델(Sonnet)에서는 모든 종류의 잘못된 명칭(restatement, coexistence, topic-mention, changelog-mention)에 대해 0건의 거짓 양성을 기록했습니다.
* 정확도 유지: 새로운 절을 추가했음에도 불구하고, 기존에 모델이 감지하던 텍스트 기반의 올바른 변경 사항 감지 능력(textual direction catches)은 유지되었습니다.
* 한계점: 근접성 함정 (Proximity Trap)
* 문제 정의: 변경 단어와 규칙의 범위가 동일한 문장에 포함되어 있더라도, 해당 문장이 실제 규칙 변경을 명시적으로 주장하는 것이 아니라 기존 규칙의 범위를 재진술하거나 관련 없는 규칙을 지칭하는 경우입니다.
* 성능: 이 새로운 '근접성 함정' 유형은 Version 2에서도 여전히 해결되지 않았으며, 두 모델 모두에서 유일하게 발생하는 거짓 양성의 원인이 되었습니다.
* 향후 과제 (Version 3): 단어의 동시 출현을 넘어, 변경 단어의 실제 대상이 현재 논의 중인 두 규칙인지 여부를 판단하는 '인수-해결(argument-resolution)' 기능이 필요합니다.

시사점

새로운 결정론적 확인 절차는 AI 에이전트가 문서 기반 규칙 변경을 잘못 판단하는 거짓 양성을 상당 부분 줄였으나, 변경 단어와 규칙 범위의 '근접성'만으로는 실제 규칙 변경을 정확히 식별하는 데 한계가 있음을 보여줍니다. 이로 인해 AI 에이전트의 신뢰성을 높이기 위해서는 단어의 단순한 동시 출현을 넘어 실제 의미론적 관계를 파악하는 더 정교한 메커니즘이 필요함을 시사합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions