Two Pre-Registered Benchmarks for Audit-Native RAG: RAB (EU AI Act 10/12/19) + LRB (Time-Travel Retrieval)

개요

기술 콘텐츠는 감사 및 규정 준수 관점에서 RAG(Retrieval-Augmented Generation) 시스템의 투명성과 신뢰성을 평가하기 위한 두 가지 사전 등록된 벤치마크인 RAB(Replayable-Audit Benchmark)와 LRB(Lifecycle Retrieval Benchmark)를 소개합니다.

주요 내용

* RAG의 한계: 기존 RAG 데모는 "올바른 청크(chunk)"를 찾는 데 집중하지만, 규제 기관이나 감사인이 요구하는 "결정 재현(replay this decision)" 및 "과거 정보 재구성(reconstruct the past)" 질문에 대한 답변 능력은 부족합니다.
* RAB (Replayable-Audit Benchmark):
* 결정 과정을 재현할 수 있는 감사 추적(audit trail)의 품질을 측정합니다.
* 세 가지 결정론적 지표(deterministic metrics)를 포함합니다:
* AC (Audit Completeness): 결정과 관련된 모든 이벤트가 기록되었는지 확인 (EU AI Act Art. 10).
* RF (Replay Fidelity): 로그만으로 답변을 다시 도출할 수 있는지 확인 (EU AI Act Art. 12).
* PC (Provenance Coverage): 모든 주장이 출처를 추적할 수 있는지 확인 (EU AI Act Art. 19).
* 이 지표들은 2026년 8월 2일부터 적용되는 EU AI Act의 기록 보관 의무 조항과 직접적으로 연결됩니다.
* JAMES(로컬 우선, 감사 네이티브 Graph-RAG)는 테스트 시나리오에서 1.000의 AC, RF, PC를 달성한 반면, 기본 로깅(Baseline-0)은 AC 0.275, RF 0, PC 0으로 낮은 성능을 보였습니다. 이는 기본 애플리케이션 로깅이 부분적인 이벤트 추적만 제공하며 재현 및 출처 추적이 불가능함을 보여줍니다.
* LRB (Lifecycle Retrieval Benchmark):
* RAG 시스템이 특정 시점의 정보를 정확하게 검색하는 능력을 평가합니다.
* 정책 변경, 가격 변동 등 데이터가 시간이 지남에 따라 변경될 때, 시스템이 해당 시점에 유효했던 사실을 검색하는지, 아니면 최신 정보로 덮어쓰인 정보를 검색하는지를 측정합니다.
* 세 가지 시스템을 비교했습니다:
* V (Vanilla): 시간 처리 기능 없음.
* N (Naive-supersede): 가장 최신 사실이 우선.
* J (JAMES): 유효 기간(validity-window) 기반 검색 (reconstruct_graph_at(t)).
* R@1 (Recall@1) 지표에서 V < N < J 순서가 4가지 모델 패밀리 및 4가지 스케일 포인트(총 12.5배 스케일)에 걸쳐 일관되게 나타나, 시간 인식 검색이 모든 스케일에서 더 우수함을 입증했습니다.
* 게시물 스케일(S3)에서 R@1 지표는 V: 0.502, N: 0.721, J: 0.845였습니다.
* 실행 방법: Ollama, BAAI/bge-m3 임베딩, ChromaDB를 사용하여 로컬 환경에서 벤치마크를 실행할 수 있습니다. 클라우드 LLM 계정이 필요 없으며, GitHub 저장소에서 코드를 다운로드하고 설정을 완료하면 됩니다.
* 프레임워크: 소개된 벤치마크는 특정 시스템의 우수성을 증명하기보다는, 공개적이고 결정론적인 시나리오, 지표, 베이스라인을 제공하여 다른 연구자들이 실행하고 결과를 비교하며 개선할 수 있는 시작점을 제공하는 데 중점을 둡니다.

시사점

이 벤치마크들은 RAG 시스템의 투명성, 재현성, 그리고 시간적 정확성을 측정하는 표준화된 방법을 제공함으로써, 감사 및 규제 준수 요구사항을 충족하는 시스템 개발을 가속화할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions