OpenWorkProof Protocol Specification
개요
OpenWorkProof Protocol은 AI 에이전트의 작업 수행 결과를 서명되고 감사 가능한 증거로 검증하는 프로토콜로, 에이전트 실행이 주장대로 이루어졌음을 확인하고 검증자가 실패를 탐지할 능력이 있음을 보장한다.
주요 내용
* 두 가지 핵심 주장 분리: 프로토콜은 작업의 '진본성(Authenticity)'과 '검증자 역량(Verifier capability)'이라는 두 가지 구별되는 주장을 분리하여 다룬다. 진본성은 영수증에 대한 서명으로 증명되며, 검증자 역량은 영수증 내의 '음성 제어(negative control)'를 통해 증명된다.
* 프로토콜의 목적 및 범위: AI 에이전트 작업에 대한 검증된 실행 영수증 형식, 가드(Guard) 정의 및 가드 인벤토리 의미론, 음성 제어 계약, 인구 통계 명세, 시간적 유효성, 신뢰 모델 및 부트스트랩을 포함한다. 모델 평가, 벤치마킹, 추적/관찰 가능성, 환경 증명, 정책 판단 의미론 등은 비목표로 한다.
* 핵심 용어 정의:
* Guard: 명령, 단언, 예상되는 실패 동작을 포함하는 검증 체크.
* Guard inventory: 운영자가 실행하는 가드 집합으로, '입증됨(proven)', '입증 안 됨(unproven)', '고장(broken)'으로 분류된다.
* Negative control: 모든 CI 패스에서 실행되는 고의로 실패하도록 설계된 입력으로, 가드가 실패할 것임을 단언한다.
* Provocation contract: 음성 제어가 유발하는 것에 대한 공식 사양.
* Receipt: 단일 검증 이벤트에 대한 서명된 증거. '양성 팔(positive arm)'과 '음성 팔(negative arm)'로 구성된다.
* Population manifest: 체크가 검사해야 하는 항목의 정직한 열거. 'eligible\_seen'과 'population\_size'를 통해 선택 손실을 추적한다.
* 실패 모델: 검증은 구조적으로 의미 없을 수 있다는 점을 인지하고, '구조적 죽음(Structural death, ln.strip() 예시)'과 '부패(rot)'의 세 가지 모드(가드 부패, 제어 부패, 인구 통계 부패)를 정의한다.
* 핵심 원시 요소:
* Guard & Guard Inventory: '입증됨'은 음성 제어가 예상대로 실패하는 동안에만 유효하며, 시간이 지남에 따라 변하는 라벨이다.
* Negative Control: 고정된 깨진 입력과 예상된 실패를 다이제스트로 고정하며, 스키마 버전에 따라 범위를 지정한다.
* Population Manifest: 'eligible\_seen'(게이트에 도달한 사전 선택 수)과 'population\_size'(선택 통과 수)를 구분하여 선택 손실을 감사 가능하게 한다.
* Receipt (DualArmReceipt): 작업 ID, 결과, 양성 팔(테스트 결과, 인구 통계 명세), 음성 팔(제어 결과, 제어 대상)을 포함하는 서명된 영수증이다. 음성 팔이 없으면 증거가 아닌 로그로 간주된다.
* Temporal Validity (RetractionReceipt): 영수증의 유효성을 추적하며, 'superseded\_by', 'refuted\_by', 'scope\_changed'와 같은 범주를 사용하여 철회될 수 있다.
* Policy-State Registry & PolicyAnchor: 정책과 해당 체크포인트가 버전 관리되는 불변 레지스트리에 저장되며, PolicyAnchor는 권위 자체를 고정하는 역할을 한다.
* 검증 흐름: CI 패스마다 가드 정의, 양성/음성 팔 실행, DualArmReceipt 패키징 및 서명, 정책/범위 변경 시 RetractionReceipt 발행 등의 단계를 거친다.
* 신뢰 모델 및 부트스트랩: 최소한의 신뢰할 수 있는 권한 부여 키와 서명된 초기 체크포인트로 시작하며, 투명성 로그와 독립적인 철회 권한을 통해 보안을 강화한다.
* 계층형 아키텍처: 정책 기록/권한 부여(Layer -1), 판결(JPS 레이어), 실행, 증거(DualArmReceipt) 순서로 구성된다.
* 검증 성숙도 모델: Level 0(자체 보고 신뢰)부터 Level 5(검증자의 검증자 검증)까지 정의하며, Level 4를 프로덕션 채택 목표로, Level 5를 차별화 요소로 삼는다.
* 채택 경로: Tier 1(인간 검증 가능 증거: 로그, 비디오)과 Tier 2(기계 검증 가능 영수증: 서명된 DualArmReceipt, 공개된 인벤토리)의 두 단계로 나뉜다.
시사점
OpenWorkProof Protocol은 AI 에이전트 작업의 신뢰성을 체계적으로 강화하기 위한 실질적인 프레임워크를 제공하며, 검증 과정 자체의 무결성을 보장하는 메커니즘을 통해 AI 시스템의 신뢰성과 감사 가능성을 높이는 데 기여한다.
댓글
GitHub Discussions