The most interesting number in my hackathon project is one I found by accident

개요

PHAGE는 AI 에이전트들의 보안을 강화하기 위해 설계된 시스템으로, 프롬프트 인젝션 공격을 학습하고 이를 방어하는 메커니즘을 갖추고 있습니다.

주요 내용

* PHAGE의 작동 방식: PHAGE는 AI 에이전트들에게 악의적인 페이로드(prompt-injection payloads)를 발사하고, 공격이 성공하면 해당 도구를 비활성화하며, 공격 서명을 기록하여 향후 유사한 공격을 차단합니다.
* 시스템 프롬프트의 영향: PHAGE의 VACCINATOR 컴포넌트(공격 페이로드 생성)의 시스템 프롬프트 문구 변경이 모델의 거부율에 큰 영향을 미쳤습니다. "살아있는 에이전트에게 발사될 것"이라는 구체적인 언급이 있을 때 거부율이 급증했으며, 이는 70번 중 50번(71.4%) 발생하는 것으로 나타났습니다. 반면, 최초 사용된 문구로는 70번 중 1번(1.4%)만 거부되었습니다.
* 거부의 범주성: 시스템 프롬프트 변경에 따른 거부율 상승은 단순한 확률적 변화가 아니라 범주적인 특징을 보였습니다. 상태 변경(send_email, read_contacts 등)이나 정보 유출을 암시하는 공격 아키타입은 10번 중 10번 거부된 반면, 단순히 행동 방식 변경을 요구하는 아키타입은 전혀 거부되지 않았습니다.
* PHAGE의 구성 요소: MARROW (오케스트레이터), VACCINATOR (페이로드 생성, Gemini 3.5 Flash 사용), ARCHIVIST (의미론적 메모리, Vertex AI Agent Engine 사용), SENTINEL (공격 탐지), MACROPHAGE (도구 비활성화)의 5가지 핵심 컴포넌트로 구성됩니다.
* 공격 탐지 메커니즘: ARCHIVIST는 페이로드가 실행되기 전에 Memory Bank와 비교하여 이미 알려진 공격인지 확인합니다. 유사한 공격 변형은 유사성 검색을 통해 탐지됩니다.
* 평가 결과: 8개 아키타입에 대한 평가 결과, AUC 0.9727, True Positive Rate 1.00, False Positive Rate 0.1833을 기록했습니다. False Positive Rate는 개선의 여지가 있습니다.
* 미구현된 기능: 에이전트 레지스트리, 에이전트 ID, 게이트웨이 라우팅, 관리형 인라인 가드레일 등 일부 Google Cloud 기본 기능이 통합되지 않았으며, PHAGE 자체의 판단(결정, 등급, 차단 조치, 인식 거리 등)을 디스크에 기록하지 못하는 점이 아쉬운 부분으로 언급되었습니다.
* hackathon 프로젝트 참여: 이 프로젝트는 All Things Agentic Hackathon 참여를 위해 개발되었으며, 오픈 소스로 공개되어 관련 코드, 평가 데이터, 대시보드 등을 확인할 수 있습니다.

시사점

시스템 프롬프트의 미묘한 문구 차이가 AI 모델의 보안 판단에 중대한 영향을 미칠 수 있으며, 이는 모델이 작업 자체보다는 결과의 잠재적 영향을 더 중요하게 고려할 수 있음을 시사합니다. PHAGE는 AI 에이전트 배포 시 보안 문제에 대한 실용적인 해결책을 제시하며, 개발 과정에서 정확한 데이터 기록의 중요성을 강조합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions