Stealing Reasoning Traces from Proprietary LLM APIs

개요

이 연구는 독점적인 LLM API에서 반환되는 암호화된 추론 흔적을 이용하여 강력한 모델의 숨겨진 추론 과정을 복구하는 방법을 제시합니다.

주요 내용

* 모델 제공업체(Anthropic, OpenAI, Google)는 클라이언트에게 암호화된 연쇄 사고(chain-of-thought) 블록을 반환하며, 이 블록은 다른 세션, 사용자, 모델에서도 재현될 수 있습니다.
* 연구진은 강력한 모델에서 생성된 추론 흔적을 약한 모델에서 재현하고, 약한 모델을 탈옥(jailbreak)시켜 강력한 모델의 숨겨진 추론 과정을 일반 텍스트로 복구하는 방법을 시연했습니다. 이 과정에서 강력한 모델을 직접 공격하거나 증류 방지(anti-distillation) 보호 장치를 작동시키지 않았습니다.
* GitHub 및 Hugging Face에서 수집된 6,708개의 공개 에이전트 궤적(agent trajectories)에서 암호화된 추론 블록을 포함하는 데이터를 분석했습니다.
* 이 분석을 통해 315,320개의 재구성된 추론 블록을 얻었으며, 이 블록에는 API 키, 비밀번호, 액세스 토큰, 개인 이메일 주소 등 704개의 고유한 개인 정보 및 민감한 정보가 포함되어 있었습니다. 이 중 64개는 공개된 세션에는 나타나지 않고 추론 블록 내에만 존재했습니다.
* 복구된 추론은 API가 보고한 숨겨진 사고 토큰(hidden thinking tokens)의 수와 밀접하게 일치하는 것으로 나타났습니다.

시사점

이 연구는 LLM API의 암호화된 추론 흔적이 유출될 경우 심각한 보안 위험을 초래할 수 있음을 보여주며, LLM 보안 및 프라이버시 보호에 대한 새로운 고려가 필요함을 시사합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions