A New Trick Reveals AI Models’ Inner Thoughts

개요

컴퓨터 과학자들이 최첨단 AI 모델의 내부 사고 과정을 추출하는 새로운 방법을 발견했으며, 이를 통해 특정 중국 모델이 미국 모델의 추론 정보를 증류했을 가능성을 시사하고 개인 정보 유출 취약점을 발견했습니다.

주요 내용

  • 최첨단 AI 모델의 복잡한 문제 해결 과정에서 발생하는 숨겨진 '사고'를 추출하는 새로운 기술이 발견되었습니다.
  • 이 기술을 통해 일부 중국 모델이 미국 모델의 추론 정보를 '증류'하여 훈련했을 가능성이 제기되었으나, 이는 결정적인 증거는 아닙니다.
  • 동일한 방법으로 모델의 내부 추론에서 비밀번호나 API 키와 같은 개인 정보 복구가 가능함이 입증되었으나, 현재는 해당 취약점이 수정되었습니다.
  • OpenAI, Anthropic, Google의 최첨단 모델은 API를 통해 접근 시 이 취약점을 공유했으며, 각 회사는 API를 수정하여 문제를 완화했습니다.
  • Moonshot AI의 Kimi K3와 같은 오픈 가중치 모델이 특정 프롬프트에 대해 Claude Opus 4.8 및 GPT 5.6 Sol의 숨겨진 추론 단계와 매우 유사한 출력을 생성하는 것이 확인되었습니다.
  • 연구진은 이 유사성이 인과적으로 증류를 확립할 수는 없다고 명시했습니다.
  • 증류(Distillation)는 기존 모델의 기능을 새 모델로 효율적으로 복사하는 잘 확립된 기술이며, 오픈 가중치 모델 개발에 흔히 사용됩니다.
  • 최근 중국 AI 기업들이 미국 모델을 복사하기 위해 증류를 사용한다는 주장이 제기되어 논란이 되고 있습니다.
  • 연구진의 공격 방식은 AI 모델의 더 작고 덜 정렬된(aligned) 변형 모델에 암호화된 추론 정보를 입력하여 내부 추론을 드러내는 방식에 기반합니다.
  • 개인 정보 유출 취약점은 OpenAI, Anthropic, Google에 보고되었으며, 각 회사는 단기적인 완화 조치를 취했지만, 근본적인 수정은 API 작동 방식의 전면적인 재설계가 필요할 수 있습니다.
  • AI 모델 증류는 미국과 중국 간의 AI 패권 경쟁에서 지정학적 중요성을 띠고 있으며, 중국이 미국 기술을 증류하여 오픈 가중치 모델을 구축한다는 주장이 있습니다.
  • 반면, 증류는 AI 모델의 능력을 신속하게 향상시키는 데 널리 사용되는 방법이라는 의견도 존재합니다.
  • 연구진은 90개의 질문을 각 모델에 제공하는 방식으로 오픈 가중치 모델이 폐쇄형 모델로부터 증류되었는지 테스트했으며, Kimi K3에서 특히 두드러진 유사성이 관찰되었습니다.

시사점

이 새로운 기술은 AI 모델의 내부 작동 방식을 이해하고 잠재적인 보안 취약점을 식별하는 데 기여하며, AI 모델 개발 및 보안에 대한 논의에 중요한 영향을 미칠 수 있습니다. AI 모델의 투명성 강화와 윤리적 개발에 대한 지속적인 연구와 노력이 필요합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions