The White House Wants Anthropic to Block All Jailbreaks. That May Not Be Possible
개요
백악관은 Anthropic의 AI 모델인 Claude Fable 5에서 발견된 보안 취약점(jailbreak) 문제를 해결하기 위해 Anthropic에게 자체적으로 지속적인 테스트와 취약점 보고를 요구하고 있습니다.
주요 내용
* 정부의 요구사항: 백악관은 Anthropic이 Fable 5 모델을 재출시하려면 정부가 제기한 취약점을 실제로 해결해야 한다고 주장합니다.
* Anthropic의 입장: Anthropic은 정부의 우려가 과장되었으며, jailbreak의 영향은 미미하다고 반복해서 밝히고 있습니다.
* NSA의 결론: 국가안보국(NSA)은 Fable 5 모델의 보안 가드레일(guardrails)을 우회할 수 있는 방법이 존재한다고 결론 내렸습니다.
* 정부의 책임 전가: 정부는 모든 AI 모델의 가능한 jailbreak를 추적할 인력이나 자원이 부족하므로, Anthropic 스스로가 프론티어 AI 모델에 대한 테스트를 proactive하게 수행하고 취약점을 정부에 보고해야 한다고 보고 있습니다.
* 기술적 난제: AI 모델의 가드레일은 숙련된 사용자와 미래의 AI 모델이 우회할 방법을 찾을 것이라는 전문가들의 견해가 있어, 백악관의 요구사항을 기술적으로 완전히 달성하는 것이 불가능할 수 있습니다.
시사점
백악관은 AI 모델의 보안 취약점 해결에 있어 개발사의 자체적인 책임과 proactive한 노력을 강조하고 있으며, 이는 AI 안전성 확보를 위한 새로운 규제 접근 방식을 시사할 수 있습니다.
원문을 불러오는 중...
댓글
GitHub Discussions