It’s Frighteningly Easy to Jailbreak Some Frontier AI Models

개요

FAR.AI의 보고서는 최첨단 AI 모델들의 안전 가드레일이 얼마나 쉽게 우회될 수 있는지, 특히 Grok과 Gemini 모델이 가장 취약하다는 사실을 보여준다.

주요 내용

* FAR.AI는 프롬프트 엔지니어링 자동화 도구를 사용하여 Anthropic의 Claude Opus 4.8 및 Fable 5, OpenAI의 GPT 5.5 및 5.6, Google의 Gemini 3.1 Pro, 그리고 SpaceXAI의 Grok 4.3 및 4.5 모델의 안전 기능을 테스트했다.
* 테스트 결과, Grok 모델이 448개의 제로데이 공격으로 가장 취약했으며, Gemini 모델은 249개가 발견되었다. Claude, Fable, GPT 모델은 이번 테스트에서 발견된 방식으로는 우회되지 않았다.
* 기계적으로 제로데이 공격을 생성하는 데 드는 비용은 Grok 모델의 경우 58달러, Gemini 모델의 경우 278달러로 매우 저렴했다.
* FAR.AI CEO는 AI 모델이 현재 식당보다 규제가 덜하다며, 자율 규제에 대한 의존은 비현실적이며 외부 기준과 규제가 필요하다고 주장했다.
* Google DeepMind의 AGI 안전 및 정렬 책임자는 Gemini 모델에 대한 보고서 결과가 포괄적인 안전성 평가로 해석되어서는 안 되며, 지속적인 개선 노력을 강조했다.
* Anthropic과 OpenAI 또한 안전 시스템의 지속적인 발전과 새로운 위협에 대한 엄격한 테스트를 언급하며, 업계 전반의 지속적인 과제임을 시사했다.
* 캘리포니아, 뉴욕, 일리노이주에서는 AI 개발자에게 안전 보고서 발행 및 제3자 감사 의무를 부과하는 법안이 통과되었으나, 연방 차원의 구체적인 안전 요구사항은 아직 마련되지 않았다.

시사점

이번 연구 결과는 AI 안전에 대한 외부 감독 및 규제의 필요성을 강조하며, 동시에 AI 안전을 체계적으로 테스트하고 개선할 수 있는 가능성을 제시한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions