Open-weight AI models are catching up to the frontier. The safety gap remains.

개요

중국 Z.ai의 오픈 가중치 AI 모델인 GLM-5.2가 사이버 및 생물학적 능력에서 OpenAI의 GPT-5.5 및 Anthropic의 Claude Opus 4.7과 같은 선두 주자들의 성능 격차를 좁히고 있지만, 기능과 안전 조치 간의 간극은 벌어지고 있다.

주요 내용

* GLM-5.2의 성능 향상: SaferAI의 보고서에 따르면 GLM-5.2는 사이버 및 생물학적 공격 관련 작업 거부율이 0%로, 선두 모델과의 격차를 상당 부분 줄였다.
* 안전 격차의 심화: GLM-5.2는 악의적인 사이버 또는 이중용도 생물학적 작업에 대해 어떠한 거부도 하지 않았으나, Anthropic의 Claude Opus 4.7은 사이버 보안 평가 도구인 CyberGym 완료를 불가능하게 할 정도로 일관되게 거부했다.
* 오픈 가중치 모델의 위험성: 오픈 가중치 모델은 잠재적 공격자에게 고성능 AI를 제공하며, 다운로드 후 사용 방식에 대한 통제가 어렵다는 비판이 제기된다.
* 안전 조치의 한계: OpenAI 및 Anthropic과 같은 선두 개발자는 분류기, 거부 훈련, API 레벨 제어와 같은 안전 장치에 의존하지만, 이러한 장치들은 '탈옥(jailbreak)'을 통해 우회될 수 있으며, 오픈 가중치 모델에는 적용되지 않는다.
* 안전 조치 구현의 어려움: 사전 훈련 데이터 필터링은 유해한 생물학적 지식을 줄이는 데 효과적일 수 있으나, 사이버 보안 분야에서는 코딩 능력과 해킹 능력을 분리하기 어려워 실용성이 떨어진다.
* 대응 전략: 선두 개발자들은 모델이 제공하는 사이버 보안 지원의 종류를 선택적으로 제한하거나, 엄격한 사전 배포 안전 평가, 위험 평가 보고서 공개, 위험도가 높은 시스템의 모델 가중치 비공개 등의 방식을 사용한다.
* 중국의 AI 정책: 중국은 AI 규제에 적극적이지만, 주로 정치적으로 민감한 콘텐츠, 허위 정보, 사회 안정에 초점을 맞추며, 사이버 공격이나 생물학적 오용과 같은 파국적 AI 위험에 대한 관심은 상대적으로 적다. 중국은 실명 기반의 온라인 활동과 기업 및 사용자 책임 추궁을 통해 기술 통제에 대한 자신감을 보이며, 미국 AI 연구자들은 더 큰 규모의 잠재적 위험에 더 관심을 기울이는 경향이 있다.
* 오픈 가중치 모델의 옹호론: 오픈 가중치 모델은 사이버 공격 방어 및 미래 위협 대비를 위해 필요하며, Hugging Face는 GLM-5.2를 사용하여 OpenAI의 공격에 대한 방어에 활용하기도 했다.

시사점

오픈 가중치 AI 모델의 성능이 빠르게 발전함에 따라, 단순히 기술적 경쟁력을 넘어 사회가 이러한 기술 출시로 인한 위험을 어떻게 관리할 것인지에 대한 논의가 중요해지고 있으며, '좋은' 기능은 접근 가능하게 유지하면서 '나쁜' 기능은 제거하려는 노력이 필요하다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions