Frontier AI labs still won’t say how they’d contain a rogue model
개요
주요 프론티어 AI 연구소들이 통제 불능 상태가 된 AI 모델에 대한 대응 계획을 공개적으로 시연하거나 발표한 사례가 적다는 연구 결과가 나왔다.
주요 내용
* Guidelight AI Standards의 최신 연구에 따르면, OpenAI, Anthropic, Meta, Google, xAI 등 5개 주요 AI 연구소의 AI 모델 통제 및 대응 계획을 평가한 결과 OpenAI가 가장 높은 점수를 받았으며 Anthropic과 Meta는 가장 낮은 점수를 기록했다.
* 평가는 AI 시스템의 내부 활동 로깅 및 모니터링, 이상 행동 감지 시 시스템 중단 여부, 독립적인 제3자 감사 시행 및 결과 공개, 통제 불능 모델 발생 시 구체적인 격리 계획 등을 기준으로 이루어졌다.
* Agentic AI의 자율적인 역할 증대와 규제 기관의 정보 공개 요구 강화로 인해 AI 모델의 안전한 운영 및 잠재적 위험 관리에 대한 중요성이 부각되고 있다.
* 일부 AI 기업들은 모델 배포 전 위험 평가에 대해 설명하지만, 시스템 내에서 운영 중인 모델의 오작동 시 대응 방안에 대해서는 공개적인 언급이 부족한 실정이다.
* California의 SB 53 및 New York의 RAISE Act와 같은 규제는 AI 개발사들에게 안전 사고 대응 프레임워크 공개를 의무화하고 있으며, 연방 차원에서도 AI Kill Switch Act와 같은 법안이 논의되고 있다.
* Guidelight의 연구는 기업들이 AI 안전 계획에 대해 더 투명해지도록 장려하는 것을 목표로 하며, 평가 결과는 공개된 정보만을 기반으로 하므로 낮은 점수가 반드시 내부 안전 장치의 부재를 의미하는 것은 아니다.
* Meta와 Anthropic은 공개된 정보상에서 통제 불능 AI에 대한 명확한 대응 계획이 부족했으며, OpenAI는 안전 사고 발생 시 워크로드를 일시 중단하거나 종료하고 재개 절차를 설명하는 등의 조치를 취한 사례가 있어 높은 점수를 얻었으나, 공식적인 대응 계획은 확인되지 않았다.
* AI 모델의 내부 작동 방식, 즉 'chain of thought'를 스캔하여 기만, 장기적인 계획, 취약점 도입 시도 등의 징후를 탐지하는 것이 중요하며, 연구자들의 유연한 연구 환경과 실시간 예방적 모니터링 도입 간의 균형이 요구된다.
시사점
AI 모델의 통제 불능 사태에 대한 대비책 마련과 공개는 AI 기술의 안전한 발전과 신뢰 구축을 위해 필수적이며, 관련 규제 강화와 기업들의 투명한 정보 공개 노력이 병행되어야 한다.
댓글
GitHub Discussions