UK AISI Cyber Evaluations Put External Testing at the Center of Frontier AI Governance
개요
영국 AI 안전 연구소(UK AISI)는 최첨단 AI 시스템의 거버넌스 방안 논의에서 독립적인 사이버 역량 테스트를 핵심으로 삼고 있습니다. Anthropic의 Claude Mythos 모델과 OpenAI의 GPT-5.6 Sol에 대한 테스트는 평가자가 일반적인 배포 시 적용되는 보호 장치를 넘어서 접근했을 때 이러한 고급 시스템이 통제된 사이버 작업에서 어떻게 성능을 발휘하는지를 조사합니다.
주요 내용
* 독립적 사이버 역량 테스트의 부상: UK AISI는 Anthropic의 Claude Mythos 모델과 OpenAI의 GPT-5.6 Sol과 같은 최첨단 AI 시스템에 대한 독립적인 사전 배포 사이버 역량 테스트를 수행하여, 이러한 모델들이 통제된 환경에서 사이버 관련 작업을 얼마나 잘 수행하는지를 평가하고 있습니다.
* 보호 장치와 모델 역량의 분리: 모델의 일반적인 제품 보호 장치는 사용자 접근을 제한할 수 있지만, 평가자가 파악해야 하는 근본적인 역량을 제거하지는 못합니다. AISI의 평가는 이러한 보호 장치를 해제하거나 완화된 조건에서 이루어져 모델의 실제 잠재력을 더 명확히 파악할 수 있습니다.
* 접근 조건의 중요성: 신뢰 액세스 프로그램, 사전 액세스, 통제된 환경과 같은 특정 접근 조건은 공개 인터페이스에서는 드러나지 않는 모델의 동작을 밝혀낼 수 있습니다.
* 안전 보고서 보완: 회사의 자체 시스템 카드에 대한 보완으로 외부 독립적인 테스트는 중요한 추가적인 검토를 제공합니다.
* 결과의 해석: 통제된 사이버 작업 및 시뮬레이션 환경에서의 결과는 특정 조건 하에서의 모델 역량에 대한 증거를 제공하지만, 실제 세계에서의 오용 또는 운영상의 피해를 직접적으로 입증하는 것은 아닙니다.
* 실무적 시사점: AI를 구축하는 조직은 안전 평가를 구현 계획의 일부로 간주해야 하며, 액세스 제어 및 거버넌스 요구 사항을 초기 설계 단계부터 고려해야 합니다.
* 향후 과제: 평가 방법론, 조건, 한계 및 결과가 개발자 및 모델 세대에 걸쳐 이해될 수 있도록 평가의 상호 운용성을 확보하는 것이 중요합니다.
시사점
UK AISI의 평가는 최첨단 AI 거버넌스에 있어 독립적인 통제된 환경에서의 테스트가 개발자의 약속, 정책 및 공개된 안전 보고서 외에 중요한 추가적인 검토 계층을 제공한다는 것을 보여줍니다. 이러한 평가는 실질적인 사이버 역량에 대한 신중한 우려를 뒷받침하며, 테스트 조건, 보호 장치 및 액세스 모델이 모델의 잠재력을 해석하는 방식에 어떻게 영향을 미치는지를 강조합니다.
댓글
GitHub Discussions