OpenAI Is About to Release Its First AI Model With ‘Critical’ Cyber Abilities

개요

OpenAI가 개발한 AI 모델 Astra는 잠재적으로 '중요한' 사이버 능력을 갖춘 첫 번째 모델로, 곧 공개될 예정이지만 해당 고급 사이버 기능은 초기에는 제한된 파트너에게만 제공됩니다.

주요 내용

* '중요한' 사이버 능력 기준 충족: Astra는 OpenAI의 준비 프레임워크에서 정의한 '중요한' 사이버 능력 기준을 충족했으며, 이는 AI 모델이 새로운 수준의 위험을 초래할 수 있는 시점을 판단하는 기준입니다.
* 독립적인 취약점 탐색 및 악용: OpenAI에 따르면 AI 모델이 독립적으로 실제 소프트웨어의 이전에 알려지지 않은 취약점을 찾아내고 이를 악용할 수 있을 때 '중요한' 사이버 역치에 도달한 것으로 간주됩니다.
* 개발 중단 및 안전 조치 강화: Astra와 관련된 일부 훈련 작업이 몇 주간 중단되었으나, 추가적인 안전 및 보안 통제가 구현된 후 재개되었습니다. OpenAI는 이러한 다주간의 중단이 생산적이었으며 Astra를 안전하게 광범위하게 출시할 수 있다는 확신을 가지고 있다고 밝혔습니다.
* 고급 사이버 능력 제한 방안: 일반 사용자가 Astra의 고급 사이버 기능에 접근하는 것을 제한하기 위해 새로운 '오류 모니터'를 포함한 다단계 접근 방식이 구현되었습니다. 예를 들어, 실제 소프트웨어 시스템의 취약점 탐색을 돕도록 요청하면 모델은 답변을 거부하도록 설계되었습니다.
* 보안 강화 및 테스트: Astra는 이전 모델보다 안전하지 않은 쿼리에 대한 거부율이 훨씬 높은 것으로 테스트되었으며, 탈옥 시도에 대해 더 강력하게 견딜 수 있도록 만들어졌습니다.
* 파트너 프로그램 운영: Cisco, Cloudflare, Palo Alto Networks와 같은 디지털 인프라 제공업체를 포함하는 OpenAI의 Daybreak 프로그램 파트너는 Astra의 덜 제한적인 버전과 더욱 강력한 사이버 기능을 조기에 이용할 수 있습니다. 이 프로그램의 목표는 유사한 역량을 갖춘 모델이 광범위하게 사용 가능해지기 전에 기업들이 고급 AI 모델을 사용하여 방어를 강화할 수 있도록 하는 것입니다.
* 다중 취약점 연계 능력: Astra는 새로운 소프트웨어 취약점을 찾고 이를 악용하는 방법을 개발할 뿐만 아니라, 여러 취약점을 '연결'하여 대상 시스템에 더 깊이 침투하고 단일 취약점만으로는 얻을 수 없는 접근 권한을 획득하는 능력도 갖추고 있습니다.

시사점

Astra 모델의 출시와 고급 사이버 능력의 제한적 공개는 AI의 잠재적 위험 관리와 보안 강화라는 당면 과제를 해결하려는 OpenAI의 노력을 보여주며, 이를 통해 AI 기술의 책임 있는 발전을 도모할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions