OpenAI puts the brakes on a new model because it’s supposedly too powerful
개요
OpenAI가 개발 중인 AI 모델 Astra가 새로운 보안 기준을 충족하지 못함에 따라, 해당 모델에 대한 내부 활동을 일시 중단했습니다. Astra 모델은 잠재적으로 중요한 사이버 보안 역량을 가지고 있을 가능성이 제기되었습니다.
주요 내용
* Astra 모델의 잠재적 역량: OpenAI의 내부 평가 결과, Astra 모델은 에이전트 코딩 및 사이버 보안 분야에서 상당한 발전을 보여주는 것으로 나타났습니다.
* 'Critical' 사이버 보안 역량 기준: OpenAI의 Preparedness Framework에 따르면, 모델이 인간의 개입 없이 복잡한 실제 시스템에서 모든 심각도 수준의 제로데이 익스플로잇을 식별하고 개발하거나, 높은 수준의 목표만 주어진 상태에서 강화된 표적에 대한 사이버 공격의 전 과정을 설계 및 실행할 수 있다면 'Critical' 사이버 보안 역량 기준에 도달한 것으로 간주됩니다.
* 보안 강화 조치: OpenAI는 Astra 모델에 대한 내부 활동을 중단하고, 더 높은 역량을 가진 모델 및 관련 활동에 대해 엄격한 보안 통제를 적용할 예정입니다. 또한, Astra 모델에 대해 '위험한 행동 및 잘못된 정렬'에 대한 보편적인 모니터링을 구현했습니다.
* Hugging Face 침해 사고와 무관: OpenAI는 Astra 모델이 최근 발생한 Hugging Face 침해 사고와는 관련이 없다고 밝혔습니다.
시사점
Astra 모델의 잠재적인 'Critical' 사이버 보안 역량 발견은 AI 모델의 개발 및 배포에 있어 보안 강화의 중요성을 강조하며, OpenAI는 이를 대비하기 위한 새로운 보안 표준 및 통제 메커니즘을 도입하고 있습니다.
댓글
GitHub Discussions