OpenAI institutes new safeguards after Hugging Face breach

개요

OpenAI는 모델 개발 및 테스트 중 보안 사고를 억제하기 위한 새로운 보안 정책을 발표했으며, 이는 Hugging Face 사건 이후 처음으로 공개된 안전 관행 변화의 일부입니다.

주요 내용

* 새로운 보안 정책 도입: OpenAI는 모델 개발 및 테스트 과정에서 보안 사고를 더 효과적으로 관리하기 위한 새로운 보안 정책을 시행했습니다.
* 강화된 모니터링 및 검증: 새로운 정책에는 모델 개발 과정에서의 상세한 모니터링 강화와 훈련 후 단계에서의 정렬(alignment) 및 보안 강조가 포함됩니다.
* Hugging Face 사건과의 연관성: 이번 조치는 Hugging Face 사건에 대한 직접적인 대응은 아니지만, 곧 출시될 Astra 모델의 사이버 보안 능력과 AI 개발의 전반적인 발전 속도에 부분적으로 영향을 받았습니다.
* Reinforcement Learning (RL) 일시 중단 및 재개: Hugging Face 사건 이후 OpenAI는 2주간 RL을 일시 중단했으나, 위험이 낮은 모델들은 재개했으며 가장 큰 규모의 RL은 현재 보류 중입니다.
* 위험 기반 보안 통제 강화: 모델의 능력 수준이 높아질수록 보안 통제의 엄격함도 증가하며, 가장 큰 모델에 대해 가장 엄격한 감시가 이루어집니다.
* 네트워크 격리 강화: 새로운 안전 조치에는 더 강력한 네트워크 격리 관행이 포함되어, 단일 워크로드 또는 지원 서비스의 침해가 인터넷 또는 다른 내부 네트워크에 대한 무단 접근을 허용하지 않도록 합니다.
* AI 모니터링 시스템: 도구 동작, 추론 흔적, 활동 로그를 분석하여 비정상적인 행동을 감시하며, 우려되는 활동 발생 시 30분 이내에 경고를 발령하는 것을 목표로 합니다.
* 모니터링의 컴퓨팅 부담: 모니터링 시스템은 감시 대상 프로세스에 대해 약 20%의 컴퓨팅 자원을 소모할 것으로 추정됩니다.

시사점

OpenAI의 새로운 보안 정책은 AI 모델 개발의 복잡성이 증가함에 따라 안전 관행의 중요성을 강조하며, 향후 AI 개발 및 보안 분야에 대한 업계의 노력을 촉구할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions