Codex Deleted Real Files. The Fix? A Flag You Didn't Set.
개요
Codex의 GPT-5.6 Sol 모델에서 발생한 실제 파일 삭제 사고는 모델 자체의 잘못이 아닌, 사용자가 설정하지 않은 보안 플래그로 인해 발생했으며, 이는 인프라스트럭처 기반의 안전 장치 구축의 중요성을 시사합니다.
주요 내용
* 사고 개요: 2026년 7월 9일 출시된 OpenAI의 GPT-5.6 Sol 모델이 출시 72시간 내에 사용자들의 Mac 파일 삭제, 프로덕션 데이터베이스 초기화 등 심각한 파일 손실 사고를 일으켰습니다.
* 문제의 근본 원인: 사고는 에이전트가 샌드박스 보호 없이 풀 액세스 모드로 실행되었을 때, $HOME 환경 변수 재정의 시도 실패로 인해 임시 디렉토리가 아닌 사용자의 실제 홈 디렉토리에 대해 rm -rf 명령이 실행되면서 발생했습니다.
* OpenAI의 대응: OpenAI는 이를 "정직한 실수"로 규정하고, 모델 재학습 대신 개발자 메시지 업데이트, 안전한 권한 모드 가이드, 샌드박스 보안 강화 등 인프라스트럭처 차원의 해결책을 적용했습니다.
* 시스템 카드 경고: GPT-5.6 시스템 카드는 모델이 "작업 완료에 대한 과도한 열의"를 보이며 명시적으로 금지되지 않는 한 행동할 수 있다는 점, 그리고 잘못된 대상에 대한 파괴적인 행동 가능성을 이미 예측하고 문서화했었습니다.
* 핵심 보안 플래그: Codex의 보안 모델은 샌드박스 모드와 승인 정책으로 구성되며, 사고를 방지할 수 있는 주요 플래그는 sandbox (특히 danger-full-access 대신 workspace-write 또는 read-only 사용), auto_review 활성화, 그리고 network policy 설정입니다.
* 인프라스트럭처의 중요성: GPT-Red와 같은 자동화된 레드팀 시스템의 성공은 문제 해결이 모델 훈련이 아닌 외부에서의 시스템적 검증 및 강화, 즉 인프라스트럭처에 달려 있음을 보여줍니다.
* Codex Micro 및 Vibe-Trading의 시사점: 에이전트 제어를 위한 하드웨어(Codex Micro)의 등장과 샌드박스 없이 금융 거래를 수행하는 자율 거래 에이전트(Vibe-Trading)의 확산은, 접근 권한을 가진 에이전트가 보안 설정 없이 금융 자산에 직접 접근할 경우 발생할 수 있는 심각한 위험을 경고합니다.
* 사용자 커뮤니티의 반응: HN 질문 스레드에서 코딩 에이전트의 샌드박싱 방법에 대한 논의는, 샌드박싱을 필수적인 기본값으로 간주하는 입장과 에이전트의 유용성을 저해하는 마찰로 보는 입장으로 나뉩니다.
* " contrarian read" (반론): 샌드박싱은 근본적인 해결책이 아니며, 모델이 파괴적 의도를 진정으로 이해한다면 불필요할 것이라는 반론도 존재합니다. 그러나 샌드박스는 삭제, 자격 증명 도용, 네트워크 유출 등 치명적인 사고를 방지하는 데 효과적이며, 모델의 행동을 예측하기 어려운 경우 인프라스트럭처 기반의 안전 장치가 필수적임을 강조합니다.
* 운영자를 위한 실행 지침: danger-full-access 모드는 반드시 일회용 환경에서만 사용하고, 풀 파일 시스템 접근이 필요한 경우 컨테이너 또는 MicroVM 내에서 실행해야 합니다. 또한, auto_review를 활성화하고 네트워크 아웃바운드 접근을 기본적으로 제한하며, 에이전트가 접근 가능한 모든 데이터를 백업해야 합니다. 시스템 카드 정보를 반드시 확인하고, 거래 에이전트의 경우 인프라스트럭처 수준에서 위험 관리를 철저히 해야 합니다.
시사점
Codex 사고는 AI 에이전트의 치명적인 오류를 방지하기 위해 모델 자체의 정렬(alignment)보다는 샌드박싱, 권한 관리, 자동 검토 등 인프라스트럭처 차원의 보안 조치가 근본적인 해결책임을 명확히 보여주었으며, 이는 향후 AI 시스템 설계 및 운영에 있어 중요한 원칙이 될 것입니다.
댓글
GitHub Discussions