OpenAI’s new reasoning technique alarms AI safety experts
개요
OpenAI의 새로운 Astra 모델에 적용될 것으로 알려진 '불투명 순환(opaque recurrence)'이라는 새로운 추론 기법은 기존의 순차적 사고방식에서 벗어나 모델의 사고 과정을 추적하기 어렵게 만들어 AI 안전 전문가들에게 우려를 야기하고 있습니다.
주요 내용
* OpenAI의 Astra 모델이 '불투명 순환(opaque recurrence)'이라는 추론 기법을 사용할 예정이며, 이는 기존 모델들의 순차적 사고방식과 달리 작동합니다.
* 이 기법은 모델의 '사고 연쇄(chain of thought, CoT)' 추적을 어렵게 만들어 AI 안전 전문가들의 불안감을 증폭시키고 있습니다.
* Redwood CEO Buck Shlegeris는 Astra의 불투명 순환 사용에 대해 깊은 우려를 표명했으며, OpenAI가 이 기법을 더욱 발전시킬 경우 CoT 모니터링이 불가능해질 수 있다고 지적했습니다.
* AI 안전 옹호론자 Zvi Mowshowitz는 이러한 기법이 AI 연구소 간의 '최악을 향한 경쟁'을 막기 위해 법적 규제가 필요할 수 있다고 언급하며, CoT 충실도와 모니터링 가능성을 유지하기 위한 노력을 훼손할 수 있다고 경고했습니다.
* 일반적인 추론 모델에서 사고 연쇄는 문제 해결 과정에서 모델이 취하는 단계적 절차를 제공하며, 이는 오작동이나 불일치를 감시하는 중요한 도구로 사용됩니다.
* 불투명 순환에서는 모델이 덜 선형적인 접근 방식을 취하며, 동일한 쿼리를 루프 안에서 여러 번 처리하여 명확한 흔적을 덜 남기므로 기존의 CoT 기록을 우회하게 됩니다.
* Astra에서의 해당 기법 사용은 제한적이며, CoT는 여전히 파악 가능할 것으로 예상되고 OpenAI는 '신경어(neuralese)'로의 전환 가능성을 일축했습니다.
* OpenAI는 이미 향후 안전 계획의 일부로 광범위한 CoT 모니터링 시스템을 발표했으며, 최고 과학자 Jakub Pachocki는 CoT 모니터링을 유지하고 활용하는 것이 연구의 핵심 목표임을 강조했습니다.
* 모든 AI 모델이 어느 정도의 불투명한 추론을 수행하며, CoT 로그를 모델 추론의 직접적인 표현으로 여기지 않는 연구자들도 존재하지만, 불투명 순환은 AI 추론을 더 어렵게 모니터링하게 만들 수 있다는 우려는 여전합니다.
* Anthropic과 Google DeepMind 또한 이미 이 기법에 대해 논의하고 있으며, Redwood Research의 Ryan Greenblatt는 불투명 추론이 기존 CoT 추론보다 더 빠르게 확장되어 모든 추론을 가시적인 채널에서 제거할 수 있다고 지적했습니다.
시사점
불투명 순환 기법의 등장은 AI의 내부 작동 메커니즘을 이해하고 안전하게 제어하는 데 중요한 도전 과제를 제시하며, AI 연구 및 개발 과정에서 모니터링 가능성을 유지하기 위한 기술적, 제도적 노력이 필요함을 시사합니다.
댓글
GitHub Discussions