Researchers fear safety disaster ahead of OpenAI’s Astra release

개요

OpenAI의 차세대 AI 모델인 Astra 출시가 임박하면서, 연구자들은 더 불투명한 기술 구조로 인해 AI 보안 및 안전에 대한 심각한 위험이 발생할 수 있다고 우려하고 있습니다.

주요 내용

* Astra는 다른 최첨단 AI 모델과 달리 "생각" 과정을 덜 보여주는 것으로 알려져 있어, 모니터링이 어렵고 잠재적으로 위험할 수 있다는 우려가 제기됩니다.
* 기존 트랜스포머 모델은 정보를 선형적으로 처리하며 "사고 과정"을 통해 추론 과정을 보여주어 AI의 행동을 감시하고 잠재적인 문제를 사전에 파악할 수 있습니다.
* Astra는 순환 깊이(recurrent depth) 또는 루프 트랜스포머(looped transformer)와 같은 더 불투명한 기술을 사용하여 정보를 내부 계층을 순환시킨 후 출력을 생성하는 것으로 알려졌습니다. 이로 인해 모델의 "생각" 과정이 시스템 내부에 더 많이 숨겨져 있어 연구자들이 감지하기 어렵습니다.
* 이러한 불투명성은 모델 성능을 향상시킬 수 있지만, 잠재적인 위협과 원치 않는 행동을 탐지하는 것을 더 어렵게 만듭니다.
* OpenAI는 Astra에서 루프 트랜스포머/순환 깊이 기술의 사용을 제한하여 연구자들이 모델의 추론을 계속 모니터링할 수 있도록 했다고 밝혔습니다.
* OpenAI는 Astra에 추가적인 "사고 과정" 모니터링을 배포하여 잠재적으로 잘못된 행동을 신속하게 감지하고 억제할 것이라고 발표했습니다.
* Redwood Research의 최고 과학자인 Ryan Greenblatt는 Astra에 더 불투명한 아키텍처를 사용하는 결정이 "AI 보안/안전에 있어 현재까지 최악의 단일 발전"이 될 수 있다고 경고했습니다.
* 안전 전문가들은 AI 개발 경쟁이 투명성 측면에서 "바닥으로 향하는 경주"로 이어져 AI를 모니터링하는 능력을 심각하게 저해할 수 있다고 우려합니다.
* OpenAI의 내부 인사들은 보고가 혼란스러워 "모니터링 불가능한 상태로의 경주"가 시작되었다는 우려를 표했습니다. Jakub Pachocki는 Astra의 계산 깊이가 GPT-4와 비교하여 "두 배 이내"라고 밝히며, 불투명성 증가가 일부 반응이 시사하는 것만큼 극적이지는 않다고 언급했습니다.

시사점

Astra에 사용된 것으로 추정되는 보다 불투명한 AI 아키텍처는 AI 보안 및 안전 연구에 중대한 도전 과제를 제기하며, AI 개발의 속도와 안전성 사이의 균형에 대한 중요한 논의를 촉발합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions