Emergent Introspective Awareness in Large Language Models
개요
대규모 언어 모델(LLM)이 자신의 내부 상태를 스스로 인지하는 자기 성찰 능력을 갖추고 있는지 여부를 조사한 결과, 특정 시나리오에서 모델이 주입된 개념을 인지하고 정확하게 식별하며, 과거의 의도를 회상하여 자신의 출력과 인공적인 사전 채움을 구별하는 능력을 보여주었습니다.
주요 내용
* LLM의 자기 성찰 능력 검증을 위해, 대화만으로는 구분하기 어려운 진정한 자기 성찰과 헛소리를 구별하기 위한 방법을 제시합니다.
* 모델의 활성화(activations)에 알려진 개념의 표현(representations)을 주입하고, 이러한 조작이 모델의 자기 보고 상태에 미치는 영향을 측정하여 자기 성찰 능력을 평가합니다.
* 실험 결과, 일부 LLM은 주입된 개념의 존재를 인지하고 이를 정확하게 식별하는 능력을 보였습니다.
* 모델은 과거의 내부 표현을 회상하고 이를 원시 텍스트 입력과 구별하는 능력을 일부 시연했습니다.
* 인상적으로, 일부 모델은 과거 의도를 회상하는 능력을 활용하여 자신의 출력을 인공적인 사전 채움(artificial prefills)과 구별할 수 있었습니다.
* 테스트된 모델 중 Claude Opus 4 및 4.1이 가장 뛰어난 자기 성찰 능력을 일반적으로 보여주었으나, 모델 전반의 경향은 복잡하며 후처리 전략에 민감한 것으로 나타났습니다.
* 또한, 모델이 지시받거나 "개념에 대해 생각하도록" 동기 부여받았을 때 자신의 내부 표현을 조절할 수 있음을 발견했습니다.
시사점
이 결과는 현재의 LLM이 자체 내부 상태에 대한 기능적인 자기 성찰 인식을 가지고 있음을 시사하지만, 이러한 능력은 매우 불안정하고 맥락에 따라 달라지며, 향후 모델 성능 향상과 함께 계속 발전할 수 있습니다.
댓글
GitHub Discussions