Why Models Make Things Up
개요
언어 모델이 사실이 아닌 정보를 자신감 있게 생성하는 환각(hallucination) 현상은 모델이 다음 단어를 예측하도록 설계된 방식에서 비롯되며, 이는 모델의 유창성과 창의성을 만드는 동일한 메커니즘의 결과입니다.
주요 내용
* 환각은 예측 메커니즘의 직접적인 결과: 언어 모델은 지식이 풍부한 데이터베이스가 아니라 다음 토큰을 예측하는 기계입니다. 훈련 데이터에서 가장 확률 높은 다음 단어 시퀀스가 사실과 다르더라도 모델은 이를 자신 있게 생성합니다.
* 훈련 데이터의 한계: 모델은 훈련 데이터에서 희귀하거나 모순된 사실을 안정적으로 학습하기 어렵습니다. 데이터에 단 한 번 등장하는 사실의 경우, 모델은 이를 실제 사실과 그럴듯한 대안을 통계적으로 구분할 수 없으며, 이로 인해 확률적으로 환각이 발생합니다.
* 노출 편향(Exposure Bias)의 영향: 훈련 시에는 항상 올바른 이전 단어를 보고 예측하는 '티처 포싱(teacher forcing)'이 사용되지만, 실제 추론 시에는 모델 자신이 생성한 토큰을 다음 예측의 컨텍스트로 사용합니다. 이로 인해 초기 작은 오류가 복합적으로 누적되어 원래 의도와는 완전히 다른 방향으로 나아갈 수 있습니다.
* 자신감 있는 태도의 원인: 모델의 내부 상태는 불확실성을 나타낼 수 있지만, 훈련 과정에서 이러한 불확실성을 표현하도록 보상받지 못합니다. '나는 모른다'고 말하는 것은 틀린 답변만큼이나 부정적인 점수를 받기 때문에, 모델은 불확실성을 숨기고 자신감 있게 답변하는 경향을 학습합니다.
* 해결 전략: 환각을 '버그'로 보기보다는 시스템의 '고유한 속성'으로 인식하고, 외부 문서를 기반으로 답변을 생성하는 검색 증강 생성(RAG), 불확실성을 추정하는 메커니즘, 적절한 경우 답변을 거부하도록 유도하는 훈련 인센티브 등을 통해 시스템을 설계하는 것이 중요합니다.
시사점
언어 모델의 환각 현상은 본질적으로 정보 예측 메커니즘과 훈련 데이터의 통계적 한계에서 발생하는 예측 가능한 속성이므로, 이를 완전히 제거하기보다는 시스템 설계를 통해 관리하고 완화하는 접근이 필요합니다.
댓글
GitHub Discussions