GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2

개요

최근 AI 연구개발 동향은 무조건적인 파라미터 증가와 데이터 스케일링에 대한 회의론이 확산되고 있으며, 이는 실제 AI 성능 지표에서 모델 크기보다는 다른 요소들의 중요성이 부각되는 결과로 이어지고 있습니다.

주요 내용

* AI 모델의 크기 대비 성능 변화: 과거에는 모델의 크기(파라미터 수)가 AI 성능의 주요 척도였으나, Z.ai의 GLM-5.2(753B 파라미터)가 GPT-5.5와 같은 초대형 모델에 근접하는 성능을 보여주며, 모델 크기와 실제 지능 사이의 상관관계에 대한 의문이 제기되고 있습니다.
* 환각(Hallucination) 현상과 모델 크기의 관계: 학습 데이터의 품질과 종류가 환각 현상에 큰 영향을 미치며, 방대한 양의 사실 기반 데이터로 학습된 모델은 "모른다"고 답하는 능력보다는 확신에 찬 잘못된 답변을 생성하는 경향을 보입니다. DeepSeek V4 Pro(1.6T 파라미터)는 94%의 높은 환각 점수를 기록했으며, GPT-5.5 또한 86%의 높은 환각률을 보였습니다. 반면 GLM-5.2는 28%의 환각률로 상대적으로 낮은 수치를 기록했습니다.
* 복잡한 문제 해결 능력: GPT-5.5와 DeepSeek V4 Pro는 거대한 크기에도 불구하고 복잡한 기술적 오류를 인지하지 못하고 잘못된 해결책을 제시하는 반면, GLM-5.2는 더 적은 리소스와 시간으로 문제의 본질을 파악했습니다. 이는 모델 크기가 커질수록 논리적 오류를 인지하거나 "모른다"고 답하는 능력이 오히려 저하될 수 있음을 시사합니다.
* 현대 LLM의 딜레마: AI 모델 개발은 단순한 성능 경쟁을 넘어, 실제 능력, 불확실성 보정(환각률), 그리고 계산 효율성이라는 세 가지 상충하는 목표(trilemma)를 동시에 고려해야 합니다. 거대 모델에 대한 맹목적인 추구는 성능 정체뿐만 아니라 오히려 성능 저하를 야기할 수 있습니다.

시사점

AI 모델의 선택과 개발은 더 이상 파라미터 수나 이론적 성능만으로 이루어져서는 안 되며, 환각률 감소, 불확실성 보정, 그리고 계산 효율성을 균형 있게 고려하는 방향으로 전환되어야 합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions