GPT-5.5 Codex reasoning-token clustering may be leading to degraded performance

개요

GPT-5.5 Codex 응답에서 reasoning_output_tokens가 516개에 집중되는 이상 패턴이 관찰되었으며, 이는 복잡한 Codex 작업에서 성능 저하를 설명할 수 있습니다.

주요 내용

  • Codex의 token_count 메타데이터 분석 결과, GPT-5.5 응답이 516개의 reasoning_output_tokens에서 비정상적으로 높게 나타나는 집계 패턴이 발견되었습니다.
  • 516개 외에도 1034개와 1552개 부근에서 고정된 경계값 스파이크가 관찰되었습니다.
  • 이 현상은 모델별로 다르며, 전반적인 reasoning-token 강도가 낮아지는 것과 일치하여 복잡하거나 중요한 Codex 작업에서의 성능 저하를 설명할 수 있습니다.
  • 이는 GPT-5.5 실행이 516개의 reasoning 토큰에서 종료될 때 잘못된 답변을 반환했다고 보고된 이전 이슈와 관련이 있습니다.
  • GPT-5.5는 전체 응답의 19.3%만을 차지하지만, 정확히 516개인 이벤트의 82.0%를 차지하며, GPT-5.5의 정확히 516개 / 516개 이상 비율은 44.0%로 다른 모델의 1.3%에 비해 현저히 높습니다.
  • 2026년 2월부터 6월까지 GPT-5.5에서 정확히 516개 토큰에서 종료되는 비율이 급격히 증가했으며, 같은 기간 동안 평균 및 P90 reasoning-token 강도는 감소했습니다.
  • 516, 1034, 1552와 같은 고정된 값은 자연스러운 분포보다는 반복적인 임계값 경계처럼 보입니다.

시사점

GPT-5.5 Codex에서 관찰된 고정 토큰 수 클러스터링은 응답 길이 또는 추론 예산에 대한 내부 임계값 동작과 관련이 있을 수 있으며, 이는 복잡한 작업에서 성능 일관성을 저해하는 요인이 될 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions