LLM-as-judge variance broke our DPO training signal for 3 weeks
Nexus Labs의 DPO(Direct Preference Optimization) 학습 파이프라인에서 단일 LLM을 선호도 판정 모델로 사용한 결과, 학습 중에는 성능 지표가 지속적으로 상승했으나 실제 프로덕션 환경에서는 정확도가 4%p 하락하는 문제가 발생했다. 이는 판정 LLM이 스스로의 레이블을 28%의 빈도로 뒤집는 높은 변동성 때문이었다.