Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train
본 연구는 Transformer 기반 대규모 언어 모델(LLM)의 강화학습(RL) 후훈련(post-training) 시 파라미터 업데이트가 각 레이어에 어떻게 분산되는지 탐구하며, 놀랍게도 단일 Transformer 레이어 훈련만으로도 전체 파라미터 훈련과 유사하거나 그 이상의 성능 향상을 얻을 수 있음을 발견했습니다.