Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train

개요

본 연구는 Transformer 기반 대규모 언어 모델(LLM)의 강화학습(RL) 후훈련(post-training) 시 파라미터 업데이트가 각 레이어에 어떻게 분산되는지 탐구하며, 놀랍게도 단일 Transformer 레이어 훈련만으로도 전체 파라미터 훈련과 유사하거나 그 이상의 성능 향상을 얻을 수 있음을 발견했습니다.

주요 내용

  • 기존 RL 후훈련 방식은 모든 모델 파라미터를 균일하게 업데이트하며, 모든 레이어가 유사하게 기여한다고 가정하는 반면, 본 연구는 이러한 가정을 반박합니다.
  • 일곱 가지 모델(Qwen3, Qwen2.5), 세 가지 RL 알고리즘(GRPO, GiGPO, Dr. GRPO) 및 수학적 추론, 코드 생성, 에이전트 의사 결정 등 다양한 작업 영역에 걸친 체계적인 레이어별 연구를 수행했습니다.
  • "레이어 기여도(layer contribution)"라는 새로운 지표를 도입하여, 단일 레이어 훈련 시 복구되는 전체 RL 성능 향상의 비율을 측정했습니다.
  • 놀랍도록 안정적인 패턴을 관찰했는데, RL 성능 향상이 소수의 레이어, 특히 단일 레이어에 집중되는 경향을 보입니다.
  • 높은 기여도를 가진 레이어는 Transformer 스택의 중간 부분에 집중되는 반면, 입력 및 출력단에 가까운 레이어는 상대적으로 기여도가 낮았습니다.
  • 레이어별 기여도 순위는 데이터셋, 작업, 모델 패밀리, RL 알고리즘 전반에 걸쳐 강력한 상관관계를 유지했습니다.

시사점

본 연구 결과는 LLM의 RL 후훈련 효율성을 크게 향상시킬 수 있는 가능성을 제시하며, 향후 모델 최적화 및 효율적인 RL 학습 전략 개발에 중요한 통찰을 제공합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions