What happens when an LLM never sees material beyond fifth grade?

개요

LittleLearner는 5학년 이하의 초등 교육 과정으로 제한된 훈련 데이터를 사용하여 언어 모델이 지식을 습득하는 방식을 탐구하는 실험적인 5B 파라미터 모델입니다.

주요 내용

* LittleLearner 모델: 880억 토큰 규모의 미국 초등 교육 과정(K-5)에 맞춰 필터링된 'LittleCurriculum'이라는 독자적인 데이터셋으로 처음부터 훈련된 0.6B, 1.3B, 5B 세 가지 규모의 모델을 제공합니다.
* 훈련 데이터 제한의 영향: 훈련 데이터의 범위가 제한되면 모델의 성능이 해당 범위 내에서 향상되지만, 범위를 벗어난 새로운 능력은 크게 개선되지 않는다는 것을 실험 결과가 보여줍니다.
* 능력은 습득이 아닌 유도: 모델 크기 확장, SFT+GRPO 후훈련, 인컨텍스트 학습과 같은 일반적인 개선 방법들은 훈련된 내용 내에서의 성능을 향상시키지만, 훈련 범위 밖의 성능을 유의미하게 개선하지 못하며, 이는 사전 훈련 필터가 실질적인 능력 상한선을 설정함을 시사합니다.
* GRPO 후훈련의 효과: GRPO를 사용한 후훈련은 5학년 이하의 능력은 크게 향상시키지만, 5학년을 넘어서는 능력은 복구하지 못합니다.
* 인컨텍스트 학습의 한계: 테스트한 프롬프트를 사용한 인컨텍스트 학습은 5B LittleLearner 모델에서 5학년을 넘어서는 새로운 추론 능력을 발휘하지 못했습니다.
* 향후 연구 방향: LittleLearner의 제어된 노출은 RL 및 탐색, 지속적 학습, 교육 과학 분야에서 모델의 행동 변화를 직접적으로 연관 지어 연구하는 데 활용될 수 있습니다.

시사점

LittleLearner 실험은 언어 모델의 능력 상한선이 사전 훈련 데이터의 범위에 의해 결정되며, 후속 훈련이나 학습 기법으로는 이를 크게 넘어서기 어렵다는 점을 보여주어, 모델 학습의 근본적인 제약 조건에 대한 이해를 심화시킵니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions