Loss Landscapes of LLMs: The Map Beneath Gradient Descent

개요

LLM(거대 언어 모델)의 훈련은 수십억 개의 매개변수를 가진 고차원 공간에서 손실 함수를 최소화하는 과정이며, 이 과정에서 손실 경관(loss landscape)은 훈련의 난이도, 아키텍처 선택, 학습률 설정 등에 대한 중요한 통찰을 제공합니다.

주요 내용

* 손실 경관의 정의: LLM 훈련은 모델 매개변수로 이루어진 고차원 공간에서의 손실 함수 최적화이며, 이 공간의 기하학적 구조를 손실 경관이라고 합니다. 매개변수가 많을수록 차원이 높아져 시각화는 어렵지만, 수학적으로는 정의됩니다.
* 그래디언트와 헤시안: 그래디언트는 손실이 가장 가파르게 증가하는 방향을 나타내며, 그래디언트 하강법은 이 방향의 반대로 이동하여 손실을 줄입니다. 헤시안은 그래디언트의 변화율, 즉 곡률을 나타내며, 경관의 국소적인 모양을 이해하는 데 중요합니다.
* LLM 경관의 특징: 전통적인 최적화의 관점에서 예상되는 수많은 나쁜 지역 최솟값 대신, LLM의 손실 경관에서는 여러 독립적으로 훈련된 모델의 해(solution)가 저손실 곡선을 통해 연결될 수 있는 경우가 많습니다. 이는 매개변수 공간의 기하학이 복잡하고 중복성이 많기 때문입니다.
* 경관의 안장점과 평탄한 방향: 손실 경관은 매우 민감한 방향(높은 곡률)과 상대적으로 둔감한 방향(낮은 곡률, 평탄한 방향)을 모두 포함합니다. 모델의 매개변수 수가 많더라도 모든 방향이 동일하게 어렵지는 않으며, 기하학적 비등방성이 존재합니다.
* 학습률과 경관 기하학: 학습률의 적절한 설정은 경관의 국소적인 곡률, 특히 가장 가파른 방향에 크게 의존합니다. 학습률 스케줄링, 워밍업, 정규화 등 다양한 최적화 기법은 경관을 더 쉽게 탐색할 수 있도록 돕습니다.
* "날카로운" vs. "평탄한" 최솟값: 평탄한 최솟값이 더 나은 일반화 성능을 보인다는 통념이 있지만, 이는 매개변수화 방식에 따라 달라질 수 있어 주의가 필요합니다. 매개변수 공간에서의 거리가 함수 공간에서의 차이를 항상 반영하지는 않습니다.
* LLM 엔지니어링에 미치는 영향: 불안정한 훈련 실행은 학습률과 국소 곡률 간의 부조화로 해석될 수 있습니다. 배치 크기는 그래디언트 추정치의 노이즈에 영향을 미쳐 탐색하는 경로를 바꿀 수 있으며, 아키텍처 설계는 경관의 기하학 자체를 변경합니다.
* 경제적 관점: LLM 훈련은 엄청난 비용이 들기 때문에, 최적화 경관을 개선하여 훈련 단계를 줄이는 것은 상당한 경제적 이득으로 이어집니다.
* 최적점 탐색이 아닌 영역 탐색: LLM 훈련은 하나의 완벽한 전역 최솟값을 찾는 것보다는, 거대한 매개변수 공간에서 좋은 해들의 영역을 찾는 과정으로 이해하는 것이 더 적합합니다. 파인튜닝, 모델 병합, 체크포인트 평균화 등의 기법들은 이 영역 내에서의 이동 및 탐색과 관련이 있습니다.

시사점

LLM 훈련은 단순히 매개변수 수를 늘리는 것을 넘어, 복잡하고 비등방적인 손실 경관을 효율적으로 탐색하는 기하학적 문제로 이해해야 하며, 이는 최적화 하이퍼파라미터, 아키텍처 설계, 그리고 모델 활용 기법 선택에 중요한 영향을 미칩니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions