LoRA Speedrun – a public wall-clock leaderboard for fine-tuning techniques
개요
LoRA Speedrun은 Qwen2.5-1.5B 모델을 GSM8K 데이터셋에서 57% 이상의 정확도로 미세 조정하는 데 걸리는 실제 시간을 측정하고 비교하는 공개 리더보드를 제공합니다.
주요 내용
* 프로젝트 목표: 모듈화된 nanogpt 프로젝트의 아이디어를 파라미터 효율적 미세 조정(PEFT)에 적용하여, 고정된 작업(GSM8K), 고정된 하드웨어(단일 L40S GPU), 공개된 벽시계 시간 기록을 통해 다양한 LoRA 미세 조정 기술의 성능을 비교합니다.
* 측정 기준: 실제 훈련 시간(wall-clock time)을 기준으로 하며, 낮은 시간이 더 우수합니다.
* 하드웨어 및 데이터: NVIDIA L40S GPU 1개(48GB)와 GSM8K 훈련 데이터셋(7,473개 예제)이 고정됩니다.
* 제약 조건: 기본 모델 가중치는 고정되며, PEFT 어댑터만 훈련 가능하며, 최대 3000만 개의 훈련 가능한 매개변수로 제한됩니다.
* 기록 검증: 모든 기록은 동일한 하드웨어에서 신선한 시드(seed)를 사용하여 3회 독립적으로 재실행되어 검증됩니다. Modal의 무료 컴퓨팅 크레딧을 사용하여 누구나 시도하고 검증할 수 있습니다.
* 현재 최고 기록: @Saivineeth147가 6분 05초 만에 달성했으며, 이는 시퀀스 패킹(sequence packing)과 완료-전용 손실 마스킹(completion-only loss masking) 기술을 사용하고 2 에포크(epoch) 동안 훈련한 결과입니다. 이전 기록 대비 약 49% 단축되었습니다.
* 기술 경쟁: LoRA, QLoRA, DoRA, rsLoRA, PiSSA, LoRA+, NEFTune, Unsloth 커널 등 다양한 PEFT 기법들을 동일한 조건에서 비교할 수 있는 경쟁의 장을 제공합니다.
* 기여 방법: 사용자는 자신의 훈련 스크립트, 설정, 노트, 자체 보고 수치를 포함하여 Pull Request를 제출할 수 있습니다. CI/CD 파이프라인에서 코드 유효성 검사, 보안 검토, 그리고 Modal L40S에서 3회 재실행하여 기록의 타당성을 검증합니다.
* 주요 고려사항: 왜 Qwen2.5-1.5B 모델을 사용하는지, 왜 벽시계 시간이 FLOPs나 단계보다 우선시되는지, 왜 Modal L40S를 사용하는지에 대한 설명이 포함되어 있습니다.
시사점
LoRA Speedrun은 다양한 파라미터 효율적 미세 조정 기법들이 실제 적용 가능한 환경에서 얼마나 빠르게 작동하는지에 대한 객관적인 비교 데이터를 제공함으로써, PEFT 연구 및 개발에 실질적인 진전을 가져올 수 있습니다.
댓글
GitHub Discussions