I trained a small transformer in 1.5hrs and it beats many LLMs
개요
작성자는 1.5시간 만에 5090 GPU를 사용하여 초기화부터 Transformer 모델을 훈련했으며, 이 모델은 많은 LLM을 능가하는 성능을 보여주었다.
주요 내용
- ARC-AGI 벤치마크: ARC-AGI는 적은 샘플(1000개의 퍼즐)을 사용하며 고차원 공간에서 작동하는 메타러닝 벤치마크로, 각 퍼즐은 서로 다른 규칙을 가지지만 일부 공통 개념을 공유한다. 인간에게는 매우 쉽게 해결 가능하며, AI 연구자들에게도 접근성이 높다.
- 모델 접근 방식: 입력-출력 쌍을 토큰 시퀀스로 변환하고, 이 시퀀스를 작은 Transformer 모델로 자동 회귀 훈련한다. 각 퍼즐에는 별도의 학습 가능한 임베딩을 부여하며, 2D 그리드를 위해 3D RoPE 임베딩을 사용한다. 색상 및 대칭 순열을 사용한 데이터 증강을 적용한다.
- 기존 모델 대비 개선점:
* 성능 향상: SwiGLU, RMSNorm, 8개 레이어로 모델 확장 등 현대적인 아키텍처 채택.
* 비용 절감: 데이터 증강 축소, AdamW에서 Normuon으로 최적화 알고리즘 변경, flash attention 사용.
* 훈련 방식 변경: 입력 토큰 대신 출력 토큰으로만 훈련하여 지도 학습 방식으로 전환했으며, 이는 성능 향상으로 이어졌다.
- 실험 결과:
* 새로운 모델은 ARC-1 공개 평가에서 45% 이상의 점수를 기록했으며, 일부 LLM과 동등하거나 더 나은 성능을 보였다.
* 입력 토큰 훈련 제거 시 성능이 약간 하락했지만(40% -> 44%), 모델 안정성과 점수 일관성이 향상되었다.
* 3D RoPE 및 개별 태스크 임베딩 제거 시 성능이 크게 하락했다.
- 기여 요청: 코드는 오픈 소스로 공개되어 있으며, 점수 향상 또는 비용 절감을 위한 기여를 환영한다.
시사점
이 연구는 Transformer 기반 모델이 적은 데이터로도 높은 성능을 달성할 수 있음을 보여주며, 샘플 효율성의 중요성과 함께 비용 효율적인 AI 연구 개발 가능성을 제시한다.
댓글
GitHub Discussions