Why Large Language Models Fail at Tabular Prediction

개요

대규모 언어 모델(LLM)은 다양한 작업에서 뛰어난 성능을 보이지만, 테이블 형태 데이터에 대한 예측 분석과 같은 일반적인 머신러닝 워크로드에서는 성공적이지 못했습니다.

주요 내용

* LLM의 테이블 데이터 예측 실패 원인 규명 시도: 본 연구는 순수 추론 환경에서 LLM의 테이블 데이터 예측 실패에 대한 다섯 가지 가설을 체계적으로 평가했습니다.
* 실험 결과:
* 노이즈 또는 비선형 분리 가능 데이터 처리 능력 부족, 선형화된 CSV 형식으로 인한 컬럼 구조 은닉, 숫자 값 토큰화, 쿼리당 예측할 테스트 포인트 수, 입력의 차원성 등 가설 (a)-(d)는 실험을 통해 기각되었습니다.
* 차원성이 결정적인 요인으로 작용했으며, LLM만이 유일하게 차원이 증가함에 따라 정확도가 감소하는 성능을 보였습니다.
* 고전적 모델과의 비교: 252개의 구성된 고전적 모델과 비교했을 때, 2차원에서는 LLM이 지역적, 거리 기반 방법과 유사하게 예측했지만, 더 높은 차원에서는 어떤 고전적 모델도 LLM의 예측을 재현하지 못했습니다.
* 차원성에 따른 LLM 성능 저하: LLM의 예측 능력은 차원이 증가함에 따라 노이즈가 섞인 고전적 학습자와는 다르게 용해되며, 이는 LLM이 테이블 데이터 예측에서 고전적 베이스라인에 뒤처지는 이유를 설명합니다.

시사점

LLM의 테이블 데이터 예측 실패는 차원성에 민감하게 반응하는 특성 때문일 가능성이 높으며, 이는 LLM이 범용적으로 사용되는 다른 영역과 달리 테이블 데이터 분석에서는 기존 머신러닝 모델과의 격차가 존재하는 이유를 제시합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions