Knowledge Distillation of Black-Box Large Language Models (2024)

개요

이 논문은 GPT-4와 같은 독점적인 블랙박스 대규모 언어 모델(LLM)의 내부 상태에 접근할 수 없는 한계를 극복하고, 더 작은 모델로의 효율적인 지식 전달을 위해 프록시 모델을 활용하는 새로운 방법인 Proxy-KD를 제안한다.

주요 내용

* 블랙박스 LLM 지식 증류의 과제: GPT-4와 같은 성능이 뛰어난 독점 LLM의 내부 상태에 접근할 수 없다는 점은 효과적인 지식 전달을 제한하며, 고품질 출력을 활용하는 데 어려움을 야기한다.
* Proxy-KD 방법론: 이러한 한계를 극복하기 위해, 본 연구는 블랙박스 LLM으로부터 더 작은 모델로 지식을 효율적으로 전달하는 데 도움을 주는 프록시 모델을 사용하는 Proxy-KD라는 새로운 방법을 도입한다.
* 성능 향상 및 비교: 실험 결과, Proxy-KD는 블랙박스 교사 모델로부터의 지식 증류 성능을 향상시킬 뿐만 아니라, 기존의 화이트박스 지식 증류 기법보다 우수한 성능을 보인다.

시사점

Proxy-KD는 블랙박스 LLM의 내부 상태 접근 제한이라는 기존의 난제를 해결하며, 첨단 LLM으로부터 지식을 증류하는 새롭고 유망한 경로를 제시한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions