Why Your LLM Classifier Doesn't Need the Taxonomy: Hypothetical Classification with Embeddings

개요

LLM을 활용한 무료 텍스트 쿼리 분류 작업은 흔하지만 비용이 많이 드는 작업입니다. 본 콘텐츠는 고정된 제품 분류 체계(taxonomy)를 LLM에 직접 주입하는 대신, 소형 모델이 가상 분류를 생성하고 이를 임베딩 조회로 실제 분류 체계에 매핑하는 효율적인 대안을 제시합니다.

주요 내용

* 기존 방식의 문제점: 대규모 상품 분류 체계(수백 개 이상)를 LLM 프롬프트에 포함시키면 토큰 사용량과 지연 시간이 증가하며, 소형 모델의 성능 저하를 유발할 수 있습니다. 또한, 모델이 분류 체계를 벗어나는 결과를 생성할 위험도 존재합니다.
* 가상 분류(Hypothetical Classification) 접근법: LLM에게 실제 분류 체계를 직접 제시하는 대신, 쿼리의 의미를 잘 나타내는 가상의 분류 경로를 생성하도록 요청합니다. 이는 프롬프트 크기를 대폭 줄이고 모델이 벗어날 실제 분류 체계가 없으므로 오류 발생 가능성을 낮춥니다.
* 임베딩을 활용한 가상 분류 해결: 생성된 가상 분류 경로는 임베딩 모델을 사용하여 실제 분류 체계의 벡터와 비교됩니다. 가장 유사한(유사도 점수가 높은) 실제 분류 경로를 찾아내는 방식으로, 이는 수백만 개의 경로를 문자열 매칭하는 것보다 훨씬 효율적입니다.
* 소형 모델의 장점 활용: 소형 LLM은 대규모 제약 조건 하에서 정확한 결과를 생성하는 데는 약하지만, 주어진 스타일의 텍스트를 생성하거나 패러프레이징하는 데는 뛰어납니다. 가상 분류 생성은 이러한 강점을 활용하는 작업입니다.
* 신뢰도 확보 및 실패 모드 관리:
* 어휘 드리프트(Vocabulary Drift): 생성된 가상 분류가 너무 일반적이어서 임베딩 공간에서 잘못된 실제 분류에 매핑될 수 있습니다. 이는 분류 체계 자체의 구조와 관련이 깊습니다.
* 해상도 모호성(Resolution Ambiguity): 쿼리 자체가 모호할 경우, 가상 분류도 모호해져 잘못된 실제 분류에 매핑될 수 있습니다.
* 분류 체계 변경(Taxonomy Churn): 상품 분류 체계가 자주 변경될 경우, 임베딩을 재구축해야 합니다.
* 실행 가드레일: 가상 분류와 실제 분류 간의 유사도 점수에 임계값(threshold)을 설정하여, 일정 수준 이하일 경우 더 큰 모델이나 인간 검토로 에스컬레이션하는 방식을 사용할 수 있습니다. 또한, 일반적인 용어의 가상 분류가 잘못된 결과로 이어지는 것을 방지하기 위해 블랙리스트를 활용할 수 있습니다.
* 품질 측정: 레이블링된 데이터셋 없이도, 기존의 구조화된 출력 방식과 제안된 방식의 결과를 비교하여 불일치하는 사례를 검토함으로써 품질을 평가하고 임계값을 조정할 수 있습니다.

시사점

이 접근법은 대규모 상품 분류 체계를 다루는 LLM 기반 분류 작업에서 발생하는 높은 비용과 지연 시간을 절감할 수 있는 실용적인 해결책을 제공합니다. 임베딩 기술과 소형 LLM의 강점을 결합하여 효율성을 극대화하며, 특히 분류 체계가 크고 쿼리가 짧은 환경에서 유용합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions