Where Does RAG Actually Cost You Money? (Episode 6)
개요
Retrieval-Augmented Generation (RAG) 시스템에서 과도한 컨텍스트 검색은 LLM 사용 비용을 증가시킬 뿐만 아니라 답변의 질을 저하시킬 수 있습니다.
주요 내용
* 과도한 검색 비용 (Over-Retrieval Tax): top_k 값을 높여 더 많은 청크(chunk)를 검색할수록 프롬프트에 포함되는 토큰 수가 늘어나 LLM 사용 비용이 증가합니다. 이 추가 비용은 검색된 청크가 실제로 유용하지 않은 경우 낮은 효율을 보입니다.
* 주의력 비용 (Attention Tax) - "Lost in the Middle" 현상: LLM은 긴 프롬프트에서 중간에 위치한 정보보다 시작이나 끝에 있는 정보를 더 중요하게 처리하는 경향이 있습니다. 과도한 컨텍스트는 올바른 답변을 포함하고 있음에도 불구하고 LLM이 이를 놓치거나 중요도를 낮게 평가하게 만들어 답변의 질을 저하시킬 수 있습니다.
* 재랭킹(Reranking)을 통한 비용 절감: 검색 단계에서 많은 후보 청크를 저렴하게 가져온 후, 더 정확한 관련성 점수를 매기는 재랭킹 단계를 거쳐 상위 몇 개의 청크만 LLM에 전달하는 방식은 비용을 절감하면서도 답변의 질을 향상시킬 수 있습니다. 이는 더 저렴한 초기 단계에 비용을 지출하여 비싼 후반 단계를 절약하는 전략입니다.
* 잘못된 계층에서의 비용 지불: 검색 품질이 낮을 때 더 크고 강력한 모델을 사용하는 것은 근본적인 문제를 해결하기보다는 비용을 증가시키는 방식입니다. 더 나은 검색, 재랭킹, top_k 값 조정과 같은 근본적인 해결책이 더 저렴하게 문제를 해결할 수 있습니다.
* 수치화된 예시: top_k=10에서 약 3,000개의 프롬프트 토큰을 사용하는 대신, 재랭킹을 통해 top_k=30 후보 중 상위 3개를 선택하면 약 900개의 프롬프트 토큰으로 줄어들어 3배의 토큰 비용 절감과 더 나은 답변 품질을 기대할 수 있습니다.
* 비용 항목: LLM 입력 토큰 비용, 답변 품질 저하 (Lost in the Middle), 재랭킹 연산 비용, 더 비싼 모델 계층 사용 비용, 지연 시간 증가, 엔지니어링 시간, 사용자 신뢰도 하락 등이 RAG 시스템의 비용으로 고려될 수 있습니다.
시사점
과도한 컨텍스트 검색은 LLM 비용 증가와 답변 품질 저하의 직접적인 원인이 되므로, 단순히 더 많은 정보를 제공하는 것보다 검색된 정보의 품질과 관련성을 높이는 것이 중요합니다. 가장 효율적인 RAG 시스템은 가장 적은 양의, 가장 잘 선택된 정보를 제공하는 시스템입니다.
댓글
GitHub Discussions