Design, Optimization, and Deployment of a Hybrid Agentic Retrieval-Augmented Generation (Agentic-RAG) Architecture

개요

이 연구는 기존 RAG의 한계를 극복하기 위해 FAISS를 이용한 밀집 벡터 검색과 BM25를 이용한 키워드 검색을 결합하고, smolagents 프레임워크를 통해 자율적인 LLM 에이전트가 이를 제어하는 하이브리드 Agentic RAG 아키텍처를 설계, 구현 및 평가합니다.

주요 내용

  • 기존 RAG의 한계: 정적 벡터 검색만 사용하며, 어휘 불일치 문제와 복잡한 컨텍스트 검증의 어려움이 존재합니다.
  • Agentic Hybrid RAG 아키텍처:
  • 듀얼 엔진 하이브리드 검색: FAISS IndexFlatIP (L2 정규화된 임베딩)를 통한 밀집 의미 검색과 BM25Okapi를 통한 정확한 키워드 검색을 결합합니다.
  • 자율 도구 오케스트레이션: smolagents 프레임워크를 사용하여 LLM 에이전트가 검색 시점, 쿼리 작성 방식, 검색 결과 검토 등을 동적으로 결정합니다.
  • 컨텍스트 보존 청킹: 재귀적 문자 경계 분할과 300자 청크 크기, 50자 오버랩을 사용하여 의미 연속성을 유지합니다.
  • 스코어 정규화 및 융합: 서로 다른 분포를 가진 벡터 및 BM25 점수를 Min-Max 스케일링으로 정규화하고, 가중치 $\alpha=0.7$를 적용하여 밀집 벡터 검색(70%)과 키워드 검색(30%)의 융합 점수를 계산합니다.
  • 기술적 도전 과제 및 해결 방안:
  • Sandbox Import Violation: 1.5B 모델의 외부 API 호출(requests, wolframalpha) 시 발생하는 에러를 Qwen2.5-72B-Instruct로 백본 모델을 업그레이드하여 해결했습니다.
  • CPU Compute Latency: 로컬 CPU에서 213초 이상 소요되던 추론 시간을 Hugging Face 호스팅 GPU 엔드포인트로 오프로드하여 2.4초 이하로 단축했습니다.
  • API Interface Drift: smolagents 패키지 업데이트로 인한 HfApiModel → InferenceClientModel 변경 문제를 다중 버전 동적 try-except 폴백 임포트 래퍼로 해결했습니다.
  • Vocabulary Mismatch: 하이브리드 융합과 Min-Max 스케일링을 엔지니어링하여 해결했습니다.
  • 실험 결과:
  • 순수 벡터 검색 대비 하이브리드 융합 시 Semantic Recall은 0.94에서 0.95로, Exact Identifier는 0.62에서 0.93으로, Composite MRR@3은 0.81에서 0.96으로 향상되었습니다.
  • 벤치마크 테스트에서 100%의 grounding verification을 달성했으며, 사실 오류 없이 포괄적인 응답을 생성했습니다.
  • 시스템 확장 및 미래 로드맵: Knowledge graph fusion (graphRAG), Multi-agent debate and verification, Production vector DB clustering, Continuous triad metric evaluation 등을 계획하고 있습니다.

시사점

Agentic Hybrid RAG 아키텍처는 기존 RAG의 한계를 극복하고, 자율 에이전트의 의사 결정과 하이브리드 검색을 결합하여 더 나은 정보 근거, 강력한 키워드 정확도, 빠르고 사실적인 정보 합성을 제공하며 현대 엔터프라이즈 AI 아키텍처를 위한 모듈식 프레임워크를 구축할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions