BalanceRAG: 계층적 검색 증강 생성 (Cascaded RAG)을 위한 공동 위험 보정 (Joint Risk Calibration)
요약
BalanceRAG는 모든 쿼리에 RAG를 적용하는 대신, LLM 단독 답변의 신뢰도를 먼저 평가하고 불확실할 때만 RAG를 사용하는 계층적 RAG(Cascaded RAG) 구조를 제안합니다. 이 연구는 두 단계의 불확실성 임계값을 최적화하여 시스템 전체의 오류율을 제어하면서도 검색 효율성을 극대화하는 공동 위험 보정(Joint Risk Calibration) 기술을 다룹니다. 실험을 통해 BalanceRAG가 불필요한 검색 호출을 줄이면서도 높은 정답 커버리지를 유지함을 입증했습니다.
핵심 포인트
- 계층적 RAG(Cascaded RAG)를 통해 LLM 단독 답변과 RAG 폴백 간의 효율적인 전환 구조 제안
- 순차적 그래픽 검정(Sequential Graphical Testing)을 활용한 2차원 격자 기반의 임계값 보정 방식 도입
- 목표 위험 수준을 준수하면서도 더 많은 정답 사례를 보존하는 위험 적응형 임계값 설정 가능
- 다중 위험 보정 확장을 통해 선택 조건부 위험 제어 및 검색 사용량 제한 가능
- 기존 Always-on RAG 방식 대비 불필요한 검색 호출을 줄여 비용 및 자원 효율성 향상
대규모 언어 모델 (LLMs)은 검색 증강 생성 (Retrieval-Augmented Generation, RAG)을 통해 사실성을 향상할 수 있지만, 모델 단독 답변이 신뢰할 수 있는 경우에는 모든 쿼리에 RAG를 적용하는 것이 불필요합니다. 이는 계층적 RAG (Cascaded RAG)의 동기가 됩니다. 즉, 각 쿼리는 먼저 LLM 단독 분기 (LLM-only branch)에서 처리되며, 기본 분기가 불확실한 경우에만 RAG 폴백 (RAG fallback)으로 격상되고, 두 분기 모두 충분히 신뢰할 수 없는 경우에는 답변을 거부 (abstain)합니다. 그러나 이러한 계층 구조를 단계별로 보정하는 것은 보수적일 수 있는데, 최종 효용이 LLM 단독 분기와 RAG의 공동 불확실성 임계값 설정 (joint uncertainty thresholding)에 달려 있기 때문입니다. 본 연구에서는 목표 위험 수준 (target risk level)에서 임계값 쌍을 인증하기 위한 BalanceRAG를 개발합니다. 두 분기에서 얻은 불확실성 점수 (uncertainty scores)가 주어지면, BalanceRAG는 각 임계값 쌍을 2차원 격자 (two-dimensional lattice) 상의 동작 지점 (operating point)으로 프레임화하고, 순차적 그래픽 검정 (sequential graphical testing)을 사용하여 안전한 동작 지점을 식별합니다. 이를 통해 수락된 지점들 사이에서 시스템 수준의 오류율을 제어하면서도 더 많은 사례를 유지하는 위험 적응형 임계값 보정 (risk-adaptive threshold calibration)이 가능해집니다. 나아가 BalanceRAG는 다중 위험 보정 (multi-risk calibration)으로 확장되어, 선택 조건부 위험 (selection-conditioned risk)과 함께 검색 사용량을 제한할 수 있습니다. 다양한 LLM 백본 (backbones)을 사용한 세 가지 오픈 도메인 질의응답 (QA) 벤치마크에서의 실험을 통해, BalanceRAG가 규정된 위험 수준을 충족하고, 더 높은 커버리지와 더 많은 수락된 정답 사례를 보존하며, 항상 켜져 있는 (always-on) RAG 방식에 비해 불필요한 검색 호출을 줄인다는 것을 입증했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기