RECAST: 적응형 증거 라우팅을 통한 올바른 컨텍스트 학습
요약
본 논문은 기존 RAG의 한계를 극복하기 위해 RECAST(Routing Evidence through Computation, Access, and Synthesized Tools)라는 학습 프레임워크를 제안합니다. RECAST는 증거가 단순히 검색되는 것이 아니라, 여러 소스 항목에 대한 필터링, 집계, 계산 연산을 통해 능동적으로 파생되도록 합니다. 이 모델은 RouterLM과 CompilerLM을 사용하여 복잡한 추론 과정을 공식화하며, 다양한 벤치마크에서 강력한 성능 향상을 입증했습니다.
핵심 포인트
- RECAST는 증거를 검색하는 것을 넘어 계산 연산을 통해 능동적으로 파생시킵니다.
- RouterLM은 기본 연산 선택을 담당하고, CompilerLM이 실행 가능한 코드로 변환합니다.
- 다양한 벤치마크에서 기존 SOTA 모델 대비 높은 성능 향상을 보였습니다.
- 훈련된 RouterLM은 제로샷 일반화 능력이 뛰어나며 강력함을 입증했습니다.
대규모 언어 모델(LLM)은 길고 이질적인 정보 출처에 기반한 작업에 점점 더 많이 적용되고 있습니다. 기존의 검색 증강 생성(RAG)은 고정된 유사성 기반 검색에 의존하며, 에이전트형 변형(agentic variants)은 쿼리와 도구 사용을 적응시키지만 여전히 주로 검색 중심적입니다. 그러나 많은 작업에서 해결책에 필요한 증거는 단일 소스 항목에 명시적으로 존재하는 것이 아닙니다. 대신, 여러 소스 항목 전반에 걸쳐 필터링, 집계 또는 계산을 통해 파생되어야 합니다. 본 논문에서는 RECAST(Routing Evidence through Computation, Access, and Synthesized Tools)를 소개합니다. 이는 증거 구성을 이질적인 검색 및 계산 연산에 대한 순차적 의사 결정 과정으로 공식화하는 학습 프레임워크로, 증거가 단순히 검색되는 것이 아니라 능동적으로 파생되도록 합니다. 경량의 RouterLM은 기본 연산을 반복적으로 선택하고 공식화하거나, 고정된 CompilerLM이 실행 가능한 코드로 번역하도록 맞춤형 연산을 지정합니다. RouterLM이 증거가 충분하다고 판단하면, 수락된 증거를 고정된 AnswerLM에 전달하여 최종 해결책을 생성합니다. 우리는 지도 미세 조정(SFT) 후 그룹 상대 정책 최적화(GRPO)로 RouterLM을 훈련시킵니다. 여섯 가지 이질적인 벤치마크군 전반에 걸쳐 RECAST는 평균 성공률 75.6%를 달성하며, 가장 강력한 대규모 모델 기반보다 15.9% 더 우수합니다. 더욱이, 훈련을 통해 Qwen3.5-9B RouterLM은 훈련 없는 Gemini 3.5 Flash RouterLM보다 5.0% 더 나은 성능을 보입니다. 세 가지 홀드아웃(held-out) 벤치마크에서 RECAST는 평균적으로 가장 강력한 기반 모델보다 15.0% 향상되어, 작업 및 이질적인 소스 표현 전반에 걸쳐 강력한 제로샷 일반화 능력을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기