재순위화(Reranking)를 위한 다중 관점 증거 및 추론 통합: Think Thrice Before Reranking
요약
본 논문은 LLM 기반 재순위화의 한계점인 단일 추론 경로 의존성 문제를 해결하기 위해 MERIT-Rank 프레임워크를 제안합니다. 이 방법은 다중 관점 증거 및 추론을 통합하여 질의-문서 관련성을 평가하고, 공동 재순위기를 통해 견고한 순위를 결정합니다. 또한 PRPO라는 점진적 학습 프레임워크로 랭킹 품질 개선까지 시도했습니다.
핵심 포인트
- MERIT-Rank는 다중 추론 공간(MTRS)을 공식화하여 여러 관점에서 관련성을 평가합니다.
- 공동 재순위기 도입으로 단일 경로 의존성 문제를 해결하고 견고성을 높였습니다.
- PRPO를 통해 점진적 랭크 정책 최적화를 수행하며 성능을 개선했습니다.
- 4B 모델이 대형 경쟁사 기준선들을 능가하는 우수한 성능을 입증했습니다.
대규모 언어 모델(LLMs)을 활용한 추론 기반 재순위화는 텍스트 순위 지정에서 유망한 개선을 보여주었습니다. 하지만 현재 방법들은 주로 단일 추론 경로에 의존하여, 추론 오류에 취약하고 문서 관련성을 뒷받침하는 다각적인 신호를 모델링하는 데 본질적으로 제약이 있습니다. 이러한 딜레마를 해결하기 위해, 우리는 재순위화의 견고성(robustness)을 향상시키기 위해 상호 보완적인 추론 경로를 모델링하는 프레임워크인 MERIT-Rank (Multi-perspective Evidence and Reasoning Integration for Text Reranking)를 제안합니다. MERIT-Rank는 다중 추론 공간(Multi-Trajectory Reasoning Space, MTRS)을 공식화하여 여러 관점에서 질의-문서 관련성을 평가하고, 이러한 추론 경로들을 통합된 순위 결정으로 응집하는 공동 재순위기(joint reranker)를 도입합니다. 나아가 우리는 단계적 최적화 목표를 통해 추론 경로를 안정화시키고 지속적으로 순위 지정 품질을 개선하는 점진적 랭크 정책 최적화(Progressive Rank Policy Optimization, PRPO)라는 점진적 학습 프레임워크를 개발했습니다. 추론 집약적(reasoning-intensive) 및 전통적인 검색 벤치마크 모두에서 실험 결과, MERIT-Rank는 경쟁사 기준선들보다 일관되게 우수한 성능을 달성하는 것으로 나타났습니다. 특히 4B 모델이 BRIGHT에서 대부분의 7B 심지어 32B 재순위기들을 능가하는 성능을 보였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기