지식이 변할 때: 변이(Mutations)를 이용한 RAG 시스템의 변형 테스트 (Metamorphic Testing)
요약
RAG 시스템이 외부 데이터 변화에 대응하는 능력을 평가하기 위해 변형 테스트(Metamorphic Testing) 프레임워크를 제안합니다. 기존 정적 평가 방식의 한계를 극복하고, 데이터 변이에 따른 시스템의 일관성을 체계적으로 검증하는 방법론을 다룹니다.
핵심 포인트
- 데이터 업데이트 및 노이즈에 따른 RAG 결함 탐지 필요성 강조
- 프리-청크 및 포스트-청크 수준의 11가지 변이 연산자 공식화
- 기존 RAGAS 지표 대비 높은 성능의 변형 오라클 성능 입증
- 검색 재설정 및 LLM 재순위화를 통한 결함 완화 방안 제시
검색 증강 생성 (Retrieval-Augmented Generation, RAG) 기반의 LLM 시스템은 시간이 지남에 따라 진화하고 변화할 수 있는 외부 문서 코퍼스 (corpora)에 의존합니다. 그러나 현재의 평가 방법론 (예: RAGAS)은 정적인 스냅샷 (static snapshots)을 기준으로 정확성을 평가하며, 일상적인 업데이트, 사실 관계의 변화, 또는 노이즈로 인해 기초 데이터가 변경될 때 발생하는 결함을 탐지하지 못합니다. 본 논문에서는 코퍼스 진화 상황에서 RAG 시스템의 일관성을 평가하는 변형 테스트 (metamorphic testing) 프레임워크를 소개합니다. 우리는 결함 분류 체계 (fault taxonomy)와, 프리-청크 (pre-chunk, 검색 인덱스) 및 포스트-청크 (post-chunk, 검색된 컨텍스트) 수준 모두에서 시스템을 체계적으로 교란하는 11가지 변이 연산자 (mutation operators)를 공식화합니다. 5개의 데이터셋과 28,000개 이상의 변이체 (mutants)를 통한 실증적 평가 결과, 4.9-10.2%의 변형 위반율 (metamorphic violation rates)이 나타났습니다. 정답 (ground truth)에 대한 메타 평가에서, 우리의 변형 오라클 (metamorphic oracle)은 0.927-1.000의 F1 점수를 달성한 반면, 가장 우수한 RAGAS 지표는 0.570에 그쳤습니다. 마지막으로, 우리는 검색 재설정 (retrieval re-configuration), 생성기 업그레이드 (generator upgrades), 그리고 LLM 기반 재순위화 (LLM-based reranking)를 통해 이러한 결함을 완화할 수 있는 실행 가능한 통찰을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기