청크 커버리지(Chunk Coverage)를 이용한 검색 증강 생성(RAG) 시스템 테스트
요약
RAG 시스템의 검색 구성 요소를 평가하기 위해 오라클(정답) 없이도 사용 가능한 '청크 커버리지(Chunk Coverage, CC)' 지표를 제안합니다. CC는 테스트 스위트가 코퍼스의 어느 부분을 검색했는지 측정하여 테스트 효율성을 높이고 결함 탐지 성능을 향상시킵니다.
핵심 포인트
- 오라클(정답) 없이 검색 품질을 측정하는 CC 지표 제안
- 테스트 스위트의 검색 공간 커버리지를 구조적으로 분석
- 무작위 선택 대비 도달 속도 및 결함 탐지 효율성(APFD) 개선
- 임상 및 금융 RAG 시나리오를 통한 유효성 검증 완료
검색 증강 생성 (Retrieval-Augmented Generation, RAG) 기반 시스템ootnote{간결함을 위해, 본 논문 전반에서 RAG 기반 시스템은 RAG 시스템으로 지칭합니다.}은 추론 시점에 외부 문서를 선택하는 검색(retrieval) 구성 요소뿐만 아니라 언어 모델의 정확한 동작에 의존하는 고위험 환경에 점점 더 많이 배치되고 있습니다. 기존의 RAG 평가 지표들은 참조 답변(reference answers)이나 관련성 주석(relevance annotations)과 같은 쿼리 수준의 오라클(oracle)에 의존하여 쿼리별로 검색 및 생성 품질을 평가하지만, 테스트 스위트가 시스템 전체의 검색 동작을 충분히 실행하는지에 대해서는 제한적인 통찰만을 제공합니다. 본 논문에서는 RAG 시스템의 검색 구성 요소를 테스트하기 위한 오라클 독립적 테스트 적합성 기준인 청크 커버리지 (Chunk Coverage, CC)를 소개합니다. CC는 테스트 스위트 전체에 걸쳐 최소 한 번 이상 검색된 코퍼스 청크(corpus chunks)의 비율을 측정하여, 검색 공간의 어느 부분이 실행되었는지에 대한 구조적 관점을 제공합니다. 나아가 우리는 CC를 사용하여 이전에 실행되지 않은 검색 영역의 커버리지를 확장하는 쿼리에 우선순위를 부여함으로써 테스트 선택 및 생성을 유도하는 방법을 보여줍니다. 우리는 임상 및 금융 RAG 시스템 시나리오에서 CC를 평가합니다. CC 기반 테스트는 도달 가능한 커버리지의 50%에 도달하는 속도가 무작위 선택(random selection)보다 1.7배 빠르고, 중복 편향 전략(redundancy-biased strategies)보다 4.2배 빠릅니다. 또한, CC는 무작위 방식 대비 결함 탐지 효율성 (APFD)을 10%에서 25%까지 향상시켜, 서로 다른 검색 결함을 더 조기에 발견할 수 있음을 나타냅니다. 이러한 결과는 CC가 테스트 오라클을 요구하지 않고도 효과적인 테스트와 관련된 검색 다양성을 포착함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기