EviScope: 충실하고 효율적인 근거 기반 언어 모델을 위한 쌍별 반사실적 증거 진단
요약
본 글은 언어 모델의 답변 정확도만으로는 부족한 근거 기반 시스템의 한계를 지적하며, 'EviScope'라는 쌍별 반사실적 벤치마크를 제안합니다. EviScope는 질문을 고정한 채 증거를 조작하여 모델이 어떤 방식으로 작동하는지 심층적으로 진단합니다. 이를 통해 답변 정확도 뒤에 숨겨진 근거 기반 행동 패턴을 노출하고, 단순히 정답 여부를 넘어선 시스템의 신뢰성을 평가할 수 있게 합니다.
핵심 포인트
- EviScope는 쌍별 반사실적 벤치마크로, 증거 조작을 통해 모델 작동 방식을 진단합니다.
- 모델이 근거 부족, 모순 무시 등 취약점을 보이는 행동 패턴을 노출합니다.
- RAG 시스템에서 명시적인 증거-행동 게이트가 항상 우월하지 않음을 보여줍니다.
- 답변 정확도 외에 충돌 처리 능력과 근거 기반 행동 분석의 중요성을 강조합니다.
근거 기반 언어 모델 시스템은 종종 최종 답변 정확도로 평가되지만, 올바른 답변이라도 근거가 부족하거나 잘못된 출처에서 가져왔거나, 증거가 불충분하거나 모순될 때 생성될 수 있습니다. 우리는 질문을 고정하고 그 증거를 추가하거나, 제거하거나, 방해하거나, 모순되게 만듦으로써 작동하는 쌍별 반사실적 벤치마크인 EviScope를 소개합니다. EviScope-v1.1은 자동 평가를 위해 복구된 반사실적 주장과 스팬 수준의 지원 레이블을 가진 40개의 사조건 사중주(quartets)를 포함하고 있습니다. Qwen2.5-7B, Llama 3.1 8B, 그리고 Gemini 3.5 Flash로부터 생성된 960개의 골드-블라인드(gold-blind) 생성을 통해, 쌍별 지표는 답변 정확도가 숨기는 모델 의존적 근거 기반 행동을 노출합니다. 두 개의 로컬 오픈 모델에서, 명시적인 증거-행동 게이트(evidence-action gate)가 QCS에서 바닐라 RAG보다 성능이 떨어졌습니다: Qwen의 경우 0.15 대 0.50, Llama의 경우 0.10 대 0.375입니다. Gemini는 두 프롬프트 모두에서 0.944의 공동 성공률에 도달했지만, 여전히 모순 삽입 후 5%의 충돌 사례에 대해 답변했습니다. 따라서 EviScope는 단순히 답변을 점수 매기는 것이 아니라, 근거 없는 답변, 충돌 무시(conflict blindness), 그리고 잘못된 비답변 행동을 구별합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기