사실만 아는 것이 아니라 출처를 정확히 파악하기: MCP 에이전트를 위한 출처 인식 검증
요약
논문 'ProvenanceGuard'는 LLM 에이전트가 생성한 답변의 사실성(factuality)을 출처 기반으로 검증하는 후처리 계층입니다. 이 시스템은 단순히 증거를 통합하지 않고, 파이프라인 전반에 걸쳐 출처의 정체성을 유지하며 다섯 단계의 엄격한 검증 과정을 거칩니다.
핵심 포인트
- '교차 출처 혼합' 방지: 잘못된 출처 귀속 주장을 식별합니다.
- 출처 정체성 보존: 답변 생성 후에도 출처 ID를 추적하여 검증합니다.
- 다단계 검증 과정: 주장 분해, 출처 매칭, 지원 점수화 등 5단계를 거칩니다.
- 활용 분야: 환자 기록이나 연구 논문 기반의 의료 에이전트에 특히 유용합니다.
저희의 최신 논문인 ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents (Hugging Face 또는 임시로 arXiv에서 읽을 수 있습니다)는 바로 그 격차를 목표로 합니다. 저희가 중요하게 생각하는 실패 모드는 '교차 출처 혼합(cross-source conflation)'이라고 부르는 것입니다. 이는 증거의 어딘가에는 사실이지만, 잘못된 출처에 귀속되는 주장입니다. 출처를 무시하는 검증기(source-blind verifier)는 그 사실이 풀(pool) 안에 존재하기 때문에 이를 통과시킬 수 있습니다. 하지만 출처를 인식하는 검증기는 그렇지 않아야 합니다.
고객 지원 에이전트가
ProvenanceGuard는 블랙박스 MCP 에이전트 위에 놓이는 후처리(post-generation) 검증 계층입니다. 이 계층은 에이전트가 답변을 생성한 후에 실행되며, 증거를 하나의 익명화된 컨텍스트로 통합하지 않습니다. 대신 파이프라인 전체에서 출처의 정체성을 유지합니다. 이는 도구 출력과 해당 출처 ID를 포함하는 캡처된 MCP 트레이스를 재훈련 없이 읽습니다. 그런 다음 순차적으로 다섯 가지 작업을 수행합니다. 답변을 특정 주장(claim)으로 분해하고, 각 주장에 가장 관련성이 높은 출처를 찾고, 그 출처가 실제로 이를 뒷받침하는지 확인하며, 출처를 답변이 명시하거나 암시하는 출처와 비교하고, 마지막으로 주장별 출처 판결과 전역적인 답변 수준의 허용(allow) 또는 차단(block) 결정을 모두 내보냅니다.
검증 흐름. 출처 정체성은 분해(decomposition), 라우팅(routing), 지원 점수화(support scoring), 귀속 확인(attribution checking), 그리고 복구(repair)를 거치면서 보존되며, 풀링되지 않습니다. 차단된 답변은 RARR 스타일의 복구를 거쳐 재검증될 수 있습니다. 출처: 논문 그림 2.
몇 가지 설계 선택 사항을 언급할 가치가 있습니다. 저희 논문의 실험을 위해, 통제되고 오프라인 환경에서 캡처된 트레이스를 처리할 수 있도록 로컬 모델을 사용했습니다. MiniLM은 관련 출처를 찾는 데 도움을 주고, DeBERTa NLI 검증기 모델은 해당 출처가 주장을 뒷받침하는지 확인하며, 로컬 언어 모델은 답변을 주장으로 분해하는 데 도움을 줍니다. 이 검증기는 또한 문자 그대로의 값(literal values)도 면밀히 확인합니다. 즉, 출처에 없는 숫자, 날짜 또는 식별자는 문장이 그럴듯하게 들린다는 이유만으로는 통과할 수 없습니다. 보정된 결정 단계는 이러한 신호들을 결합합니다. 답변이 차단되면, RARR 스타일의 복구 단계가 출처 기반 수정(source-grounded revision)이나 안전한 대체 방안을 시도할 수 있으며, 검증기가 이를 다시 확인합니다.
우리가 평가한 것은 언급된 모델들이지, ProvenanceGuard의 필수 요구 사항은 아닙니다. 동일한 주장(claim), 출처(source), 결정 단계는 팀이 클라우드 서비스를 선호하는 경우 호스팅되는 모델에도 적용될 수 있습니다. 새로운 설정은 자체적인 테스트와 보정이 필요할 것입니다. 저희가 보고한 결과는 로컬 구성에서 나온 것입니다. 이 보수적인 결정 정책은 출처를 정확히 파악하는 것이 가장 빠른 답변을 생성하는 것보다 더 중요한 데이터 민감 검토에 적합합니다.
저희는 ProvenanceGuard를 환자 기록, 연구 논문 및 기타 도구를 사용한 의료 에이전트의 답변에 테스트했습니다. 이를 통해 281개의 실제 추적(trace)을 연구할 수 있었습니다. 의학은 유용한 테스트 대상입니다. 왜냐하면 환자의 기록에서 나온 사실과 일반적인 연구에서 나온 사실을 같은 출처로 취급할 수 없기 때문입니다. 이 방법은 에이전트가 도구 출력 및 출처 ID를 기록하는 다른 분야에서도 사용될 수 있습니다. 주요 테스트의 경우, 인간 전문가들이 시스템 개발에 사용된 데이터를 제외한 40개의 답변 세트에서 나온 361개 주장을 검토했습니다.
가장 직접적인 결과는 이렇습니다. 전문가들은 139개의 주장(claim)이 통과해서는 안 된다고 말했고, ProvenanceGuard는 그중 138개를 포착했습니다. 단 하나를 놓쳤습니다. 또한 전문가들이 지지된다고 간주한 67개 주장을 잡아내어 검토 또는 수정을 위해 보냈습니다. 이는 저희가 테스트한 신중한 설정을 반영합니다. 즉, 지원되지 않는 주장(unsupported claims)을 통과시키는 것보다 일부 지원되는 주장에 대해 재검토하는 것을 선호한다는 것입니다. 식별 가능한 출처를 가진 주장의 경우, 이 테스트에서 약 86%의 확률로 올바른 출처를 선택했습니다.
저희는 동일한 주장들에 대해 네 가지 다른 지원 확인기(support checkers)를 실행했습니다. ProvenanceGuard가 논문에서 측정한 시스템이 차단되어야 할 주장을 포착하면서 불필요한 차단을 피하는 정도에서 가장 높은 점수를 받았습니다. 이 비교에 포함된 다른 확인기들은 각 주장을 어떤 도구 출력이 지원했는지 알려주지 못했습니다. ProvenanceGuard는 그 연결을 기록하므로, 검토자는 각 주장에 대해 확인된 출처와 그것이 생성한 결정을 볼 수 있습니다.
| Verifier | Reject/block F1 | 주장-출처 ID 생성 여부 |
|---|---|---|
| ProvenanceGuard (당사) | 0.802 | 예 |
| MiniCheck | 0.783 | 아니오 |
| RAGAS Faithfulness | 0.758 | 아니오 |
| AlignScore | 0.662 | 아니오 |
| SummaC-ZS | 0.436 | 아니오 |
동일하게 분리된 주장 패킷에 대한 이진 지원 지표. ProvenanceGuard는 차단(blocking) 측면에서 출처를 무시하는 기준선보다 높거나 같으며, 또한 주장별 출처 판결을 생성합니다. 출처: 논문 초록 및 표 III.
여러 유사한 출처가 있는 별도의 더 어려운 테스트에서 ProvenanceGuard는 어떤 주장을 차단할지 결정하는 데 0.846의 F1 점수를 기록했지만, 주장 중 정확한 출처를 식별한 비율은 50.3%였습니다. 유사한 출처들을 구별하는 것은 여전히 중요한 개선 영역으로 남아 있습니다.
또한 잘못된 귀속(attribution)에 초점을 맞춘 통제된 테스트를 수행했습니다. 이 테스트에서는 지지 증거는 그대로 두고 50가지 사례에서 명시된 출처만 변경했습니다. ProvenanceGuard는 50개의 스왑을 모두 포착했습니다. 이는 시스템이 명확한 출처 오류를 감지할 수 있음을 보여주며, 반면 더 어려운 테스트는 여러 그럴듯한 출처 중에서 선택하는 어려움을 보여줍니다.
차단(Blocking)은 차단된 답변에 대해 조치할 것이 있을 때만 유용합니다. RARR 스타일의 복구 루프에 연결되어 전체 추적 실행을 통해 173개의 차단된 답변을 모두 해결했지만, 이 중 144개는 실질적인 재작성(rewrite)보다는 폴백(fallback) 텍스트로 끝났습니다. 이는 시스템이 답변을 조작하기보다 검증할 수 없는 답변을 피하는 것을 선택했기 때문입니다. 재구성된 다중 출처 테스트 추적에서는, 새로운 복구 실행을 통해 처음에 차단되었던 59개의 답변을 단 두 번의 최종 폴백만으로 모두 해결했습니다. 오프라인 게이트(gate)로서 오버헤드는 적당하며, 보고된 로컬 구성에서 답변당 대략 반 초 정도가 소요되며, NLI 및 라우팅 호출 자체는 수십 밀리초에 불과합니다.
에이전트가 단일 패시지 RAG(Retrieval-Augmented Generation)에서 다중 도구 MCP(Multi-Tool Component Protocol) 환경으로 이동함에 따라, 어떤 출처에서 특정 사실이 실제로 왔는지 여부는 더 이상 각주가 아니라 '사실성(factuality)'의 의미 자체를 구성하는 부분이 됩니다. ProvenanceGuard는 이러한 출처 연결을 주장(claim)별로 가시화합니다. Multiverse Computing에게 이는 민감한 추적 기록(sensitive traces)을 필요할 때 통제된 환경에 보관하면서 기존 에이전트를 검사할 수 있는 방법을 의미합니다. 의료 연구가 하나의 사용 사례이며, 이와 동일한 접근 방식은 에이전트의 추적이 도구와 출처를 보존하는 모든 곳에 적용될 수 있습니다.
이러한 적응은 이미 NVIDIA NVFlow에서 확인할 수 있는데, 여기서는 금융 에이전트를 위해 선택적 근거 검증(grounding-verification) 단계를 통합했습니다. 이는 완료된 답변을 에이전트가 검색한 SEC 발췌문과 비교하여 확인하고, 원래의 롤아웃이나 학습 데이터를 변경하지 않으면서 별도의 결정 사항을 저장합니다. NVFlow의 기여는 ProvenanceGuard의 출처 인식 검증 접근 방식을 사용하며, 위에서 논의된 복구 루프(repair loop)는 더 광범위한 연구 시스템에 속합니다.
ProvenanceGuard는 또한 UC Berkeley에서 열린 Agentic AI Summit 2026 포스터로 발표되었습니다.
라우팅 및 NLI 도출 과정, 보정 제거 실험(calibration ablations), 다중 출처 스트레스 슬라이스, 그리고 전체 결과 테이블을 포함한 모든 기술적 세부 사항이 궁금하신가요? Hugging Face에서 전체 논문을 읽거나, 저희 팀에 연락하여 귀하의 에이전트에 출처 인식 검증을 적용하는 방법에 대해 상담받으세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 HuggingFace Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기