Grounding Probes: 관찰자 모델의 은닉 상태를 이용한 생성기 독립적 환각 탐지
요약
본 논문은 검색 증강 생성(RAG) 시스템의 환각 탐지 문제를 해결하기 위해 'Grounding Probe'를 제안합니다. 이 프로브는 별도의 생성기 의존성 없이, 관찰자 언어 모델의 중간 레이어 은닉 상태를 이용해 응답이 컨텍스트에 근거하는지 판단합니다. 이를 통해 기존 방법 대비 높은 정확도와 독립성을 확보했습니다.
핵심 포인트
- Grounding Probe는 생성 모델과 분리되어 환각을 탐지합니다.
- 관찰자 언어 모델의 은닉 상태를 활용하여 성능을 높였습니다.
- 훈련-테스트 AUROC 격차를 크게 줄여 일반화 능력을 입증했습니다.
검색 증강 생성(retrieval-augmented generation)이 컨텍스트에 근거하지 않은 응답을 감지하는 것은 속도와 정확도 사이의 트레이드오프를 발생시킵니다. 표면적인 검사는 의역된 허위 정보를 놓치고, 샘플링 기반 방법은 추가 생성을 비용으로 요구합니다. 은닉 상태 프로브(Hidden-state probes)는 이 둘 사이에 위치하지만, 기존의 모든 프로브는 생성 모델 자체의 활성화 값(activations)을 읽기 때문에, 생성기가 바뀌면 탐지기도 무효화되고 폐쇄 가중치(closed-weight) 생성기는 도달하기 어렵습니다. 본 논문은 이러한 결합(coupling)을 제거합니다. Grounding Probe는 컨텍스트, 질문, 응답을 하나의 순방향 패스(forward pass)로 읽고 아무것도 생성하지 않는 관찰자 언어 모델(observer language model)의 평균 풀링된 중간 레이어 은닉 상태에 대한 로지스틱 회귀입니다. 이 프로브가 필요한 방법은 다음과 같습니다: 응답 토큰에 대해 풀링하고, 중간 레이어를 읽으며, 제어 용량(control capacity)을 갖는 것입니다. 이를 통해 훈련-테스트 AUROC 격차를 0.087-0.202에서 0.009-0.013으로 줄였습니다. 관찰자에게 직접 질문하는 것보다 은닉 상태를 읽는 것이 네 가지 모델 모두에서 최소 +0.166 AUROC의 비용을 발생시킵니다. 15,090개의 주석이 달린 응답에 맞춰 조정했을 때, 이 프로브는 네 가지 관찰자(observers) 전반에 걸쳐 RAGTruth 테스트에서 0.879-0.894 AUROC를 달성하며, 지도 학습 스팬 탐지기(supervised span detector)와 평균화된 경우 0.924 AUROC (단독 탐지기 대비 0.820 [email protected]에 더해 0.060 높음)를 달성합니다. 이 프로브는 여섯 개의 생성기에 걸쳐 유지되며, 평가 프롬프트가 훈련에 포함되지 않은 경우를 포함한 홀드아웃(hold-out) 제어들은 생성기를 제거하는 비용이 약 0.02 AUROC임을 보여줍니다. 코드, 프로브 및 예측 결과가 공개됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기