D-Score: 대규모 언어 모델(LLM)의 환각 탐지를 위한 스펙트럼 은닉 상태 신호
요약
LLM의 은닉 활성화(hidden activations) 기하학적 구조를 활용하여 환각을 탐지하는 새로운 지표인 D-Score를 제안합니다. 단 한 번의 순전파만으로 계산 가능한 스펙트럼 통계량을 통해 외부 검증 없이도 효과적으로 환각을 식별할 수 있습니다.
핵심 포인트
- 은닉 활성화 행렬의 특이값 분포를 이용한 D-Score 제안
- 추가적인 검색이나 다중 생성 없이 단일 순전파로 환각 탐지 가능
- 모델 내부의 불확실성이 은닉 궤적의 확산으로 나타난다는 직관 활용
- FAVA-Annotation 및 RAGTruth 데이터셋에서 성능 검증 완료
대규모 언어 모델(Large Language Models)은 유창하지만 사실이 아니거나, 가용한 증거에 의해 뒷받침되지 않거나, 모델 내부적으로 표현된 것으로 보이는 정보와 일치하지 않는 텍스트를 생성할 수 있습니다. 우리는 은닉 활성화(hidden activations)의 기하학적 구조로부터 환각 탐지를 연구하며, 단 한 번의 순전파(forward pass)로 계산되는 간단한 스펙트럼 통계량인 D-Score를 소개합니다. 고정된 모델, 레이어(layer), 허용 오차(tolerance) 매개변수에 대해, D-Score는 은닉 활성화 행렬의 특이 방향(singular directions) 중 특이값(singular values)이 선도적인 값(leading one)에 가깝게 유지되는 방향의 개수를 계산합니다. 우리는 이 수치를 환각 점수(hallucination score)로 사용하며, D-Score가 사전에 정의된 수치보다 클 경우 입력 텍스트를 환각된 것으로 분류합니다. 이러한 접근의 동기는 모델이 자신의 내부 상태에 존재하는 정보와 충돌하는 텍스트를 처리할 때, 은닉 표현(hidden representation)이 주장된 내용과 더불어 일종의 반대 증거, 불확실성, 수정 또는 지지 부족을 함께 인코딩할 수 있다는 점에 있습니다. 이는 은닉 궤적(hidden trajectory)이 추가적인 특이 방향으로 퍼지게 만들 수 있습니다. 우리는 경량 스펙트럼 논증(spectral argument)을 통해 이러한 직관을 공식화하고, 결과물인 탐지기를 FAVA-Annotation 및 RAGTruth에서 평가합니다. 실험 결과, D-Score는 외부 검증기(external verifier), 검색 단계(retrieval step), 다중 생성(multiple generations) 없이도 환각 탐지를 위한 강력한 은닉 상태 신호임을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기