내부 어텐션 발산 신호를 이용한 대규모 언어 모델의 환각 탐지
요약
본 논문은 대형 언어 모델(LLM)의 환각을 감지하기 위한 경량의 단일 패스 불확실성 정량화 방법을 제안합니다. 이 방법은 반복 샘플링이나 외부 모델 없이 주의 행렬(attention matrices)을 활용하여 불확실성을 추정하며, 구체적으로 각 어텐션 헤드의 분포와 균일 참조 분포 간의 KL 발산을 측정합니다. 실험 결과, 이 '주의 발산' 신호는 답변의 정확도를 높은 예측력으로 보여주었으며, 모델의 중간 층과 사실적 토큰에서 불확실성 정보를 제공하는 효율적인 화이트박스 지표임을 입증했습니다.
핵심 포인트
- LLM 환각 감지를 위해 경량화되고 단일 패스로 작동하는 불확실성 정량화 방법론을 제시함.
- 주의 행렬(Attention Matrices)의 KL 발산 측정치를 활용하여 모델의 불확실성을 추정하며, 이는 반복 샘플링이 필요 없음.
- 제안된 '주의 발산' 신호는 다양한 환경에서 답변 정확도를 예측하는 데 높은 성능을 보임.
- 불확실성 정보가 주로 중간 레이어와 명칭 엔티티/숫자와 같은 사실적 토큰에 집중되어 있음을 발견함.
우리는 대규모 언어 모델(Large Language Models)에서 환각(hallucinations)을 탐지하기 위한 경량의 단일 패스 불확실성 정량화(uncertainty quantification) 방법을 제안합니다. 이 방법은 어텐션 행렬(attention matrices)을 사용하여 반복적인 샘플링이나 외부 모델이 필요 없이 불확실성을 추정합니다. 구체적으로, 우리는 각 어텐션 헤드(attention head)의 분포와 균일 참조 분포(uniform reference distribution) 간의 쿨백-라이블러 발산(Kullback-Leibler divergence)을 측정하고, 이 특징들을 로지스틱 회귀 분석 프로브(logistic regression probe)에 사용합니다. 여러 데이터셋, 태스크 유형 및 모델 계열 전반에 걸쳐 어텐션 발산은 답변의 정확도와 높은 예측력을 보이며 기존 불확실성 추정 방법들과 경쟁할 만한 성능을 나타냅니다. 우리는 이 신호가 중간 레이어(middle layers)와 개체명(named entities), 숫자와 같은 사실적 토큰(factual tokens)에 집중되어 있음을 발견했으며, 이는 어텐션 역학(attention dynamics)이 모델 불확실성에 대한 효율적이고 해석 가능한 화이트박스(white-box) 신호를 제공함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기