TRACE: 환각 감소를 위한 계층 간 증거 기반 궤적 교정
요약
TRACE는 LLM의 추론 과정 중 각 계층에서 발생하는 사실적 증거의 변화를 분석하여 환각을 교정하는 training-free 알고리즘입니다. 모델 내부의 계층 간 후보 궤적을 활용해 최적의 교정 계층과 연산자를 결정론적으로 도출하며, 별도의 학습이나 외부 검색 없이도 환각을 효과적으로 감소시킵니다.
핵심 포인트
- 계층 간 사실적 증거가 균일하지 않다는 점에 착안하여, 입력마다 최적의 교정 방식(스칼라 반전, 이전 상태 복구, 후보 공간 교정)을 동적으로 선택합니다.
- 추가적인 학습(training-free), 레이블, 검색(retrieval) 과정이 전혀 필요 없는 결정론적 알고리즘입니다.
- 15개 모델과 8개 모델 제품군을 대상으로 한 실험에서 평균적으로 유의미한 사실성(factuality) 성능 향상을 입증했습니다.
- 단일 범용 알고리즘으로서 다양한 모델과 벤치마크에서 퇴보 없이 일관된 성능 개선을 보여줍니다.
환각 교정 (Hallucination correction)은 단방향적인 문제가 아닙니다. 우리는 중간 계층 (intermediate layers)이 최종 계층보다 일관되게 더 진실하거나, 혹은 일관되게 덜 신뢰할 수 있는 것이 아님을 보여줍니다. 그럼에도 불구하고 환각 감소는 대개 하나의 고정된 개입 형태를 통해 구현됩니다: 한 계층을 다른 계층과 대조하거나, 진실성 방향 (truthfulness direction)을 따라 유도(steer)하거나, 혹은 외부 증거에 의존하는 방식입니다. 이러한 프레임워크는 구조적으로 불완전합니다. 계층 간 사실적 증거 (Cross-layer factual evidence)는 균일하게 진화하지 않습니다. 어떤 실패 사례에서는 진실된 지지 정보가 내부에 존재하다가 나중에 억제되는 반면, 다른 사례에서는 후보 간의 경쟁이 깊이(depth)에 따라 진정으로 다방향성을 유지하므로, 단일한 부호가 있는 스칼라 계열 (signed scalar family)만으로는 일반적으로 충분하지 않습니다.
우리는 환각 감소를 위한 계층 간 증거 기반 궤적 교정 (Trajectory Correction from Cross-layer Evidence for Hallucination Reduction, TRACE)을 소개합니다. 이는 LLM (Large Language Model) 자체의 순전파 (forward pass) 과정 내에서 각 입력의 계층 간 후보 궤적 (cross-layer candidate trajectory)으로부터 교정 계층과 적절한 교정 연산자 (correction operator)를 모두 도출함으로써, 추론 시간 (inference time)에 환각을 교정하는 결정론적이고 학습이 필요 없는 (training-free) 알고리즘입니다. 하나의 고정된 하이퍼파라미터 (hyperparameter) 설정 하에서, TRACE는 모델 내부의 증거만을 사용하여 스칼라 반전 (scalar reversal), 이전 상태 복구 (earlier-state recovery), 그리고 후보 공간 교정 (candidate-space correction) 중에서 선택합니다.
15개의 모델, 8개의 모델 제품군, 그리고 3개의 사실성 벤치마크 (factuality benchmarks)에 걸쳐 단일 범용 알고리즘으로서 평가했을 때, TRACE는 모든 평가 셀에서 성능을 향상시켰으며, 퇴보 없이 평균적으로 +12.26 MC1 포인트 및 +8.65 MC2 스타일 포인트를 획득하였고, 최대 +47.20 MC1 및 +43.38 MC2 스타일 포인트의 이득을 달성했습니다. 이 방법은 레이블 (labels), 검색 (retrieval), 사전 학습 (pretraining), 미세 조정 (finetuning) 또는 모델별 보정 (per-model calibration)을 전혀 사용하지 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기