보편적인 환각 탐지기는 없지만, 보편적인 기준점은 있다 — 사전 등록된 10개 모델.
요약
모델의 첫 토큰 생성 시점에서 순전파(forward pass) 신호를 통해 환각을 탐지하는 연구를 소개합니다. 어텐션 형태, 잔여 움직임 등 29가지 내부 신호를 분석하여 모델 및 작업별로 최적의 탐지 기준점을 제시합니다.
핵심 포인트
- 단일 보편적 탐지기는 없으나 모델별 보정된 기준점은 존재함
- 기하학적 정보와 모델 신뢰도는 상당 부분 중복됨
- 탐지 신호는 양자화 정밀도에 영향을 받지 않는 정밀도 불변성을 보임
- 사전 등록된 실험을 통해 무작위 추측보다 높은 성능을 검증함
안녕하세요. 저는 지난 1년간 ML에 대해 배우면서 하나의 집착을 추구해 온 사람입니다: 모델이 첫 토큰을 확정하는 순간 거짓말을 하는 것을 포착하는 것입니다. 텍스트를 보기 전에, 단 한 번의 순전파(forward pass), 고정된 모델 상태에서 말이죠.
저는 네 가지 내부 신호 계열(어텐션 형태(attention shape), 잔여 움직임(residual motion), 판독기 기하학(readout geometry), 신뢰도(confidence) — 총 29가지)을 적합시키고, 정직한 선택자가 모델당 하나를 고르게 한 뒤, 데이터가 존재하기 전에 모든 것을 사전 등록했습니다. 두 번이나요.
실험 1 (Run 1) — 2개의 작업, 10개 모델(총 20회 배포):
- 기하학만으로 구성된 탐지기는 사전 등록한 기준점을 넘었습니다: 20회 중 18회 성공 (필요 ≥17). 여기에 모델 자체의 신뢰도를 결합하면 동일하게 18/20이 나옵니다 — 놓친 두 번의 경우와, 구조가 더 엄격하다는 '신뢰도가 더 많이 커버한다'는 주장은 반례를 찾았습니다(기준점 ≥19). 모델의 신뢰도는 기하학적 정보와 중복됩니다.
- 보편적으로 가장 좋은 신호는 없습니다 — 18개의 작동 사례에서 12가지 다른 신호가 승리했으므로, 최고의 선택은 모델 및 작업마다 다릅니다. 하지만 보편적인 기준점은 있습니다: 아홉 개의 모델로 보정된 고정 조합을 열 번째 모델에 테스트하는 것입니다 — 각 순전파는 하나의 모델을 제외하고 그 제외된 모델의 점수를 매기며 10개 모델 전체를 순환합니다. 여전히 무작위 추측보다 높은 성능을 보여줍니다 (ANLI에서 9/10, TriviaQA에서 10/10).
실험 2 (Run 2) — HaluEval-QA(환각된 답변 포착)를 포함한 별도의 6개 작업 확장:
- 새로운 작업에 대해 모델별로 보정: 무작위 추측보다 높은 성능을 보여주며 10/10 달성했습니다.
- 제가 사전 등록했던 하나의 적용 가능한 탐지기 — 고정된 신호, 고정된 부호를 가지며 블라인드로 적용됨 — 10회 중 6회 성공. 네 번의 실패가 신호를 잃게 하지는 못합니다; 이들은 그 신호를 역방향으로 읽습니다 (AUROC가 0.17까지 낮음). 동일한 기하학, 반전된 부호입니다.
이것은 보편적인 적합 절차이자 무작위 추측보다 높은 기준점이지, 바로 상용화할 수 있는 단일 탐지기는 아닙니다. 심지어 부호조차 모델별로 설정해야 합니다.
등록된 모든 점수 행렬은 공개적입니다; 두 번의 사전 등록된 판결 모두 모델 추론 없이(python stage_b/verify_endpoints.py, GPU 불필요) 이들로부터 재도출됩니다.
부디 허점을 찾아주세요.
논문: furnace.baby/cc-paper · 코드: github.com/flowstyleliving/commit-confluence
FAQ
"환각이 단지 양자화(quantization) 아티팩트가 아닌가요?"
4비트 모델을 실행하고 계시니까요."
타당한 우려이기에, 이를 검증하기 위한 반증(falsifier)을 사전에 등록했습니다. 동일한 모델을 nf4 → int8 → bf16 → fp32 정밀도로 실행하여, 정밀도가 낮아짐에 따라 신호가 저하되는지 확인하는 방식입니다. 결과는 그렇지 않았습니다. 탐지기의 수치는 작동하는 모델들에서 정밀도 불변성(precision-invariant)을 보였습니다. 즉, 반올림 노이즈(rounding noise)가 아니라 실제 연산을 측정하고 있다는 뜻입니다. (소형 모델에서의 int8 흔들림은 32B 모델에 이르러 사라집니다.)
"당신의 연구 자체가 환각이 아니라는 것을 어떻게 믿죠? AI의 도움을 받은 거창한 주장 아닌가요?"
저를 믿지 않아도 모든 것은 검증 가능합니다. 등록된 모든 점수 행렬(score matrix)은 공개되어 있으며, 사전에 등록된 두 판결은 모델 추론 없이(zero model inference) 행렬로부터 재도출됩니다. python stage_b/verify_endpoints.py를 실행하면 GPU 없이도 요약 내용과 바이트 단위로 일치하는 결과를 재현할 수 있습니다. 사전 등록은 데이터가 존재하기 전에 새로운 분리된 시드(disjoint seed)를 사용하여 동결(hash)되었으며, 레이블을 섞은 대조군(shuffled-label controls)을 포함하고 네 차례의 적대적 검토(adversarial review)를 거쳤습니다. 제가 틀렸다면 행렬이 이를 보여줄 것입니다.
"20개 중 7개가 실패(FAIL)라고 보고하면서 신호는 괜찮다고 말씀하시네요. 어느 쪽이 맞습니까? 그리고 아주 작은 샘플만 다시 돌려본 것 아닌가요?"
둘 다 아닙니다. Run 2의 6개 작업 중 2개는 봉인된 쌍(ANLI 및 TriviaQA)을 그대로 복제한 것이지만, 5배 더 큰 새로운 분리된 데이터(n=200 → n=1000)를 사용했으므로 이는 적은 표본(small-n)에 의한 우연이 아닙니다. 원시 기하학적 구조(raw geometry)는 유지되었습니다: 배포 가능한 18개 중 18개 모두 통과했습니다. 7/20이라는 수치는 사전에 등록된 '제로 에러 예산(zero-error-budget)' 규칙에서 기인합니다. 이 규칙은 단 몇 개의 행이라도 깨끗한 YES/NO 첫 번째 토큰을 확정(commit)하지 못할 경우 해당 작업의 셀 전체를 무효화합니다. 솔직한 함정은 이렇습니다: 탐지기는 확정 순간(commit-moment)을 읽기 때문에 '답변 우선(answer-first)' 출력을 가정합니다. 만약 모델이 답변하기 전에 줄바꿈을 하거나 사고 사슬(chain-of-thought)을 시작하면, 최종 답변이 정답일지라도 해당 행은 미확정(non-commit)으로 간주됩니다. 1,000개 중 단 몇 개의 행(한 모델이 가끔 판단 대신 추론을 수행함)이 이러한 현상을 일으켰고, 이것이 FAIL을 유도했습니다. 해당 규칙은 데이터를 보기 전에 동결되었으므로 지금 완화할 수 없습니다. 정직한 헤드라인은 규칙이 산출한 수치인 7/20이며, 그 옆에 원시 기하학적 구조를 함께 제시합니다.
향후 사전 등록된 수정안(pre-registered amendment)은 일회성 오류(one-off blip)와 진정한 과업 이탈 추론(off-task reasoning)을 구분해낼 것입니다. 저는 '정답 우선 제약(answer-first constraint)'이 올바른 결정인지, 아니면 결과에 은밀하게 영향을 미치는 편향(hidden thumb on the scale)인지에 대해 진심으로 많은 이들의 검토를 받고 싶습니다.
"6/10의 전이 실패(transfer failure)는 그저 노이즈 아닌가요?"
아니요, 바로 그 부분이 흥미로운 지점입니다. 네 번의 실패는 신호(signal)를 잃어버린 것이 아니라, 오히려 신호를 거꾸로 읽고 있습니다. AUROC가 0.17만큼 낮게 나타났는데, 이는 즉 '확신에 찬 오답(confidently wrong)'을 의미합니다. 각 모델은 자신의 데이터로 보정(calibrated)되었을 때 정반대의 부호를 선택합니다. 따라서 단일한 고정된 탐지기(frozen detector)를 모델들에 무작정 적용할 수는 없습니다. 모델별로는 10/10입니다. 실패는 신호의 문제가 아니라, 구체적으로 '고정된 부호의 전이(fixed-sign transfer)'에 관한 문제입니다.
"막대 그래프가 보이지 않는 작업들은 어떻게 되나요?"
Run 2의 6개 작업 중 3개는 탐색적(exploratory) 작업이었습니다. ANLI Round 2(의도적으로 더 어려운 NLI 라운드)와 HaluEval의 대화(dialogue) 및 요약(summarization) 분할(QA 형식을 넘어선 두 가지 형식의 환각 탐지)이 이에 해당합니다. 사전 등록 규정에 따라 이 작업들은 합격/불합격 기준(pass/fail bar)을 갖지 않으며, 헤드라인 결론을 바꿀 수도 없습니다. 하지만 참고 삼아 말씀드리자면, 모델별 보정 하에서 모든 작업의 신호는 우연(chance) 이상의 수준을 유지했습니다. 즉, 25개의 모델-작업 셀(cell) 모두 신뢰 구간(confidence intervals)이 0.5를 상회했습니다. 저는 이들을 어떤 판결의 근거로 계산하지는 않지만, 그렇다고 숨기지도 않을 것입니다.
"왜 전체를 아우르는 단일 정확도 수치가 없나요?"
정직한 수치가 존재하지 않기 때문입니다. 이는 서로 다른 구성 요소와 서로 다른 사전 등록 기준을 가진 세 가지 실험입니다(18/20은 ≥17 필요, 10/10 vs 6/10은 ≥8 필요, 7/20 게이트 규칙). 이들을 평균 내는 것은 범주 오류(category error)가 될 것입니다. 단일한 숫자는 더 깔끔해 보일 수 있겠지만, 의미는 더 퇴색될 것입니다. 이 연구의 관통하는 핵심은 점수가 아니라 하나의 주장입니다. 즉, 보편적인 탐지기는 없지만, 부분적으로 전이되는 보편적인 하한선(universal floor)은 존재한다는 것입니다.
수정: isparavanje의 피드백을 반영하여 서론과 계보(pedigree) 부족 부분을 수정했습니다 :)
submitted by /u/k01234n to r/MachineLearning
[link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기