증거 유형 경쟁: 개입 데이터(Interventional Data)는 언제 언어 모델에게 인과 방향을 가르칠 수 있는가?
요약
개입 데이터가 언어 모델의 인과 추론 능력을 향상시킨다는 가설을 검증한 연구입니다. 실험 결과, 모델의 인과 방향 결정은 학습 데이터의 구성보다 추론 시점의 문맥(context)에 존재하는 증거 유형에 의해 결정됨을 발견했습니다.
핵심 포인트
- 개입 데이터 비율을 높여도 인과 방향 개선이 어려울 수 있음
- 인과 추론의 전환 스위치는 가중치가 아닌 문맥에 존재함
- 관찰된 문맥이 존재할 경우 모델의 인과적 보간 능력이 억제됨
- 활성화 패칭을 통해 중간 레이어의 관찰된 행이 전환점임을 확인
개입 데이터(Interventional data)는 모델에게 인과 추론(causal reasoning)을 가르치기 위한 황금 표준(gold standard)으로 널리 간주됩니다. 우리는 관찰된 상관관계(observational correlation)와 인과 효과(causal effect)를 대립시키는 완전히 통제된 합성 환경에서 이 가설을 테스트하였으며, 이것이 교육적으로 실패한다는 것을 발견했습니다. 두 가지가 체계적으로 반대되는 부호를 갖는 심슨의 역설(Simpson's-paradox) 세계에서는, 사전 학습(pretraining)에서 개입 샘플의 비율을 늘려도 인과 방향(causal direction)이 개선되지 않습니다. 모델의 do()-응답(do()-response) 크기는 단조롭게 증가하지만, 그 부호는 관찰된 문맥(observational context)으로부터 복사됩니다. 개입 증거(interventional evidence)가 사용될지 여부를 결정하는 것은 학습 혼합물(training mixture)이 아니라 추론 시점에 문맥에 존재하는 증거 유형입니다. 동일한 학습 레시피 하에서, 순수하게 관찰된 문맥은 50개 세계 중 29개에서 체계적인 부호 반전(sign reversal)을 유도하고, 혼합된 문맥은 19/50에서 유도하는 반면, 정렬된 개입 프로브(interventional probes)만 사용했을 때는 41/50의 정확도를 보였습니다. 문맥에서 관찰된 증거를 제거하면 억제되었던 인과적 보간 능력(causal interpolation ability)이 즉시 해제됩니다 (ratio_true = +0.56). 4단계 콘텐츠 조작 실험은 이 전환이 콘텐츠에 의해 매개되며 단계적으로 일어남을 보여줍니다. 이러한 억제 현상은 학습 시드(training seeds) 전반에 걸쳐 안정적이며(매칭된 프로토콜의 두 번째 시드에서도 11/11의 강력한 반전이 지속됨), 0.93B 파라미터 규모에서도 비율로서 견고하게 나타납니다 (매칭된 프로브 전용 실험군에서 31.8% vs 6%의 반전 발생). 비록 절대적인 이득은 4배 감소하더라도 말입니다. CLadder에 대한 외부 감사 결과, 2개 층 구조를 가진 학습된 양의 효과 사전 확률(positive-effect prior)이 드러났습니다: 부호를 무작위화하여 재학습하면 분포 내(in-distribution)에서는 제거되지만 분포 외(out-of-distribution)에서는 제거되지 않습니다. 요약하자면: 능력은 가중치(weights)에 존재하고, 전환(switch)은 문맥(context)에 존재하며, 활성화 패칭(activation patching)을 통해 이 전환이 중간 레이어의 관찰된 행(observational rows)에 국한됨을 확인할 수 있습니다. 우리는 더 나아가 프로브 기반의 인과 평가(probe-based causal evaluation)의 샘플링 노이즈 플로어(sampling noise floor)와 부호 오류를 26%에서 9%로 줄이는 증거 평균화 프로토콜(evidence-averaging protocol)을 정량화합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기