정답과 유효하지 않은 추적: 검증 가능한 초등 수학이 Chain-of-Thought 추적이 밝히는 것
요약
본 연구는 초등 수학 벤치마크 iGSM을 사용하여 Chain-of-Thought(CoT) 추적의 신뢰성을 검증했습니다. CoT가 항상 정확한 해결책과 유효하게 연결되는 것은 아니며, 특히 어려운 문제에서는 상당수의 정답이 유효하지 않은 추적을 가질 수 있음을 발견했습니다. 이는 AI 안전 및 해석 가능성 측면에서 중요한 함의를 제시합니다.
핵심 포인트
- CoT 추적은 기계적 검증이 어려워 신뢰성 테스트가 필요함.
- iGSM 벤치마크는 정답과 유효한 추적을 프로그램적으로 검증 가능하게 함.
- 어려운 인스턴스의 경우, 상당수 정답이 의미론적 의존성 검사에 실패하는 유효하지 않은 추적을 가짐.
- 훈련된 CoT 추적은 최소성을 약화시키고, 무작위 섞기나 교체는 정확도를 유지함.
Chain-of-thought 추적은 모델이 답변에 도달하는 과정을 기록한 것으로 널리 간주되어 디버깅, 에이전트 감사(auditing), 그리고 추론에 대한 주장들을 뒷받침합니다. 이러한 해석을 테스트하기는 어렵습니다. 왜냐하면 자연어 사고 추적은 기계적으로 검증되는 경우가 드물기 때문입니다. 우리는 생각하는 과정을 연구하고 학습된 추론 및 계획 주장을 지원하기 위해 설계된 합성 초등 수학 벤치마크인 iGSM에서 이를 재조명합니다. 결정적으로, iGSM은 올바른 해결책이 사용해야 하는 정확한 양과 의존성을 노출하여, 생성된 추적을 단계별로 프로그램적으로 확인할 수 있게 하며, 정답이 유효한 추적을 신뢰성 있게 동반하는지 테스트할 수 있도록 합니다. 우리는 먼저 유효하고 최소한의 추적만을 사용하여 훈련된 모델들을 평가합니다. 답변의 정확성과 추적의 유효성은 분포 내에서는 거의 일치하지만, 분포를 벗어나면 분리됩니다: 가장 어려운 인스턴스의 경우, 정답 중 31.6%가 유효하지 않은 추적을 가지며, 이 중 절반 이상은 모든 구문 및 산술 검사를 통과하지만 의미론적 의존성 검사에 실패합니다. 다음으로 우리는 추적 감독(trace supervision)에 개입합니다. 최소한이 아닌 훈련 추적은 최소한이 아닌 출력을 유도하며, 다른 질의로 동일한 문제를 다시 요청하는 것은 원래 질의에서 상속된 계산을 드러내어, 선택적 계획의 증거로서의 최소성을 약화시킵니다. 훈련 추적 문장의 토큰을 무작위로 섞는 것은 아무런 추적도 검증을 통과하지 못함에도 불구하고 분포를 벗어난 상황에서도 거의 깨끗한 정확도를 유지합니다. 마찬가지로, 교체된 훈련 추적은 높은 분포 내 정확도를 유지합니다. 우리는 이러한 발견들이 AI 안전의 맥락에서 Chain-of-thought 모니터링 및 해석에 미치는 함의에 대해 논의합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기