AMTFV: LLM 자기 수정(Self-Correction)을 위한 에이전트 기반 수학적 도구 흐름 검증
요약
LLM의 수학적 문제 해결 신뢰성을 높이기 위해 에이전트 기반의 수학적 도구 흐름 검증 방식인 AMTFV를 제안합니다. 검증 모델링과 실행을 분리하여 정확한 계산을 지원하며, DeepSeek, GPT, Gemini 등 다양한 모델에서 기존 베이스라인보다 높은 성능을 입증했습니다.
핵심 포인트
- AMTFV: 중단-실행-재개 인터페이스를 통한 수학적 도구 흐름 검증 방식 제안
- 검증 모델링과 구체적 실행을 분리하여 계산의 정확성 확보
- 수학적 도구 상자 에이전트를 통해 실행 가능한 호출 및 정확한 계산 수행
- DeepSeek, GPT, Gemini 등 주요 모델 평가 결과 기존 방식 대비 성능 향상
대규모 언어 모델(Large language models)은 강력한 수학적 문제 해결 능력을 보여주었으나, 모델이 제시한 후보 답안을 신뢰성 있게 검증하는 것은 여전히 어려운 과제로 남아 있습니다. 기존의 대표적인 방법들은 주로 자연어 성찰(natural-language reflection)을 통해 출력을 수정하거나, 검증 프로그램(verification programs)을 직접 생성하여 검증을 보조합니다. 전자의 경우 정확한 계산을 신뢰성 있게 지원하지 못할 수 있으며, 후자의 경우 수학적 모델링과 저수준 구현(low-level implementation)이 조기에 결합되는 문제가 있습니다. 우리는 AMTFV (Agentic Mathematical Tool-Flow Verification)를 제안합니다. 수학적 도구 흐름(Mathematical Tool Flow, MTF)을 중단-실행-재개(interrupt--execute--resume) 인터페이스로 도입함으로써, AMTFV는 검증 모델링을 구체적인 실행으로부터 분리하고 수학적 도구 상자(mathematical toolbox)를 통해 정확한 계산을 지원합니다. 구체적으로, 검증 에이전트(verification agent)는 먼저 검증 워크플로우를 구축하고, 신뢰할 수 있는 실행이 필요한 수학적 객체와 계산 의도(computational intent)를 MTF 요청에 인코딩하여 수학적 도구 상자 에이전트(mathematical toolbox agent)로 전송합니다. 후자는 요청을 파싱하고 실행 가능한 호출(executable calls)을 생성하여 백엔드로 전달해 정확한 계산을 수행합니다. 이후 도구의 출력값은 후보 답안 판정, 답안 수정, 그리고 검증 워크플로우 수정을 지원합니다. 우리는 DeepSeek, GPT, Gemini의 7가지 모델 구성으로 5개의 도전적인 수학적 추론 데이터셋에서 AMTFV를 평가했습니다. 실험 결과, AMTFV는 본 연구에서 평가된 대표적인 베이스라인(baselines)들을 전반적으로 능가했습니다. 개별 모델 구성 하에서, AMTFV는 가장 강력한 베이스라인보다 평균 정확도를 최대 8.3%포인트 향상시켰으며, 검증 복잡도가 중간 및 높은 샘플에서 더 큰 성능 향상을 보였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기