암시적 계층적 GRPO: 도구 통합 수학적 추론을 위한 도구 호출과 실행의 분리
요약
본 논문은 LLM의 추론 성능을 높이기 위해 도구 호출과 실행을 분리하는 '도구 통합 추론(TIR)' 개념을 제안합니다. 기존의 즉각적인 도구 상호작용이 추론의 일관성을 해치는 문제를 해결하기 위해 지연 실행과 계층적 제어 프레임워크를 도입한 IH-GRPO 알고리즘을 개발했습니다. 실험 결과, Qwen3 모델 시리즈를 대상으로 다양한 수학적 추론 벤치마크에서 유의미한 성능 향상을 입증했습니다.
핵심 포인트
- 도구 호출(Tool Invocation)과 실행(Execution)을 분리하여 LLM의 추론 일관성 및 표현력 강화
- 명시적 제어를 동반한 지연 실행(Delayed Execution) 방식 도입
- 암시적 계층적 정책이 명시적 정책과 동일하게 동작하도록 하는 대리 손실(Surrogate Loss) 기반의 IH-GRPO 알고리즘 제안
- Qwen3 모델(1.7B, 4B, 8B)을 활용한 수학적 추론 벤치마크에서 성능 향상 달성
대규모 언어 모델 (LLMs)은 추론 능력을 향상시키기 위해 도구 호출 (tool invocation)을 점점 더 많이 활용하고 있습니다. 그러나 기존 방식은 일반적으로 도구 호출을 즉각적인 실행 (execution)과 밀접하게 결합합니다. 이러한 즉각적인 도구 상호작용은 LLM의 추론 일관성 (reasoning coherence)을 저해하고 표현력 (expressivity)을 제한하여, 궁극적으로 추론 성능을 저하시킬 수 있습니다. 이를 위해, 본 논문에서는 최초로 추론 과정에서 도구 호출과 실행을 분리하는 문제를 제안하고 공식화하며, 도구 통합 추론 (TIR)을 강화하기 위해 명시적 제어를 동반한 지연 실행 (delayed execution)을 도입합니다. 나아가, 우리는 계층적 제어 프레임워크 (hierarchical control framework)를 제안하고, 암시적 계층적 정책 (implicitly hierarchical policy)이 명시적 계층적 정책 (explicit hierarchical policy)과 동일한 동작을 학습할 수 있게 하는 대리 손실 (surrogate loss)을 이론적으로 도출하여, 제안된 IH-GRPO 알고리즘을 이끌어냅니다. IH-GRPO에 대한 광범위한 실험 결과, 가장 강력한 베이스라인 방법 대비 6개의 도메인 외 (out-of-domain) 수학적 추론 벤치마크에서 Qwen3-1.7B, Qwen3-4B, Qwen3-8B 모델 각각에 대해 1.87%, 2.16%, 2.53%의 절대적 성능 향상을 달성하였으며, 다른 도메인에서도 일관된 성능 향상을 보여주었습니다. 우리의 코드는 https://github.com/Lumina04/IH-GRPO-01 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기