Off-Context GRPO: 특권 정보(Privileged Information)를 사용하여 어려운 문제에 대해 추론하는 법 배우기
요약
Off-Context GRPO(OC-GRPO)는 강화학습 과정에서 특권 정보(Privileged Information)를 활용해 LLM의 추론 능력을 향상시키는 새로운 방법론을 제안합니다. 모델이 정답을 찾기 어려운 상황에서 가이드를 제공하되, 중요도 보정을 통해 원래의 목적 함수를 유지하며 학습 효율을 높입니다.
핵심 포인트
- 특권 가이드를 활용해 RLVR의 학습 절벽 문제 해결
- 중요도 보정(Importance-corrected)을 통한 목적 함수 불일치 방지
- 수학 추론 벤치마크에서 표준 GRPO 대비 평균 3.9% 성능 향상
- 추가 비용을 최소화하면서 모델의 추론 성능을 효과적으로 개선
검증 가능한 보상(verifiable rewards)을 사용하는 강화학습(RLVR)은 대규모 언어 모델(Large Language Models)의 추론 능력을 향상시킵니다. 그러나 전형적인 RLVR 접근 방식은 어려운 문제에서 실패합니다. 모델이 어떠한 정답도 생성할 수 없을 때, 모델은 extit{0}의 학습 신호를 받게 됩니다. 솔루션 접두사(solution prefixes)와 같이 훈련 중에 특권 가이드(privileged guidance)를 제공하는 것은 모델을 {0이 아닌 보상을 가진 정답}으로 유도함으로써 이러한 학습 절벽(learning cliff)을 극복하는 데 도움을 줄 수 있습니다. {우리는 이러한 롤아웃(rollouts)을 extit{off-context}라고 부릅니다. 이는 특권 가이드가 포함된 훈련 프롬프트로부터 생성되지만, 목표 목적 함수(target objective)는 해당 가이드가 없는 원래의 프롬프트에 의해 정의됩니다.} {우리는} Off-Context GRPO (OC-GRPO)를 소개합니다. 이는 가이드된 롤아웃을 사용하되, 업데이트를 원래의 가이드되지 않은 목적 함수로 다시 유도하기 위해 중요도 보정(importance-corrected) 목적 함수를 적용하여, 보정되지 않은 가이드 훈련을 불안정하게 만드는 불일치(mismatch)를 방지하는 GRPO의 최소 수정 변형 모델입니다. 실증적으로, 우리의 알고리즘은 무시할 수 있는 수준의 추가 비용만으로 표준 수학 추론 벤치마크 전반에서 바닐라(vanilla) GRPO 대비 평균 3.9%의 절대적 향상(13.8%의 상대적 이득)을 달성했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기