RLVR에서 탐색과 최적화를 분리하는 방법
요약
본 논문은 강화학습(RLVR) 과정에서 참신성 인센티브 추가가 성능 저하를 일으키는 문제를 해결하기 위해 Exploration-Distillation (ExpDis) 프레임워크를 제안합니다. ExpDis는 탐색(exploration)과 최적화(optimization) 과정을 분리하여, 여러 탐색자 정책을 훈련하고 그 결과를 학생 정책으로 증류한 후 참신성 보너스 없이 학습시킵니다.
핵심 포인트
- 탐색과 최적화를 분리하는 ExpDis 프레임워크 제안
- 참신성 인센티브가 모델 품질 저하를 막음
- 학생 정책은 참신성 보너스 없이 훈련되어 안정적 성능 유지
- 다양하고 정확한 해답을 생성하여 pass@k 스케일링 개선
최신 언어 모델들은 이미 훈련된 체크포인트 위에 검증 가능한 보상(verifiable rewards)을 이용한 강화학습(Reinforcement Learning with Verifiable Rewards, RLVR) 과정을 거칩니다. RLVR의 핵심적인 장점은 새로운 추론 전략을 발견할 수 있다는 것입니다. 원칙적으로 모델은 이전 훈련 데이터에는 없는 참신한 아이디어를 샘플링할 수 있습니다. 하지만 실제로는 RLVR에 강력한 참신성 인센티브(novelty incentives)를 추가하는 것이 제한적인 성공만을 거두었으며, 모델의 품질을 저하시킬 수 있습니다. 검증 가능한 보상이 모델 지식과 행동의 좁은 부분만을 감독하기 때문에, 이러한 성능 저하를 되돌리기가 어렵습니다. 대신, 우리는 탐색(exploration)을 최적화(optimization)로부터 분리하는 프레임워크인 Exploration-Distillation (ExpDis)를 제안합니다. 우리는 보상에 참신성 보너스를 포함하여 하나 이상의 탐색자 정책(explorer policies)을 훈련시키고, 그들의 궤적(trajectories)을 정확성과 품질 측면에서 필터링한 다음, 이를 별도의 학생 정책(student policy)으로 증류(distill)합니다. 이후 학생 정책은 참신성 보너스 없이 훈련됩니다. 우리는 탐색과 최적화를 번갈아 가며 위의 절차를 여러 라운드 동안 반복합니다. 이러한 분리는 학생 정책의 품질을 저하시키지 않으면서도 탐색을 공격적으로 확장할 수 있게 해줍니다. 총 일곱 가지 수학 추론 벤치마크와 두 모델 계열에 걸쳐, ExpDis는 동일한 실시간 예산(wall-clock budget)에서 DAPO보다 우수한 성능을 보였습니다. 더욱이, 우리는 pass@$k$ 스케일링의 개선된 정도를 관찰했는데, 이는 ExpDis가 더 다양하고 정확한 해답을 생성하는 모델을 만든다는 것을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기