SpecRoll: Speculative Reinforcement Learning Rollouts를 위한 Fast-Slow
요약
SpecRoll은 강화학습(RL) 과정에서 자기회귀적 롤아웃 생성의 병목 현상을 해결하기 위한 새로운 speculative rollout 엔진입니다. 두 가지 시간 척도(fast-slow)를 활용해 타겟 모델의 분포를 유지하면서도 생성 속도를 획기적으로 향상시킵니다.
핵심 포인트
- Speculative decoding을 RL 사후 학습에 최적화하여 적용
- Reflex 모듈을 통한 역전파 없는 은닉 상태 수정 메커니즘
- Fast-Slow 적응 경로를 통한 타겟 모델 분포 보존 및 효율성 증대
- GRPO 대비 최대 2.15배의 생성 속도 향상 달성
강화학습 (RL) 사후 학습 (post-training)은 대규모 언어 모델 (LLM)의 추론 능력을 향상시키지만, 자기회귀적 롤아웃 생성 (autoregressive rollout generation)은 여전히 주요한 효율성 병목 현상으로 남아 있습니다. Speculative decoding은 생성을 가속화할 수 있지만, 타겟 정책 (target policy)이 지속적으로 진화하기 때문에 RL 과정에 이를 적용하는 것은 어렵습니다. 즉, 정적인 제안자 (static proposers)는 금방 구식이 되고, 빈번한 Drafter 업데이트는 상당한 오버헤드를 발생시킵니다. 우리는 두 가지 시간 척도 (timescales)에서 적응하면서 타겟 모델의 샘플링 분포를 보존하는 speculative rollout 엔진인 SpecRoll을 소개합니다. 경량화된 미래 토큰 헤드 (future-token heads)가 병렬 제안을 생성하며, 우리가 제안하는 Reflex 모듈은 지연된 검증기 피드백 (verifier feedback)을 사용하여 역전파 (backpropagation) 없이 제한된 궤적 국소적 은닉 상태 수정 (trajectory-local hidden-state corrections)을 수행합니다. 상호 보완적인 slow path는 지속적인 성능 저하가 감지될 때만 헤드 파라미터를 업데이트합니다. SpecRoll은 이러한 메커니즘을 동시성 인식 희소 트리 검증 (concurrency-aware sparse-tree verification) 및 정확한 타겟 검증 (exact target verification)과 결합하여, 타겟 롤아웃 분포와 GRPO 목적 함수를 변경하지 않고 유지합니다. 1.5B에서 14B에 이르는 5개의 모델과 3개의 수학적 추론 데이터셋에 대해 테스트한 결과, SpecRoll은 일반적인 GRPO 대비 1.26-2.15배의 생성 속도 향상과 1.21-2.04배의 엔드투엔드 (end-to-end) 속도 향상을 달성했습니다. 또한 15개의 모든 매칭된 설정에서 생성 및 엔드투엔드 시간 모두에서 FastGRPO보다 우수한 성능을 보였으며, 평균 쌍별 엔드투엔드 이득은 1.18배였습니다. 통제된 절제 연구 (ablations)를 통해 fast 및 slow 적응 경로가 상호 보완적인 이점을 제공함을 보여줍니다. 소스 코드는 https://anonymous.4open.science/r/SpecRoll-26062006 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기