RollVerify: 효율성과 정확도를 연결하는 롱테일 롤아웃 강화학습
요약
본 논문은 LLM의 추론 및 일반화 능력을 향상시키는 강화학습(RL) 과정에서 발생하는 효율성 및 정확도 문제를 다룹니다. 기존 방식들이 오프-폴리시 샘플 사용으로 인한 성능 저하를 겪는 한계를 극복하기 위해, RollVerify라는 경량 RL 프레임워크를 제안합니다. 이 프레임워크는 부분 롤아웃 기반의 궤적을 능동적으로 검증하고 복구하여 고품질 샘플을 확보하는 것이 핵심입니다.
핵심 포인트
- RollVerify: 효율성과 정확도를 동시에 잡은 경량 RL 프레임워크 제시
- 오프-폴리시 시프트 메트릭(OPS) 도입으로 궤적의 편차 정량화
- 시퀀스/토큰 레벨 검증을 통해 유효하지 않은 접미사 제거
- 온-폴리시 학습에 근접한 정확도를 유지하며 학습 비용 절감
강화학습(RL)은 대규모 언어 모델(LLM)의 추론 및 일반화 능력을 향상시키는 데 매우 중요합니다. 이는 컨텍스트 창이 커짐에 따라 길이가 점점 롱테일(long-tail)로 길어지는 방대한 롤아웃(rollout)에 의존합니다. 온-폴리시(on-policy) 학습에서 이러한 롱테일 롤아웃은 GPU 버블을 초래하여 시스템 활용도를 낮추고 RL 확장성을 제한할 수 있습니다. 비동기식 또는 부분 롤아웃 방식은 동기화를 완화하여 처리량을 개선하지만, 필연적으로 최종 정확도에 손상을 줄 수 있는 오래된 오프-폴리시 샘플(궤적)을 도입합니다. 기존 접근 방식들은 주로 학습 중에 오프-폴리시 샘플의 가중치를 재조정함으로써 이 오프-폴리시 문제를 완화하지만, 여전히 완전한 온-폴리시 학습과 비교했을 때 성능 격차를 남길 수 있습니다. 본 연구에서는 단순히 학습 중 샘플을 재가중치화하는 대신, 부분 롤아웃을 기반으로 구축된 경량 RL 프레임워크인 RollVerify를 제안합니다. 이는 샘플이 학습에 들어가기 전에 능동적으로 검증하고 복구합니다. 구체적으로, 부분적으로 생성된 궤적의 오프-폴리시 편차를 정량화하는 오프-폴리시 시프트 메트릭(OPS)을 도입합니다. OPS 제약 조건에 따라 RollVerify는 시퀀스 레벨과 토큰 레벨 검증을 모두 수행하여 궤적의 유효하지 않은 접미사(suffix)를 식별하고 잘라냅니다. 이를 통해 모델의 정확도를 보호하는 동시에 부분 롤아웃의 효율성 향상을 유지하는 고품질 샘플을 얻을 수 있습니다. 수학 및 도구 지원 수학 추론에 대한 실험 결과는 RollVerify가 온-폴리시 학습과 비교할 만한 정확도를 달성하면서도 학습 비용을 줄인다는 것을 보여줍니다. 추가적인 코드 생성 결과는 수학 분야를 넘어선 예비 증거를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기