스코어 센트링(Score Centering)이 오프폴리시 강화학습을 안정화시킨다
요약
본 논문은 LLM 강화학습(RL)의 불안정성이 훈련-추론 불일치(TIM) 환경에서 발생하는 '드리프트'에 기인한다고 분석합니다. 이를 상쇄하는 스코어 센트링(Score Centering) 방법을 제안하여, TIM 하에서도 RL을 안정화시키는 새로운 접근 방식을 제시했습니다.
핵심 포인트
- LLM 강화학습은 훈련-추론 불일치(TIM)에 민감하다.
- RL 불안정성의 주원인은 축적되는 '드리프트'이다.
- 스코어 센트링 기법으로 드리프트를 상쇄하여 안정화한다.
대규모 언어 모델(LLM)의 강화학습(RL)은 훈련 엔진과 추론 엔진 간의 작은 차이에 매우 민감한 것으로 알려져 있으며, 이는 종종 훈련-추론 불일치(training-inference mismatch, TIM)라고 불립니다. 하지만 TIM을 완전히 제거하는 것은 롤아웃 효율성 측면에서 큰 비용이 발생하기 때문에 비실용적입니다. 본 논문에서는 RL의 불안정성이 TIM 하에서 주로 '드리프트(drift)'에 의해 발생하며, 이는 매 훈련 단계마다 축적되는 훈련 엔진과 추론 엔진 간의 지속적인 편향이라고 보여줍니다. 우리는 드리프트를 상쇄하여 TIM 하에서 RL을 안정화시키는 가법적(
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기