ReflectRL: Golden Negative Trajectories를 통한 성찰적-직접 추론(Reflective-to-Direct
요약
ReflectRL은 전문가 모델의 실패 사례인 '골든 네거티브 궤적'을 활용하여 LLM의 추론 능력을 향상시키는 새로운 온폴리시 학습 프레임워크입니다. 결함이 있는 궤적을 성찰하여 학습한 뒤 이를 직접 추론으로 전이함으로써, 어려운 문제에서도 효율적인 성능 향상을 이끌어냅니다.
핵심 포인트
- 실패한 전문가 궤적을 '골든 네거티브 궤적'으로 정의하여 학습 신호로 활용
- 성찰적 추론을 통해 결함이 있는 궤적에서 유의미한 학습 정보를 추출
- 성찰적-직접 정책 전환을 통해 습득된 능력을 직접 추론으로 전이
- 최소한의 오버헤드로 다양한 LLM 백본과 벤치마크에서 성능 향상 입증
온폴리시 (On-policy) 학습은 대규모 언어 모델 (LLM)의 추론 능력을 향상시키기 위한 강력한 사후 학습 (post-training) 패러다임으로 부상하였으며, 종종 더 강력한 전문가 모델로부터 얻은 골든 궤적 (golden trajectories)을 통해 강화됩니다. 그러나 전문가가 더 어려운 문제에서 실패할 경우, 기존의 궤적 가이드 (trajectory-guided) 방식들은 주요 감독 소스를 잃게 되며, 이러한 실패한 궤적들은 일반적으로 부정적 샘플 (negative samples)로서 폐기됩니다. 우리는 이러한 실패를 '골든 네거티브 궤적 (Golden Negative Trajectories)'이라 명명하며, 이를 모방해야 할 시연 (demonstrations)이 아니라 성찰해야 할 결함이 있는 궤적으로 취급할 때 여전히 가치 있는 추론 신호를 제공할 수 있다고 주장합니다. 우리는 '성찰적 이점 (Reflection Advantage)'을 확인했습니다. 즉, 어려운 문제의 경우 결함이 있는 궤적을 성찰하는 것이 문제를 처음부터 직접 해결하는 것보다 더 쉽고 효과적일 수 있습니다. 이에 착안하여, 우리는 온폴리시 학습 과정에서 골든 네거티브 궤적으로부터 학습하는 경량화된 플러그 앤 플레이 (plug-and-play) 프레임워크인 ReflectRL을 제안합니다. ReflectRL은 먼저 이러한 궤적들을 사용하여 성찰적 추론 (Reflective Reasoning)을 유도한 다음, 성찰적-직접 정책 전환 (Reflective-to-Direct Policy Transition)을 적용하여 습득된 추론 동작을 직접 추론 (Direct Reasoning)으로 다시 전이시킵니다. 9개의 벤치마크, 4개의 LLM 백본 (backbones), 그리고 4개의 온폴리시 학습 방법을 통한 실험 결과, ReflectRL은 최소한의 오버헤드로 추론 성능을 일관되게 향상시킴을 보여주었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기