RRC: 순위 기반 보상 구축을 통한 LLM 강화학습 내 생성형 보상 모델의 잠재력 활용
요약
생성형 보상 모델의 잠재력을 강화학습(RL)에서 극대화하기 위한 RRC(Ranking-based Reward Construction) 방법론을 제안합니다. 기존 스칼라 점수 방식과 생성형 모델 간의 불일치를 해결하기 위해 순위 기반 보상을 구축하여 학습 성능을 개선합니다.
핵심 포인트
- 생성형 보상 모델과 기존 RL 알고리즘 간의 패러다임 불일치 해결
- 자기 경쟁적 순위 지정 및 앵커 가이드 순위 지정 전략 도입
- 상대적 선호 순위를 활용하여 더 효과적인 RL 학습 신호 제공
- 대화 및 추론 벤치마크에서 기존 방식 대비 일관된 성능 향상 입증
최근 보상 모델링 (reward modeling)의 발전은 판별형 보상 모델 (discriminative reward models)에서 생성형 보상 모델 (generative reward models)로의 패러다임 전환을 보여주고 있습니다. 그러나 응답 순위 지정 (response ranking)에서의 강력한 능력에도 불구하고, 생성형 보상 모델은 강화학습 (RL)에서 그 잠재력을 완전히 실현하지 못했습니다. 우리의 분석에 따르면, 이러한 한계는 생성형 보상 모델링의 비교적 특성 (comparative nature)과 기존 RL 알고리즘이 채택하고 있는 스칼라 점수 산정 패러다임 (scalar scoring paradigm) 사이의 불일치에서 발생합니다. 이 간극을 메우기 위해, 우리는 상대적 선호 순위 (relative preference rankings)로부터 보상을 도출함으로써 생성형 보상 모델이 더 효과적인 RL 학습 신호를 제공할 수 있도록 하는 순위 기반 보상 구축 (Ranking-based Reward Construction, RRC) 접근 방식을 제안합니다. RRC는 두 가지 상호 보완적인 전략을 도입합니다: 샘플링된 응답들 간의 비교를 활용하는 자기 경쟁적 순위 지정 (self-competitive ranking), 그리고 소수의 참조 응답 세트를 통해 확장 가능한 순위 기반 보상 구축을 가능하게 하는 앵커 가이드 순위 지정 (anchor-guided ranking)입니다. 개방형 대화 및 추론 벤치마크 전반에 걸친 실험을 통해, RRC가 생성형 보상 모델을 사용한 RL 학습을 실질적으로 개선하며, 기존의 보상 구축 방식들에 비해 일관된 성능 향상을 달성함을 입증했습니다. 우리의 코드는 https://github.com/wangclnlp/RRC 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기