
CoRT: 루브릭 가이드 RL을 위한 토큰 수준의 신용 할당 (credit assignment)
요약
CoRT는 GRPO의 루브릭 피드백이 모든 토큰에 동일하게 적용되는 한계를 해결하기 위해 토큰 수준의 신용 할당 방식을 제안합니다. 반사실적 재생(counterfactual replay)을 통해 보상을 정교화하여 응답 수준의 성능을 향상시킵니다.
핵심 포인트
- GRPO의 스칼라 보상 방송 문제를 토큰 단위로 해결
- 반사실적 재생(counterfactual replay) 기법 도입
- 응답 수준의 GRPO 성능을 평균 4.4포인트 향상
CoRT: 루브릭 가이드 RL (Reinforcement Learning)을 위한 토큰 수준의 신용 할당 (credit assignment)
GRPO에서의 루브릭 피드백 (Rubric feedback)은 하나의 스칼라 보상 (scalar reward)으로 축소되어 모든 토큰에 균일하게 방송됩니다. CoRT는 반사실적 재생 (counterfactual replay)을 통해 이를 해결하며, 응답 수준의 GRPO 성능을 평균 4.4포인트 향상시킵니다. https://t.co/vh8vqk0tHo
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기