OR Else: 정책 최적화(Policy Optimization)를 위한 미분 가능한 신뢰 영역(Differentiable Trust
요약
LLM 사후 학습 시 PPO 및 GRPO의 클리핑 목적 함수 문제를 해결하기 위한 새로운 'Output Reset(OR)' 기법을 제안합니다. 연구 결과, PPO-OR은 보상 점수 향상에 효과적이었으나 GRPO-OR은 보상 이득보다는 학습 안정성 측면에서 차이를 보였습니다.
핵심 포인트
- 클리핑 목적 함수의 급격한 도함수 변화를 해결하기 위한 OR 규칙 제안
- PPO-OR 적용 시 PPO-clip 대비 평균 보상 모델 점수 향상 확인
- GRPO-OR은 보상 점수 이득보다 낮은 분산과 오버슈트 감소 효과를 보임
- Llama-3.2-1B-Instruct 및 Anthropic hh-rlhf 데이터셋을 통한 검증
여기서 연구된 PPO 및 GRPO 베이스라인은 클리핑된 대리 목적 함수(clipped surrogate objectives)를 사용하며, 이 함수의 유리한 방향(favorable-direction) 포화는 스칼라 목적 함수의 도함수(derivative)에 급격한 변화를 일으킵니다. 우리는 매끄러운 단방향 포화 규칙(smooth one-sided saturation rule)인 Output Reset (OR)이 대규모 언어 모델(Large Language Model, LLM) 사후 학습(post-training)을 위한 유용한 대안이 될 수 있는지 질문합니다. PPO-OR 및 GRPO-OR은 클리핑된 정책 항(clipped policy term)을 롤아웃 상대적 토큰 로그 비율(rollout-relative token log-ratio) 공간에서의 OR 제곱 마진 손실(OR squared-margin loss)로 대체합니다. 이때 어드밴티지(advantage)의 부호가 업데이트 방향을 결정하며, 토큰이 유리한 마진(favorable margin)을 넘어서면 직접적인 OR 잔차(residual) 기여도는 0이 됩니다. 우리는 일반화된 어드밴티지 추정(Generalized Advantage Estimation, GAE) 하에서의 PPO-clip과 PPO-OR, 그리고 그룹 상대적 어드밴티지(group-relative advantages) 하에서의 GRPO와 GRPO-OR을 비교하였으며, Anthropic의 exttt{hh-rlhf} 데이터셋에서 하나의 공유된 보상 모델(reward model)과 방법론당 3개의 시드(seed)를 사용하여 exttt{Llama-3.2-1B-Instruct}를 활용했습니다. GAE 하에서 PPO-OR은 PPO-clip보다 평균 최종 학습 시간 보상 모델 점수가 $0.305$ 더 높았으며, 시드 간 관찰된 분산(spread)은 더 컸습니다. 그룹 상대적 어드밴티지 하에서 GRPO-OR은 더 높은 평균 점수를 기록하지는 않았으나, 더 작은 관찰된 분산, 0에 가까운 최종 OR 잔차, 그리고 감소하는 오버슈트 비율(overshoot fraction)을 보여주었으며, 반면 매칭된 GRPO 클리핑 목적 함수(clipped-objective) 궤적은 가변적인 상태로 남아있었습니다. 두 그룹 상대적 방법 모두 GAE 방법들보다 훨씬 더 큰 롤아웃 대비 현재 로그 비율 변위(rollout-to-current log-ratio displacement)를 보였으며, OR이 이를 일관되게 감소시키지는 않았습니다. 따라서 OR은 매칭된 비교군 모두에서 최적화 동작을 변화시키지만, 관찰된 보상 효과는 두 경우에서 다르게 나타납니다. $G=2$일 때, GRPO-OR의 진단 결과가 보상 점수 이득으로 이어지지는 않았습니다. 더 큰 그룹이 이 결과를 바꿀 수 있을지는 여전히 미결 과제로 남아 있습니다. 보고된 점수는 학습 시간 보상 모델 측정값이며, 홀드아웃(held-out) 인간 선호도 성능이 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기