확산 선호도 정렬을 위한 잠재 보상 레지스터 (Latent Reward Registers)
요약
확산 모델의 정렬 과정에서 발생하는 시간적 신용 할당 문제를 해결하기 위해 '잠재 보상 레지스터'를 제안합니다. DiT 입력에 레지스터 토큰을 추가하여 중간 단계의 잠재 변수로부터 직접 보상을 추정하며, 효율적인 학습 및 추론 전략을 제공합니다.
핵심 포인트
- 레지스터 토큰을 통해 디노이징 과정 전반에 걸쳐 조밀한 보상 신호 제공
- RG-OPD 전략으로 온라인 강화학습 대비 GPU 시간 최대 33배 절감
- RGS를 통해 파라미터 업데이트 없이도 SOTA 수준의 샘플링 성능 달성
- 높은 노이즈 수준에서도 우수한 쌍별 정확도(pairwise accuracy) 입증
확산 모델 (Diffusion models)을 인간의 선호도에 맞게 정렬하는 작업은 대개 최종 생성된 샘플에 대해 평가되는 희소한 종단 보상 (sparse terminal reward)에 의존하며, 이는 다단계 디노이징 (denoising) 과정 전반에 걸쳐 심각한 시간적 신용 할당 (temporal credit-assignment) 문제를 야기합니다. 본 논문에서는 고정된 확산 트랜스포머 (Diffusion Transformer, DiT)의 입력 시퀀스에 학습 가능하고 위치에 구애받지 않는 레지스터 토큰 (register tokens)을 앞에 붙임으로써, 중간 단계의 노이즈가 섞인 잠재 변수 (noisy latents)로부터 종단 선호도를 직접 추정하는 메커니즘인 잠재 보상 레지스터 (Latent Reward Registers)를 제안합니다. 이 독립적인 판독 (readout) 메커니즘은 생성기의 은닉 상태 (hidden states)나 속도장 (velocity field)을 변경하지 않고도 잠재적 보상 증거를 추출합니다. 그 결과로 얻어지는 전체 디노이징 과정 동안의 조밀하고 미분 가능한 보상 신호는 두 가지 정렬 전략을 용이하게 합니다. 학습을 위해, 보상-경사 온폴리시 증류 (Reward-Gradient On-Policy Distillation, RG-OPD)는 표준 정책 경사 (policy gradients)의 계산 비용이 많이 드는 롤아웃 (rollouts)을 우회하여 온폴리시 궤적 (on-policy trajectories)을 따라 보상 유도 업데이트를 증류합니다. 추론을 위해, 보상 유도 샘플링 (Reward-Guided Sampling, RGS)은 파라미터 업데이트 없이 크기가 매칭된 보상 경사를 통해 궤적을 조종합니다. 실증적으로, 높은 노이즈 수준 (u = 0.8)에서 레지스터는 평가된 잠재 보상 모델들 중 가장 높은 쌍별 정확도 (pairwise accuracy)를 달성했습니다. 또한, RG-OPD는 GPU 시간을 최대 33배까지 줄이면서 온라인 강화학습 (online reinforcement learning) 베이스라인보다 뛰어난 성능을 보였으며, RGS는 훈련이 필요 없는 방법들 중 새로운 SOTA (state-of-the-art)를 구축하여 정렬 및 지각 지표 (perceptual metrics)를 엄격하게 향상시켰습니다. 코드와 가중치는 https://github.com/Guanys-dar/latent-reward-register 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기