행동 제어를 위한 벡터 유도 정책 최적화(VSPO) 방법론
요약
언어 모델이 답변의 상세함이나 전문성 같은 부차적인 행동 선호도를 학습할 때 발생하는 희소 보상 문제를 해결하기 위한 VSPO(Vector-Steered Policy Optimization) 방법론을 제안합니다. VSPO는 스티어링 벡터를 사용하여 다양한 강도로 롤아웃을 샘플링하도록 GRPO를 수정하며, 이를 통해 모델이 스티어링 벡터를 내재화하는 온-정책 잠재 자기 증류 효과를 얻습니다. 실험 결과, VSPO는 작업 정확도를 유지하면서도 목표 행동에 대한 제어력을 기존 방식보다 효과적으로 개선함을 입증했습니다.
핵심 포인트
- 희소한 행동 보상 병목 현상을 해결하기 위해 스티어링 벡터를 활용한 VSPO 방법론 도입
- 다양한 스티어링 강도로 롤아웃을 샘플링하여 희귀 행동을 업샘플링하고 데이터 다양성 확보
- 온-정책 잠재 자기 증류(On-policy Latent Self-distillation)를 통한 정책 최적화 가속화
- 기존의 보상 형성(Reward Shaping) 방식보다 우수한 반복 복잡도(Iteration Complexity) 증명
- 설명 전문성, 확신 표현, 강건성, 상세함 등 다양한 행동 제어 목표에서 성능 검증
현대의 언어 모델(Language Models)은 기본 정확도 목표를 최적화하는 동시에, 답변의 상세함(Verbosity), 수용성(Agreeableness), 또는 기술적 전문성 수준과 같은 부차적인 행동 선호도(Behavioral Preferences)를 수용해야 하는 경우가 많습니다. 실제로 베이스 모델(Base Model)은 원하는 행동을 매우 드물게 나타내거나 전혀 나타내지 않을 수 있습니다. 따라서 모델에 목표 행동을 부여하는 과정은 희소한 행동 보상 병목 현상(Sparse Behavioral Reward Bottleneck)을 야기합니다. 이러한 다중 목표 문제(Multi-objective Problems)를 해결하기 위해, 우리는 생성된 롤아웃(Rollouts)의 행동 강도를 제어하기 위해 목표 행동과 관련된 스티어링 벡터(Steering Vector)를 사용하는 벡터 유도 정책 최적화(Vector-Steered Policy Optimization, VSPO)를 소개합니다. VSPO는 다양한 스티어링 강도(Steering Intensities)로 롤아웃을 샘플링하도록 GRPO를 수정하여 얻어집니다. 이 과정은 모델이 자신의 스티어링 벡터를 내재화하는 온-정책 잠재 자기 증류(On-policy Latent Self-distillation) 절차로 해석될 수 있습니다. 스티어링 강도를 변화시킴으로써, VSPO는 희귀한 행동을 업샘플링(Upsampling)하고 롤아웃의 다양성을 풍부하게 하여, 희소 보상 문제를 완화하고 정책 최적화(Policy Optimization)를 증명 가능한 수준으로 가속화합니다. 포괄적인 이론과 실험을 통해, 우리는 VSPO가 일반적인 보상 형성(Reward Shaping) 및 기타 대안적 접근 방식과 비교하여 유리한 특성을 가짐을 입증합니다. 구체적으로, 밴딧 추상화(Bandit Abstraction) 하에서 스티어링으로 유도된 분포가 목표 행동과 충분히 일치할 때, VSPO는 보상 형성된 GRPO보다 더 나은 반복 복잡도(Iteration Complexity)를 달성함을 증명합니다. 우리는 설명 전문성(Explanation Expertise), 확신 표현(Confidence Expression), 오도하는 문맥에 대한 강건성(Robustness to Misleading Context), 그리고 답변 상세함(Response Verbosity)이라는 네 가지 목표 행동에 대해 MATH 및 MMLU-Pro를 포함한 여러 추론 벤치마크에서 VSPO를 평가합니다. 우리의 결과는 VSPO가 보상 형성(Reward Shaping), 교사 추적 증류(Teacher-trace Distillation), 그리고 가이드 기반 베이스라인(Guidance-based Baselines)과 비교했을 때, 작업 정확도를 유지하거나 향상시키면서 목표 행동에 따른 제어력을 일관되게 개선함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기