일반 선호도 강화학습 (General Preference Reinforcement Learning)
요약
본 논문은 LLM 정렬(alignment)의 두 가지 주요 경로인 온라인 RL과 선호도 최적화 간의 격차를 해소하기 위해 일반 선호도 강화학습(GPRL)을 제안합니다. GPRL은 응답을 다차원 부분 공간에 임베딩하고, 불완전한 스칼라 보상 대신 구조화된 비교 기반의 일반 선호도 모델(GPM)을 사용합니다. 이를 통해 단일 축 착취나 보상 해킹에 강인하며, AlpacaEval 2.0에서 높은 성능을 달성하여 기존 방법론들을 능가함을 입증했습니다.
핵심 포인트
- LLM 정렬의 한계: 온라인 RL은 프로그램적 검증기에 의존하고, 선호도 최적화는 지속적인 탐색에 어려움이 있습니다.
- GPRL 제안: 응답을 다차원 부분 공간에 임베딩하고 구조화된 비교(General Preference Model)를 사용하여 일반 선호도를 모델링합니다.
- 강인한 학습 메커니즘: GPRL은 차원별 상대적 이점 계산, 자체 스케일 정규화, 폐쇄 루프 드리프트 모니터 등을 통해 단일 축 착취와 보상 해킹에 저항합니다.
- 성능 입증: Llama-3-8B-Instruct를 기반으로 AlpacaEval 2.0에서 높은 승률을 달성하며 기존 방법론(SimPO, SPPO)보다 우수한 성능을 보여줍니다.
사후 학습 (Post-training)은 거대 언어 모델 (LLM) 정렬 (alignment)을 크게 두 개의 분리된 경로로 나누었습니다. 검증 가능한 보상 (verifiable rewards)을 사용하는 온라인 강화학습 (Online RL)은 수학 및 코드에서의 창발적 추론 (emergent reasoning)을 유도하지만, 개방형 작업 (open-ended tasks)에 도달할 수 없는 프로그래밍 방식의 검증기 (programmatic verifier)에 의존합니다. 반면 선호도 최적화 (preference optimization)는 개방형 생성 (open-ended generation)을 다루지만, 온라인 RL을 구동하는 지속적인 탐색 (continuous exploration)을 포기합니다. 이 격차를 줄이려면 개방형 품질에 대한 검증기가 필요하지만, 스칼라 보상 모델 (scalar reward model)은 이 작업에 적합한 형태가 아닙니다. 품질은 다차원적이며, 어떤 스칼라 점수든 불완전한 대리 지표 (proxy)가 되어 온라인 RL이 점수에 가장 민감한 축으로 붕괴되도록 만듭니다. 우리는 대신 응답을 $k$개의 반대칭 부분 공간 (skew-symmetric subspaces)에 임베딩하고, 선호도를 구조화되고 비이행성 (intransitivity)을 인식하는 비교로 표현하는 일반 선호도 모델 (General Preference Model, GPM)로 눈을 돌립니다. 이를 바탕으로, 우리는 $k$-way 구조를 정책 업데이트 (policy update)까지 이어가는 일반 선호도 강화학습 (General Preference Reinforcement Learning, GPRL)을 제안합니다. GPRL은 차원별 그룹 상대적 이점 (per-dimension group-relative advantages)을 계산하고, 특정 축이 지배하지 않도록 각 차원을 자체 스케일로 정규화하며, 문맥 의존적 고유값 (context-dependent eigenvalues)을 사용하여 이를 집계합니다. 동일한 구조는 단일 축 착취 (single-axis exploitation)를 감지하고, 차원의 가중치를 재설정하고 신뢰 영역 (trust region)을 좁힘으로써 이를 즉시 수정하는 폐쇄 루프 드리프트 모니터 (closed-loop drift monitor)를 구동합니다. $ exttt{Llama-3-8B-Instruct}$에서 시작하여, GPRL은 AlpacaEval 2.0에서 길이 제어 승률 (length-controlled win rate) $56.51%$를 달성하는 동시에, 확장된 학습 과정 전반에서 보상 해킹 (reward hacking)에 저항함으로써 Arena-Hard, MT-Bench, WildBench에서 SimPO 및 SPPO를 능가합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기