ISO: RLVR 네이티브 최적화 스택
요약
RLVR(검증 가능한 보상) 강화학습 시 모델 가중치의 스펙트럼을 재사용하는 ISO(Isospectral Optimization) 프레임워크를 제안합니다. ISO는 오프라인 방식인 ISO-Merger와 온라인 방식인 ISO-Optimizer를 통해 모델의 추론 및 코딩 성능을 효율적으로 향상시킵니다.
핵심 포인트
- 스펙트럼 상속을 통해 베이스 모델의 가중치 스펙트럼을 재사용
- ISO-Merger: 데이터 없이 전문가 모델들의 능력을 결합하는 오프라인 방식
- ISO-Optimizer: 베이스 스펙트럼을 고정하여 훈련 단계를 획기적으로 단축
- 1.5B~8B 모델의 추론 및 코딩 작업에서 높은 정확도와 효율성 입증
검증 가능한 보상(Verifiable Rewards, RLVR)을 이용한 강화학습(Reinforcement Learning, RL)은 언어 모델의 추론 능력을 빠르게 발전시키고 있지만, 보상 피드백을 가중치 공간(weight-space) 업데이트로 변환하는 최적화 계층(optimization layer)에 대해서는 여전히 이해가 부족한 상태입니다. 이전 분석(Zhu et al., 2025)을 바탕으로, 우리는 모델 가중치의 특이 구조(singular structure)를 통해 이 누락된 계층을 연구하고 '스펙트럼 상속(spectral inheritance)'을 식별했습니다. 즉, RLVR은 연관된 입력 및 출력 특이 프레임(singular frames)의 변화를 통해 새로운 행동을 습득하는 동시에 베이스 모델의 가중치 스펙트럼(weight spectra)을 재사용할 수 있습니다. 우리는 스펙트럼 상속을 상호 보완적인 오프라인 및 온라인 구현을 갖춘 RLVR 네이티브 고정 스펙트럼 최적화 프레임워크인 ISO(Isospectral Optimization)로 구체화합니다. 오프라인 방식인 ISO-Merger는 공유 베이스를 가진 전문가(specialists)들의 프레임 변화를 하나의 고정 스펙트럼 모델로 결합하며, 병합 후 데이터, 롤아웃(rollouts), 그래디언트 업데이트(gradient updates) 또는 온-정책 증류(on-policy distillation, OPD)를 필요로 하지 않습니다. 이는 상호 보완적인 전문가 능력을 회복하며, 비교된 데이터 프리(data-free) 병합 방법들 중 가장 강력한 종합 성능을 달성합니다. 온라인 방식인 ISO-Optimizer는 베이스 스펙트럼을 고정된 상태로 유지하면서 AdamW 및 Muon을 포함하여 선택된 베이스 옵티마이저(base optimizer)를 프레임 변수에 적용합니다. 1.5B에서 8B 파라미터에 이르는 추론 및 코딩 작업 전반에 걸쳐, ISO-Optimizer는 보고된 실행 결과에서 정확도를 향상시켰으며 훨씬 적은 훈련 단계로 동일한 점수에 도달했습니다. Qwen3-8B-Base에서 AdamW는 270 훈련 단계 후에 0.495의 종합 정확도에 도달합니다. ISO-AdamW는 단 100 훈련 단계 만에 동일한 정확도에 도달하며, 210 훈련 단계 후에는 0.509로 더욱 향상됩니다. 종합적으로, ISO는 RLVR의 누락된 최적화 계층에 대한 구체적인 해답을 제시합니다. 즉, 사전 학습(pre-training) 최적화를 통째로 상속받는 대신, 보상 기반 적응(reward-driven adaptation)의 구조를 중심으로 사후 학습(post-training)을 설계하는 것입니다: 스펙트럼은 상속하고, 프레임을 최적화하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기