MoE 강화학습에서의 전문가 공간 탐색
요약
본 논문은 Mixture-of-Experts (MoE) 모델의 강화학습(RL)을 개선하기 위한 새로운 프레임워크인 Expert-Space Exploration Reinforcement Learning (ESRL)을 제안합니다. ESRL은 전문가 라우팅 공간을 명시적으로 탐색하여 역할 수행 다양성을 높이면서도, 신뢰할 수 있는 계산 경로를 유지하는 것이 핵심입니다. 실험 결과, ESRL은 다양한 MoE 백본에서 최고의 성능을 보여주었습니다.
핵심 포인트
- ESRL은 MoE 모델의 전문가-라우팅 공간을 명시적으로 탐색합니다.
- 신뢰성 유지를 위해 고신뢰성 전문가를 앵커로 보존하고 후보 풀을 제한합니다.
- 라우터 엔트로피에 따라 섭동 강도를 조정하여 과도한 섭동을 방지합니다.
- ESRL은 수학, 과학, 코드 작업 등 전반적인 영역에서 최고 성능을 입증했습니다.
강화학습 (RL)은 대규모 언어 모델의 사후 학습에 핵심적인 요소가 되었습니다. Mixture-of-Experts (MoE) 모델을 위한 최근 RL 발전은 주로 전문가 선택을 고정된 구성 요소로 취급하면서 최적화 안정성과 훈련 효율성을 개선하는 데 초점을 맞추어 왔습니다. 라우팅이 출력 분포를 유도하는 희소 계산 경로를 결정하기 때문에, 전문가 선택은 추가적인 역할 수행 다양성(rollout diversity)의 원천을 제공합니다. 경험적 분석을 통해 우리는 전문가 라우팅을 섭동(perturbing)하는 것이 모델 출력을 효과적으로 변경하고 역할 수행 다양성을 증가시킨다는 것을 발견했으며, 이는 디코딩 온도(decoding temperature)를 높이는 것과 유사합니다. 그러나 직접적인 섭동은 부적합한 전문가를 활성화시키고 역할 수행 품질을 상당히 저하시킬 수 있습니다. 이러한 관찰에 동기를 부여받아, 우리는 MoE 모델의 전문가-라우팅 공간을 명시적으로 탐색하는 아키텍처 인식 프레임워크인 Expert-Space Exploration Reinforcement Learning (ESRL)을 소개합니다. ESRL은 고신뢰성 전문가를 앵커(anchor)로 보존하고, 확률적 라우팅을 그럴듯한 후보 풀(plausible candidate pool)로 제한함으로써 신뢰할 수 있는 계산 경로를 유지합니다. 또한, 과도한 섭동을 피하기 위해 라우터 엔트로피에 따라 섭동 강도를 추가적으로 조정합니다. 섭동으로 인해 발생하는 라우팅 불일치(routing mismatch)를 완화하기 위해, ESRL은 역할 수행 중 사용된 전문가 경로를 기록하고 이를 정책 최적화 중에 재실행합니다. 실험 결과는 ESRL이 top-K, top-1, 그리고 공유 전문가 라우팅을 사용하는 MoE 백본 전반에 걸쳐, 그리고 추가적인 샘플링이나 계산 비용 없이 수학, 과학, 코드 작업 전반에서 최고의 성능을 달성함을 입증했습니다. 특히, Qwen3-30B-A3B에 적용된 ESRL은 비교된 모든 방법 중 최고를 기록하며, 평균 Pass@1과 Pass@8을 각각 GRPO보다 3.2%, 4.5% 향상시켰습니다. 전문가 활용 및 훈련 역학에 대한 추가 분석은 MoE 특유의 라우팅 구조를 활용하는 것이 RL 훈련에 어떻게 이점을 주는지에 대한 통찰력을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기