Muon은 에이전트 기반 강화학습(RL)에 어떤 도움이 되는가?
요약
본 논문은 Muon을 사용하여 에이전트 기반 강화학습(RL)의 희소 보상 환경에 적용한 연구 결과를 제시합니다. Qwen2.5-0.5B-Instruct 모델과 ALFWorld에서 GiGPO 및 GraphGPO 등의 정책 최적화기를 활용하여, Muon이 AdamW 대비 높은 성능 향상을 보여주었음을 입증했습니다.
핵심 포인트
- Muon은 에이전트 기반 RL의 희소 보상 환경에 효과적으로 적용될 수 있다.
- GiGPO 하에서 Muon을 사용했을 때 최종 검증 성공률이 크게 상승했다.
- 학습률과 어드밴티지 추정기 등 다양한 요소와 함께 연구할 필요가 있다.
Muon은 대규모 사전 학습에서 AdamW와 경쟁력이 있지만, 강화학습(RL) 후속 훈련에서의 가치는 여전히 불분명합니다. 우리는 Qwen2.5-0.5B-Instruct를 사용하여 ALFWorld에서 Muon의 순수 형태를 AdamW와 비교하는 단일 시드 매칭 비교를 통해 희소 보상 에이전트 기반 RL에 적용했습니다. Group-in-Group Policy Optimization (GiGPO) 하에서, 숨겨진 가중치 행렬에만 Muon을 적용했을 때 최종 윈도우 검증 성공률이 0.290에서 0.546으로 (+88%) 상승했습니다. 고속 AdamW 컨트롤은 업데이트 후에도 성공률을 유지하지 못했습니다. 그 효과는 어드밴티지 추정기(advantage estimator)와 학습률에 따라 달라집니다. $3 ext{e-}5$에서 Muon은 GRPO를 0.161에서 0.268로 개선했지만, GraphGPO의 후반 윈도우 간격은 포화 상태 근처에서 좁아졌습니다. $1 ext{e-}5$에서 GraphGPO Muon은 0.901에 도달하며 정규화된 검증 AUC를 0.399에서 0.556으로 높였고, 각각 30 및 60 업데이트 시점에서 0.5와 0.75의 성공률에 도달했습니다. 이러한 탐색적 결과들은 Muon이 에이전트 기반 RL에 도움이 될 수 있음을 보여주며, 정책 최적화기(policy optimizer), 어드밴티지 추정기, 학습률을 함께 연구하도록 동기를 부여합니다. 다중 시드 및 교차 작업 검증은 여전히 미개척 분야입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기