CMuon: 청크 단위 모멘텀 직교화 (Chunked Momentum Orthogonalization)를 통한 확산 트랜스포머
요약
Diffusion Transformers(DiT) 학습 시 발생하는 Muon 옵티마이저의 수렴 문제를 해결하기 위한 CMuon 기법을 제안합니다. 통합된 텐서를 청크 단위로 분할하여 직교화함으로써 학습 속도를 AdamW 대비 2배 이상 향상시켰습니다.
핵심 포인트
- DiT의 통합 텐서 구조에서 발생하는 암시적 부분 공간 결합 문제 식별
- 청크 단위 모멘텀 직교화(CMuon)를 통한 가중치 분할 전략 제안
- 675M 규모 DiT 모델로 ImageNet 256에서 FID 1.18 달성
- AdamW 대비 2배 이상의 학습 속도 향상 및 수렴 성능 개선
확산 트랜스포머 (Diffusion Transformers, DiTs)는 시각적 생성 모델링 (visual generative modeling) 분야에서 최첨단 (SOTA) 성능을 달성했으나, 그 학습 과정은 여전히 계산 비용이 매우 높습니다. 최근 제안된 모멘텀 직교화 (Momentum Orthogonalization, Muon) 옵티마이저는 AdamW의 유망한 대안을 제공하지만, 이를 DiT에 직접 적용할 경우 후기 단계의 수렴 (convergence)이 최적화되지 않는 문제가 발생합니다. 본 논문에서는 이러한 병목 현상의 근본 원인을 식별합니다. 표준 DiT 아키텍처는 계산 효율성을 위해 기능적으로 구별되는 가중치들(예: AdaLN 및 QKV 레이어 내의 가중치)을 통합된 텐서 (unified tensors)로 결합합니다. 이러한 결합된 텐서에 Muon을 적용하면 의도치 않게 암시적 부분 공간 결합 (implicit subspace coupling)이 유도되어, 업데이트 방향을 왜곡하고 전역 최적화 (global optimization)를 저하시킵니다. 이를 해결하기 위해, 우리는 직교화 (orthogonalization)를 수행하기 전에 이러한 행렬들을 독립적인 하위 구성 요소로 분할하는 단순하면서도 매우 효과적인 전략인 청크 단위 Muon (Chunked Muon, CMuon)을 소개합니다. 광범위한 실험을 통해, CMuon으로 학습된 675M 파라미터 규모의 DiT가 ImageNet 256에서 단 200 에포크 (epochs) 만에 1.18의 FID를 달성함을 입증했습니다. 이는 AdamW 대비 2배 이상의 학습 속도 향상을 나타내며, 동시에 기존 Muon의 후기 단계 수렴 정체 현상을 효과적으로 극복합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기