MMOE: 효율적인 전문가 설계를 통한 Diffusion Transformer의 현대화
요약
MMOE는 Diffusion Transformer를 현대화하기 위해 LLM의 효율적인 확장 원칙을 적용한 새로운 아키텍처입니다. 공유 및 경량 전문가, 게이트-잔차 라우팅 등을 통해 생성 품질과 비용 간의 최적의 균형을 달성했습니다.
핵심 포인트
- LLM의 효율적 확장 원칙을 Diffusion Transformer에 적용
- 공유/경량 전문가 및 게이트-잔차 라우팅 도입
- 기존 모델 대비 더 빠른 수렴 속도와 낮은 FID 달성
- 단일 8-GPU H100 노드 환경에서 효율적인 학습 증명
최신 대규모 언어 모델(Large Language Models, LLMs)은 용량 성장과 효율성을 결합함으로써, 용량이 증가함에 따라 토큰당 비용과 배포 비용을 통제 가능한 수준으로 유지하며 성공적으로 확장하고 있습니다. AIGC 파운데이션 모델(AIGC Foundation Models, AFMs), 특히 확산 트랜스포머(Diffusion-Transformer) 백본은 희소 전문가(Sparse Experts)를 채택하기 시작했으나, 최근의 노력들은 LLM 확장을 실용적으로 만들었던 효율성 메커니즘을 도입하기보다는 주로 총 파라미터 수와 희소성 비율(Sparsity Ratios)을 늘리는 데 집중되어 있어, 생성 품질과 훈련 및 배포 비용 간의 균형을 맞추는 경우가 드뭅니다. 이는 자연스러운 질문을 던집니다: 효율적인 LLM 확장의 이면에 있는 아키텍처 원칙을 AFM에 더 균형 잡힌 방식으로 적용할 수 있을까? 우리는 SiT 스타일의 확산 트랜스포머를 현대화한 ModernMOE (MMOE)를 소개합니다. 이는 라우팅된 전문가(Routed Experts), 공유 및 경량 전문가(Shared and Lightweight Experts), 게이트-잔차 라우팅(Gate-residual Routing), 그리고 어텐션-잔차 정보 재사용(Attention-residual Information Reuse)을 AIGC 생성에 체계적으로 적용합니다. MoE를 단일 플러그인 교체 대상으로 취급하는 대신, MMOE는 서로 다른 현대적 전문가 구성 요소들이 확산 트랜스포머 내부에서 조합될 때 수렴(Convergence), 효율성, 그리고 생성 품질에 어떻게 영향을 미치는지 연구합니다. 본 논문의 모든 실험은 접근 가능한 단일 머신 예산인 8-GPU H100 노드 1대에서 배치 크기(Batch Size) 256으로 400k 스텝 동안 훈련되었습니다. 동일한 훈련 및 샘플링 프로토콜과 예산 하에서, MMOE는 밀집(Dense) 모델 및 중간 단계의 희소 전문가(Intermediate Sparse-expert) 베이스라인 모델보다 모든 기록된 체크포인트에서 더 낮은 FID를 달성했습니다. 즉, 훈련 스텝당 더 빠르게 수렴하며, 희소 변형 모델들 중에서는 최상의 품질-비용 균형을 달성했습니다. 라우팅 분석(Routing Analysis)은 또한 깊이(Depth)에 따른 안정적인 전문가 전문화, 경량 경로(Lightweight Routes)의 상당한 사용, 그리고 노이즈 제거(Denoising) 과정 중 스텝 간의 완만한 라우팅 변화를 보여줍니다. 이러한 결과는 AFM이 단순히 총 파라미터와 희소성 비율을 늘리는 대신, 검증된 효율성 설계를 도입함으로써 LLM의 균형 잡힌 확장 경로를 따를 수 있음을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기