균일성 함정 극복: SplitMoE를 통한 비디오 확산 모델 확장
요약
본 논문은 기존의 토큰별 MoE가 비디오 데이터의 복잡한 특성(공간적/시간적 중복성, 롱테일 의미론)을 처리하는 데 한계가 있음을 지적합니다. 이를 해결하기 위해 전문가 풀을 '의미론적'과 '일반'으로 분리하고, 프로토타입 기반 라우팅 및 풀-푸시 정규화를 적용한 SplitMoE 아키텍처를 제안했습니다.
핵심 포인트
- SplitMoE는 비디오 데이터에 적합하도록 MoE 구조를 개선함.
- 전문가 풀을 의미론적 전문가와 일반 전문가로 이분화하여 사용.
- 균일성 함정(Uniformity Trap) 문제를 해결하고 라우팅 일관성을 높임.
- 표준 벤치마크에서 기존 MoE 대비 우수한 비디오 생성 품질 입증.
대규모 언어 모델(LLM)에 의해 대중화된 Mixture-of-Experts (MoE)는 시각적 생성 모델을 확장하는 데 유망한 패러다임입니다. 하지만 기존의 토큰별 MoE는 동질적인 전문가 풀 내에서 토큰들을 독립적으로 라우팅하며, 전문가 사용을 균일성 쪽으로 정규화하여 공간적-시간적으로 중복성이 높고 의미론적으로 롱테일(long-tailed)인 비디오 데이터에 적합하지 않습니다. 우리는 기존의 시각적 MoE가 '균일성 함정'에 빠진다는 것을 보여줍니다. 즉, 의미론적으로 충분히 조직되지 않은 라우팅이 균일한 전문가 사용 정규화와 결합하여 일관된 패치들을 서로 다른 전문가들로 분산시키고, 이는 라우팅 파편화 및 구조적 왜곡을 초래합니다. 이를 해결하기 위해, 우리는 균일성의 속박을 깨는 스플릿-역할(split-role) 희소 아키텍처인 SplitMoE를 제안합니다. 내재된 의미론적 불균형을 수용하기 위해, 우리는 전문가 풀을 의미론적 전문가(semantic experts)와 일반 전문가(generic experts)로 명시적으로 이분화합니다. 여기서 의미론적 전문가는 고수준의 의미론적 추상화를 포착하고, 일반 전문가는 잔여 시각 정보 및 유연한 생성 능력을 보존합니다. 프로토타입 기반 라우팅(prototype-guided routing)과 풀-푸시 정규화(pull-push regularization)를 활용하여, SplitMoE는 토큰들이 임의의 균형 제약 조건이 아닌 의미론적 속성에 따라 자연스럽게 클러스터링되도록 합니다. 광범위한 결과들은 동등한 활성화 매개변수 예산 하에서, SplitMoE가 표준 벤치마크 전반에 걸쳐 수렴 속도, 라우팅 일관성, 비디오 생성 품질 면에서 기존의 부하 균형 MoE보다 우수함을 보여줍니다. SplitMoE는 출현하는(emergent) 거시-미세 디노이징 로직을 밝힘으로써 커뮤니티에 모달리티 인식 확장 경로를 제공하며, 대규모 비디오 월드 모델 구축을 위한 중요한 참고 자료 역할을 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기