
microsoft/Mage-VL · Hugging Face - 효율적인 코덱 네이티브 스트리밍 멀티모달 파운데이션 모델
요약
Mage-VL은 비디오 코덱 구조를 활용하여 시각적 토큰을 75% 이상 절감하고 추론 속도를 3.5배 향상시킨 멀티모달 파운데이션 모델입니다. 코덱 정렬 희소성(codec-aligned sparsity)과 System 1 & 2 이중 프로세스 설계를 통해 실시간 스트리밍 인지 효율성을 극대화했습니다.
핵심 포인트
- 코덱 네이티브 구조로 시각적 토큰 소비 75% 이상 절감
- 균일 프레임 샘플링 대비 최대 3.5배의 추론 속도 향상
- System 1(경량 인지)과 System 2(전체 VLM)의 이중 프로세스 설계
- H.264/HEVC 및 신경망 코덱(DCVC-RT) 모두 수용 가능한 유연성
- 4B 규모의 컴팩트한 시각 인코더 Mage-ViT와 Qwen3-4B 결합
Mage-VL은 이미지 및 비디오 이해를 위한 코덱 네이티브 (codec-native), 선제적 스트리밍 (proactive-streaming) 멀티모달 파운데이션 모델 (multimodal foundation model)로, 시각 인코더 (visual encoder)는 4B 규모의 컴팩트한 크기로 처음부터 완전히 학습되었습니다. 이 모델은 현대 VLM의 모라벡의 역설 (Moravec's paradox) — 복잡한 오프라인 추론에는 강하지만, 단순한 실시간 스트리밍 인지에는 느리고 연산 집약적이라는 점 — 을 해결하는 것을 목표로 합니다. 비디오를 균일하게 샘플링된 프레임으로 디코딩하고 동결된 웹 사전 학습 ViT (frozen web-pretrained ViT)를 통해 조밀한 패치 토큰 그리드를 밀어넣는 대신, Mage-VL은 현대 비디오 코덱의 구조를 따릅니다. 즉, 스트림을 앵커 (I) 프레임과 예측 (P) 프레임으로 분리하고, 모든 앵커 패치는 유지하되 코덱이 비트를 소비하는 영역, 즉 실제 움직임과 새로운 세부 정보가 포함된 영역의 예측 프레임 패치만을 유지합니다. 이러한 코덱 정렬 희소성 (codec-aligned sparsity)은 시공간적 문맥 (spatio-temporal context)을 보존하면서도 시각적 토큰을 75% 이상 절감하며, 균일한 프레임 샘플링 대비 최대 3.5배의 실제 추론 속도 (wall-clock inference speedup) 향상을 가져옵니다.
이 시스템은 두 가지 구성 요소를 결합합니다:
- Mage-ViT — 3D 회전 위치 인코딩 (3D rotary position encoding)이 적용된 공유 16×16 패치 그리드 상에서 코덱 유도 시공간 중요도에 따라 토큰을 할당하는, 처음부터 학습된 코덱-ViT (Codec-ViT) 시각 인코더입니다. 이는 코덱 불가지론적 (codec-agnostic)입니다. 동일한 인터페이스를 통해 모션 벡터(motion vectors) + 잔차 에너지(residual energy)를 이용한 전통적인 코덱 (H.264/AVC, HEVC/H.265) 또는 학습된 레이트 맵(learned rate map)을 이용한 신경망 코덱 (DCVC-RT)을 모두 수용하며, 아키텍처나 재학습 변경이 필요하지 않습니다.
- Qwen3-4B 인과적 디코더 (causal decoder) — 유일한 사전 학습된 구성 요소인 Qwen3-4B-Instruct-2507 언어 백본 (language backbone)으로, 경량화된 2층 MLP 프로젝터 (MLP projector)를 통해 Mage-ViT의 가변 길이 토큰 스트림을 소비하며, 이미지, 단기/장기/초장기 비디오 및 스트리밍을 위한 통합 인터페이스를 제공합니다.
이 쌍의 상단에는 System 1 & System 2 이중 프로세스 설계가 적용되어 단일 모델 내에서 선제적 스트리밍을 추가합니다. 경량 인지 게이트 (System 1)가 각 롤링 코덱 윈도우 (rolling codec window)를 감시하며 일상적인 콘텐츠에는 침묵을 유지하다가, 응답할 가치가 있는 이벤트가 완료될 때만 전체 VLM (System 2)을 호출합니다. 이를 통해 별도의 멀티 에이전트 파이프라인 (multi-agent pipeline)이 필요하지 않습니다.
✨ 주요 특징
코덱 네이티브(Codec-native) 및 처음부터 학습(from scratch). 전체 비주얼 스택(visual stack)을 처음부터 학습했습니다. 즉, 수십억 규모의 이미지-텍스트 ViT 초기화 과정을 거치지 않았습니다. 생물학적 영감을 받은 예측 패치(predictive-patch) 메커니즘(16×16 크기의 I/P 프레임)은 시각적 토큰(visual-token) 소비를 75% 이상 절감하며(밀집 프레임 샘플링의 약 1/8 이하), 동일한 예산 내에서 모델이 8배 더 긴 비디오를 학습할 수 있게 합니다.
코덱 네이티브(Codec-native) 가속. 코덱 토큰화(Codec tokenization)는 우수한 정확도-효율성 프런티어(accuracy–efficiency frontier)를 설정합니다. 동일한 정확도 기준에서 균일 프레임 샘플링(uniform frame sampling) 대비 실제 추론 시간(wall-clock inference)을 최대 3.5배 가속하며, 대부분의 비디오 벤치마크(단일 8×B200 노드 기준)에서 비교 모델 중 가장 빠릅니다.
네이티브 해상도 스케일링(Native-resolution scaling). 가변 해상도 사전 학습(Variable-resolution pretraining)을 통해 Mage-ViT는 토큰 예산에 따라 단조롭게 성능이 향상됩니다(676개 토큰에서 Food-101 >96.1%, ImageNet >86.3% 정점 도달). 이는 고정 해상도 인코더가 성능 포화 또는 저하를 겪는 것과 대조적입니다.
LLM과 일치하는 비디오 성능 이득. 4B Qwen3 백본(backbone)을 고정하고 ViT만 교체했을 때, Mage-VL은 보고된 모든 비디오 및 시간적 접지(temporal-grounding) 벤치마크에서 Qwen3-VL-4B보다 성능이 향상되었습니다. 특히 위치 파악(localization) 중심 작업에서 가장 큰 폭의 향상을 보였습니다 (+22.5 QVHighlight, +17.1 ActivityNet, +11.0 VSI-Bench, +24.5 VideoEval-Pro).
크기 대비 강력한 성능. 정지 이미지에서는 Qwen3-VL-4B와 대등하며, 비디오 이해 및 공간 지능(spatial intelligence)에서는 명확하게 앞섭니다 (+11.0 VSI-Bench, +53.1 CrossPoint, +5.2 EmbSpatial, +22.5 QVHighlight).
단일 모델을 통한 선제적 스트리밍(Proactive streaming). 동결된 백본(frozen-backbone) 인지 게이트(cognition gate)가 저지연 이벤트 기반 해설을 제공합니다. 이는 SoccerNet 스트리밍의 TimVal / F1 / ROC-AUC / PR-AUC 지표에서 최고 성능을 기록했으며, 실제 2026년 월드컵 중계에도 일반화될 수 있습니다.
submitted by /u/pmttyji [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기