
Mage-Flow - 이미지 생성 및 편집을 위한 효율적인 네이티브 해상도 파운데이션 모델 - Microsoft
요약
Microsoft가 공개한 Mage-Flow는 4B 규모의 컴팩트한 생성 스택으로, 텍스트 기반 이미지 생성 및 편집을 지원합니다. 토크나이저와 백본의 공동 설계를 통해 적은 컴퓨팅 자원으로도 고해상도 및 다양한 종횡도의 고품질 이미지를 효율적으로 생성합니다.
핵심 포인트
- 4B 규모의 컴팩트한 모델로 대형 모델과 대등한 성능 구현
- Mage-VAE를 통한 경량화된 고충실도 잠재 토크나이저 적용
- 네이티브 해상도 지원으로 다양한 종횡비의 이미지 생성 가능
- 융합 커널 및 패킹 기술로 학습 속도 약 2.5배 향상
- 생성 및 편집을 위한 Base, RL-aligned, Turbo 변체 제공
모델: (많은 샘플 데모 이미지는 모델 카드(Model cards)를 확인하세요) https://huggingface.co/microsoft/Mage-Flow https://huggingface.co/microsoft/Mage-Flow-Turbo https://huggingface.co/microsoft/Mage-Flow-Edit
Mage-Flow는 효율적인 텍스트-이미지 생성 (text-to-image generation) 및 지시어 기반 이미지 편집 (instruction-based image editing)을 위한 컴팩트한 4B 규모의 생성 스택 (generative stack)입니다. 수백억 개의 파라미터로 규모를 확장하는 대신, Mage-Flow는 세심한 토크나이저-백본-시스템 공동 설계 (tokenizer–backbone–system co-design)를 통해 최첨단 (state-of-the-art) 수준에 경쟁력 있는 품질에 도달하며, 이를 통해 현실적인 컴퓨팅 예산 내에서 빠르고, 메모리 사용량이 적으며, 미세 조정 (fine-tune)하기 쉽게 유지됩니다.
이 스택은 공동 설계된 두 개의 공유 구성 요소로 구축되었습니다:
- Mage-VAE — 경량화된 고충실도 잠재 토크나이저 (latent tokenizer) (앵커-잠재 KL 정규화 (anchor-latent KL regularization)를 사용하는 1단계 확산 인코딩/디코딩 (one-step diffusion encode/decode)).
- NR-MMDiT — Mage-VAE 잠재 공간 (latent space)에서 정류된 흐름 매칭 (rectified flow matching)으로 학습된 공유 4B 네이티브 해상도 멀티모달 확산 트랜스포머 (Native-Resolution Multimodal Diffusion Transformer).
네이티브 해상도 패킹 (native-resolution packing) 및 융합 커널 (fused-kernel) 학습 인프라와 함께, 이 공유 스택은 두 가지 모델 인스턴스화를 지원합니다: 텍스트-이미지 생성을 위한 Mage-Flow와 지시어 기반 이미지 편집을 위한 Mage-Flow-Edit입니다. 각 모델은 Base, RL 정렬 (RL-aligned), 그리고 4단계 Turbo 변체 (variants)로 제공됩니다.
✨ 주요 특징
컴팩트함 및 경쟁력: 생성 및 편집을 위한 단일 4B 제품군으로, 훨씬 더 큰 오픈 시스템 (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B)과 대등하거나 이를 능가합니다.
효율적인 토크나이저: Mage-VAE는 픽셀당 인코딩/디코딩 MACs를 약 12배 / 22배 적게 사용하면서도 FLUX.2-VAE의 재구성 충실도 (reconstruction fidelity)를 충족하여, VAE가 고해상도의 병목 현상이 되는 문제를 제거합니다.
네이티브 해상도: 하나의 체크포인트로 극단적인 4:1 비율 (예: 512×2048, 2048×512)을 포함하여 모든 종횡비에서 512부터 2048까지 생성할 수 있습니다.
시스템 수준의 속도: 네이티브 해상도 패킹 (FlashAttention 가변 길이 + 샘플당 2D RoPE) 및 융합 CUDA 커널을 통해 스텝당 학습 시간을 약 1.93초에서 약 0.78초로 단축했습니다 (~2.5배 빠른 학습). CFG의 조건부/비조건부 분기 (conditional/unconditional branches)는 하나의 패킹된 순전파 (packed forward)에서 실행됩니다.
전체 제품군.
생성(generation) 및 편집(editing) 모두를 위한 Base, RL-aligned, 그리고 4-step Turbo 변형 모델(variants). 다재다능한 편집. Mage-Flow-Edit은 통합된 이미지 및 텍스트 조건부 모델(image-and-text-conditioned model) 내에서 의미론적 콘텐츠 편집(semantic content editing), 외형 변환(appearance transformation), 이미지 복원(image restoration), 그리고 구조 인지 출력(structure-aware outputs)을 지원합니다. 보고서의 편집 갤러리를 참조하세요. 대화형 지연 시간(Interactive latency). 단일 A100에서 1024² 해상도 기준: Mage-Flow-Turbo는 이미지당 0.59초, Mage-Flow-Edit-Turbo는 편집당 1.02초, 피크 메모리(peak memory)는 약 18–20 GB (비교 대상 시스템 중 가장 낮음). /u/pmttyji에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기