
LynnReal-Omni: Minmax H3 기반 모델 및 Comfy 노드 사용 가능
요약
LynnReal-Omni는 MiniMax H3 아키텍처를 기반으로 32B 공유 멀티모달 확산 트랜스포머를 사용하여 단일 프레임워크에서 다양한 비디오 작업을 통합했습니다. 이 모델은 텍스트/이미지 투 비디오, 포즈 가이드 생성, 스타일 변환 등 여러 기능을 하나의 파이프라인으로 구현합니다. 또한, 실시간 스트리밍에 최적화된 27B LynnReal-Omni-Flash 버전을 개발하여 추론 비용을 낮추고 빠른 비디오 생성을 가능하게 했습니다.
핵심 포인트
- MiniMax H3 기반의 단일 프레임워크로 다중 비디오 작업 통합
- 텍스트/이미지 투 비디오, 포즈 가이드 등 다양한 기능 지원
- 실시간 스트리밍에 최적화된 LynnReal-Omni-Flash 모델 개발
- H100 환경에서 Flash 모델이 Standard 대비 빠른 추론 속도 입증
Github: https://github.com/LynnReal-AI/LynnReal-Omni Models: https://huggingface.co/stdstu123/LynnReal-Onmi-beta-0.1/tree/main/comfyui/models/diffusion_models 하나의 모델로 여러 비디오 작업을 통합했습니다. MiniMax H3 아키텍처를 기반으로 하는 32B 공유 멀티모달 확산 트랜스포머(shared multimodal diffusion transformer)를 통해 LynnReal-Omni는 텍스트-투-비디오, 이미지-투-비디오, 사람 및 손 포즈 가이드 생성, 구조적 제어(structural control), 오므니-레퍼런스 생성(omni-reference generation), 스타일 변환(style transfer), 비디오 편집(video editing), 저화질 비디오 복원(degraded-video restoration) (누적 오류로 영향을 받은 비디오도 복구한다는 것을 발견했습니다) 및 스트리밍 장편 비디오 생성까지 모두 단일 프레임워크에서 4단계의 빠른 생성으로 구현합니다. 또한 외형 레퍼런스, 편집 가능한 3D 렌더링, 게임 녹화와 같은 이질적인 입력(heterogeneous inputs)을 받아 에이전트가 하나의 모델 내에서 시각적 조건을 구성할 수 있습니다.
Flash는 실시간 렌더링에 맞춰 개발되었습니다. 저희는 모델 및 디코딩 가속화와 경량 VAE 디코더를 통해 추론 비용을 낮춘 27B LynnReal-Omni-Flash(3단계 생성)를 훈련했습니다. 단일 H100에서 Standard 모델로 22프레임 540p 비디오의 워밍업 생성 및 디코딩에 843ms가 걸리고, Flash 모델로는 377ms가 걸려 실시간 스트리밍 비디오 생성을 위한 기반을 마련했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기