
MiniMax H3 오픈 웨이트(Open-Weight) 출시 — 실제 다운로드 가능한 부분과 API 전용 부분의 차이점
요약
MiniMax가 멀티모달 비디오 생성 시스템인 H3의 오픈 웨이트를 출시했습니다. 핵심 생성기인 H3-Base는 공개되었으나, 전처리 레이어와 2K 재생성 패스는 API 전용으로 유지됩니다.
핵심 포인트
- H3-Base는 33B 밀집 단일 스트림 트랜스포머 구조임
- 오픈 웨이트 라이선스는 한국, 미국, EU 등 주요 지역에서 제한됨
- 핵심 생성기 외 전처리 및 2K 고해상도 기능은 API로만 제공됨
- 최소 구동 환경은 CPU 오프로딩 활용 시 12GB VRAM에서도 가능
MiniMax는 7월 31일에 범용 멀티모달 비디오 생성 시스템인 H3를 출시했으며, 직후에 가중치(weights)가 공개되었음을 확인했습니다. 이는 Hugging Face의 MiniMaxAI/MiniMax-H3로 올라와 있으며, 같은 날 ComfyUI로 재패키징된 미러(mirror) 버전도 네이티브 지원과 함께 배포되었습니다.

사전에 중요한 점: 보고된 바에 따르면 오픈 웨이트(open-weight) 라이선스는 적용 대상 지역에서 EU, 영국, 한국, 미국을 제외합니다. 그 외 지역에서의 상업적 이용은 무료이지만 제품 UI에 "MiniMax H3"를 표시해야 하며, 연간 매출이 2,000만 달러를 초과하는 경우 별도의 서면 승인이 필요합니다. 만약 제외된 지역에 거주한다면, 이 모델을 사용할 계획을 세우기 전에 Hugging Face 모델 카드에서 라이선스를 직접 확인하십시오. (이 글을 포함한) 간접적인 요약을 귀하의 구체적인 상황에 대한 최종 결론으로 받아들이지 마십시오.
실제로 공개된 것과 API 전용으로 남는 것의 차이: 이 시스템은 세 가지 레이어로 구성됩니다. MiniMax의 API 뒤에 머무는 호스팅된 전처리/오케스트레이션 레이어(Context-IR), 오픈 소스로 공개된 핵심 생성기(H3-Base), 그리고 역시 API로 호스팅되는 2K 재생성 패스(Regenerate-2K)입니다. 따라서 여기서 "오픈 소스"라는 의미는 전체 상업용 파이프라인이 아니라 핵심 생성기(core generator)를 의미합니다.
이 모델을 개인 하드웨어에서 실행할 수 있을지 평가하려는 분들을 위한 기술적 세부 사항은 다음과 같습니다. 이 모델은 33B 밀집 단일 스트림 트랜스포머 (33B dense single-stream Transformer) 구조이며, 두 가지 작업 특화 체크포인트인 fl2va (텍스트/이미지 기반 생성)와 ref2va (참조 기반 생성)로 제공됩니다. 가장 작은 양자화 (quantized) 형태의 경우 각각 약 21GB입니다. 전체 정밀도 (Full precision)로 실행할 경우 약 123.6GB가 필요하며, 보고된 바에 따르면 가장 작은 구동 조합은 약 42.5GB입니다. ComfyUI의 자체 가이드에 따르면 12GB 그래픽 카드와 CPU 오프로딩 (CPU offloading)을 통해 실행할 수 있다고 하지만, 빠릿하기보다는 느린 경험이 될 것으로 예상됩니다. 네이티브 로컬 생성의 짧은 변 길이(short edge)는 768px이며, 2K 출력은 오픈 웨이트 (open weights)의 일부가 아닌 별도의 인컨텍스트 재생성 (in-context regeneration) 단계를 통해 이루어집니다.
실행을 위한 대략적인 과정 (정확하고 최신인 명령어를 확인하려면 공식 모델 카드를 참조하세요 — 출시 세부 사항이 매우 빠르게 변할 수 있으므로, 아래 내용은 예시일 뿐 복사하여 붙여넣기를 보장하지 않습니다):
from huggingface_hub import snapshot_download
# 실제로 필요한 체크포인트만 다운로드하세요 —
...
이번 출시가 단순히 "또 다른 모델이 나왔다"는 수준을 넘어 주목을 받은 이유는 무엇일까요? Artificial Analysis의 보고에 따르면, H3는 비디오 편집 분야에서 1위를 차지했으며 텍스트-비디오 (text-to-video) 및 이미지-비디오 (image-to-video) 분야 모두에서 상위 3위 안에 들었습니다. 또한 가중치 (weights)를 공개함으로써 해당 카테고리에서 압도적인 차이로 선두를 달리는 오픈 웨이트 모델이 될 것이라고 언급했습니다 (Artificial Analysis, 2026년 7월). 다만, 동일한 벤치마크에서 H3가 텍스트-비디오 분야에서는 Gemini Omni Flash에 뒤처지고, 이미지-비디오 분야에서는 Seedance 2.0과 Gemini Omni Flash 모두에 뒤처진다는 보고도 있으므로 이를 고려하여 균형 있게 판단할 가치가 있습니다 (South China Morning Post, 2026년 7월). 즉, 모든 분야를 휩쓴 것이 아니라 특정 카테고리(편집)에서 강력한 결과를 보여준 것입니다.
요약(TL;DR): MiniMax가 H3의 핵심 생성기(core generator)를 오픈 소스로 공개했습니다(전체 호스팅 파이프라인이 아님). 이는 텍스트, 이미지, 비디오, 오디오를 통합적으로 이해하고 네이티브 오디오(native audio)가 포함된 비디오를 출력하는 33B 비디오 생성 모델입니다. 제3자 벤치마크에 따르면 모든 분야에서 균일하게 1위를 차지한 것은 아니며, 특히 비디오 편집(video editing) 분야에서 강력한 성능을 보여줍니다. 라이선스에는 EU, 영국, 한국, 미국이 제외되어 있으므로, 상업적 이용을 계획하기 전에 공식 약관을 확인하시기 바랍니다.
더 자세한 내용을 알아보려면 다음을 방문하세요: RouteAI
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기