MiniMax H3 노트: 범용 모달 비디오, 33B 백본 및 2K 인컨텍스트 재생성
요약
MiniMax가 출시한 H3는 기존의 '텍스트-투-비디오' 모델 패러다임을 재고찰하며, 텍스트, 이미지, 비디오, 오디오를 단일 멀티모달 생성 문제로 통합했습니다. 이 모델은 대화, 주변 소리, 음악 등을 별도로 이어 붙이는 것이 아니라 컨텍스트 내에서 공동으로 예측합니다. 특히 H3-Regenerate-2K 단계는 단순 업스케일링을 넘어 원본 컨텍스트를 재주입하여 2K 해상도에서 디테일을 창조적으로 재구성하는 것이 핵심입니다.
핵심 포인트
- H3는 Txt/Img/Vid/Audio를 단일 멀티모달 생성 문제로 통합했습니다.
- 대화, 음악, 효과음 등이 컨텍스트 내에서 공동으로 예측됩니다.
- H3-Regenerate-2K는 단순 업스케일링이 아닌 재구성을 통해 디테일을 창조합니다.
- H3-Omni-Transformer는 33B 파라미터 규모로 비디오와 오디오 라텐트를 공동 예측합니다.
MiniMax는 2026년 7월 31일에 H3를 출시했으며, 이는 단순히 '또 다른 텍스트-투-비디오 모델'이라기보다는 '파이프라인 재고찰(rethink the pipeline)' 범주에 속합니다. 흥미로운 부분은 데모 릴 자체가 아닙니다. H3는 텍스트-투-비디오, 이미지-투-비디오, 첫/마지막 프레임 생성, 참조 기반 생성, 모션 전이, 오디오-비주얼 편집, 그리고 오디오 조건부 생성을 모두 단일 멀티모달 생성 문제의 서로 다른 지침으로 취급한다는 점입니다.
무언가에 연결하기 전에 알아두면 좋을 내용을 정리했습니다.
구조(The shape of it)
H3는 텍스트, 이미지, 비디오, 오디오로 구성된 컨텍스트를 입력받아 동기화된 비디오와 스테레오 사운드를 반환합니다. 호스팅되는 출력은 24 FPS의 4초에서 15초 길이이며 32 kHz 스테레오 오디오를 갖추고 있고, MiniMax는 기본적으로 2K 해상도를 마케팅하고 있습니다. 내부적으로 호스팅되는 2K 경로는 두 단계로 이루어집니다: H3-Base가 768p의 짧은 측면(short-side) 결과를 생성한 다음, H3-Regenerate-2K가 이 결과와 원래의 멀티모달 컨텍스트를 사용하여 2K에서 재구성합니다.
일반적인 조립 라인과의 대조점은 다음과 같습니다:
typical: prompt -> silent video -> TTS -> SFX -> music -> sync pass
H3: multimodal context -> one joint video + audio latent prediction
MiniMax에 따르면 H3-Omni-Transformer는 비디오와 오디오 라텐트를 공동으로 예측하므로, 대화, 주변 소리(ambience), 음악, 효과음 등이 나중에 이어 붙이는 것이 아니라 컨텍스트 내에서 생성됩니다. 이 대화 기능은 영어, 중국어, 일본어, 한국어, 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어, 러시아어, 아랍어를 포함한 11개 언어에서 안정적으로 보고되었습니다.
사양표(Spec sheet)
| 항목 | 값 |
|---|---|
| 개발사 | MiniMax |
| ... |
33B라는 숫자는 호스팅되는 파이프라인의 모든 구성 요소가 아닌 H3-Omni-Transformer를 설명합니다.
파이프라인: Context-IR → Base → Regenerate-2K
H3-Context-IR -> 구조화된 컨텍스트 중간 표현(structured Context Intermediate Representation)
H3-Base -> 768p 비디오 + 오디오
H3-Regenerate-2K -> 기본 출력 + 원래 컨텍스트를 사용한 2K 재구성
가장 중요한 단계는 바로 이것입니다. 기존의 업스케일러(upscaler)는 픽셀을 보간할 뿐이며, 이전에 해상도가 확보되지 않았던 디테일을 창조해낼 수 없습니다. 이것이 작은 글씨나 섬세한 물체의 가장자리가 보통 흐릿하게 변하는 이유입니다. H3-Regenerate-2K는 원래의 프롬프트와 레퍼런스를 재주입하면서 장면을 더 높은 해상도로 재구축하므로, 모델은 의미론(semantics)을 부드럽게 처리하기보다는 해결할 두 번째 기회를 얻게 됩니다.
아키텍처 노트 (Architecture notes)
Contextual Omni Representation는 설계 아이디어입니다. 언어는 컨텍스트, 타겟, 그리고 각 모달리티 간의 관계를 설명합니다. H3-Context-IR은 지침을 구문 분석하고(parses), 모달리티를 연관시키며(associates), 시간에 걸쳐 추론하고(reasons over time), 그 결과를 H3-Base용으로 직렬화하는(serializes) 호스팅 전처리 및 오케스트레이션 계층입니다.
H3-Encoder는 H3-Base 내부에 존재합니다. 이는 사전 학습된 Qwen3-VL-32B 가중치를 사용하며, 레이어 50의 히든 스테이트(hidden states)를 H3-Omni-Transformer로 전달합니다.
H3-VAE는 잠재 공간(latent spaces) 모두를 포괄하는 이름입니다. 오픈 웨이트 문서에서는 이를 다음과 같이 분리했습니다:
H3-VisualVAE: 시간적으로 인과적인 인코딩(temporally causal encoding), 16× 공간 압축, 4× 시간 압축, 24개 잠재 채널, 이후 1 × 2 × 2 패치화(patchification)를 거칩니다.H3-AudioVAE: 32 kHz 스테레오를 40 Hz의 시간 비율로 잠재 토큰(latent tokens)에 압축합니다.
H3-Omni-Transformer는 33B 규모의 밀집 단일 스트림 트랜스포머입니다. 약 13B 개의 파라미터가 AdaLN 관련 브랜치에 위치하며, 이들의 변조 출력(modulation outputs)은 미리 계산하고 캐싱할 수 있으므로 해당 브랜치들이 추론 전용 배포 환경에서 상주할 필요가 없습니다. 모달리티별 부분은 입력/출력 레이어와 AdaLN 브랜치에 국한되며, 중앙 트랜스포머는 하나의 패킹된 시퀀스(packed sequence)로 실행됩니다. 3D 멀티모달 RoPE는 (t, h, w) 전반에 걸쳐 시간적 및 공간적 위치를 인코딩합니다.
오픈 웨이트(Open weight)이지만 완전한 오픈 소스(open source)는 아닙니다. H3-Base-FL2VA와 H3-Base-Ref2VA는 프로세서, 토크나이저, 텍스트 인코더, 트랜스포머(Transformer), 비주얼 VAE, 오디오 VAE와 함께 다운로드할 수 있습니다. 초기 릴리스에 포함되지 않은 것은 H3-Context-IR과 H3-Regenerate-2K입니다. 로컬 생성은 짧은 쪽이 768p를 목표로 하므로, 공식적인 2K 워크플로우를 재현하려면 호스팅된 스테이지(hosted stages)를 호출해야 합니다.
Ref2VA 모드에서의 참조 처리(Reference handling)는 관대하지만 제약이 있습니다. 최대 이미지 9개, 비디오 클립 3개, 오디오 클립 3개를 사용하며, 총 혼합 파일은 12개로 제한됩니다. 또한 참조 비디오와 오디오 각각에 대해 2초에서 15초의 길이 제한과 모달리티별 지속 시간 제한이 있습니다. 오디오가 유일한 참조 입력(reference input)이 될 수는 없습니다. 설계 의도는 H3가 단순히 파일들을 묶음으로 받는 것이 아니라, 자산들 사이의 관계를 추론하도록 하는 것입니다: 캐릭터 보존, 움직임 복사, 스타일 전이, 오디오 유지 또는 교체, 목소리를 음색 참조(timbre reference)로 사용하거나 자연어를 통해 기존 장면을 편집하는 식입니다.
라이선스는 Apache 2.0이나 MIT가 아닌 MiniMax H3 커뮤니티 라이선스(MiniMax H3 Community License)를 따릅니다. 배포 전에 영토적, 출처 표기, 안전 및 상업적 조건을 읽어보세요.
벤치마크 위치 (Benchmark position)
MiniMax의 출시 자료는 VBench 스타일의 매트릭스보다는 데모 시연에 의존하므로, Artificial Analysis의 블라인드 비디오 아레나(Video Arena)가 더 유용한 중립적인 정보원입니다. 2026년 9월 2일 스냅샷:
| 작업 (Task) | H3 순위 (H3 rank) | H3 Elo | 선두 주자 (Leader) | Leader Elo |
|---|---|---|---|---|
| 오디오가 포함된 텍스트-투-비디오 (Text-to-Video with Audio) | #4 | ≈1,228 | Wan 3.0 | 1,242 |
| ... |
이 수치들은 변동합니다. 눈에 띄는 점은 H3가 해당 분야의 독점적인 선두 주자들과 근접한 위치에 있으면서도, 오픈 웨이트(open-weight) 엔트리 중 몇 안 되는 경우라는 것입니다. 핵심 판매 포인트(pitch)는 단일 최고 점수가 아니라 (품질, 네이티브 오디오 비주얼 생성, 멀티모달 참조, 다운로드 가능한 기본 가중치) 이 모든 것을 묶은 패키지입니다.
가격 책정 (Pricing)
2026년 9월 24일 MiniMax 공식 페이지를 재확인했습니다. 예산을 세우기 전에 반드시 확인하세요.
| 사용량 | 리스트 가격 |
|---|---|
| H3 생성, 768P | $0.08/초 |
| ... | |
10초 기준으로는 768P에서 약 $0.80, 2K에서 $1.30에 근접하며, 15초는 각각 $1.20와 $1.95에 가깝습니다. 이 수치에는 청구 가능한 레퍼런스(references) 및 Context-IR 토큰은 포함되지 않습니다. 만약 공급업체별로 별도의 키를 관리하는 것이 번거롭다면, CometAPI와 같은 통합 멀티 모델 게이트웨이도 H3를 minimax-h3 모델 ID로 제공하며 광고된 시작 요금은 $0.064/초입니다. 다만, 제3자 헤드라인 요금은 경로(route), 해상도, 청구 규칙에 따라 달라지므로 보편적인 단일 가격으로 간주해서는 안 됩니다. |
Wan3.0, Seedance 2.5, Vidu Q3 대비 비교
| 차원 | MiniMax H3 | Wan3.0 | Seedance 2.5 | Vidu Q3 |
|---|---|---|---|---|
| 최대 단일 생성 시간 | 15초 | 30초 | 30초 | 16초 |
| ... | ||||
| 만능 우승자는 없습니다. 클립 길이보다 오픈 가중치(open weights), 멀티모달 컨디셔닝(multimodal conditioning), 스테레오 오디오, 편집 및 2K 마감이 더 중요할 때는 H3를 선택하세요. 30초와 1080P가 필요하면 Wan 3.0을 선택하세요. 거대한 레퍼런스 세트와 아이덴티티 일관성이 중요하다면 Seedance 2.5를 선택하세요. 대화 타이밍과 카메라 제어가 중요하다면 Vidu Q3를 선택하세요. 모든 모델에 동일한 내부 프롬프트 세트를 적용하여 실행해 보세요. 공개 리더보드는 항상 비교 가능한 버전을 노출하는 것은 아니며, 이전 버전이나 터보(turbo) 변형을 사용하면 비교가 무효화됩니다. |
알려진 제한 사항
- 길이: 30초 경쟁 모델 대비 최대 15초입니다.
- 오픈 가중치 범위: H3-Base 다운로드만 가능하며, Context-IR 및 2K 재생성은 호스팅됩니다.
- 하드웨어: AdaLN 캐싱 트릭을 사용하더라도 33B 밀집 비디오 모델은 로컬에서 비용이 많이 듭니다.
- 비용 구조: 생성(generation), 재생성(regeneration), 레퍼런스 미디어, Context-IR가 각각 별도로 청구됩니다.
- 라이선스: 커뮤니티 라이선스는 법적 승인이 필요합니다.
- 아레나 변동성: 순위는 표류하며 작업별 테스트를 대체하지 못합니다.
접근 경로
- Hailuo 및 MiniMax Design을 포함한 MiniMax 호스팅 제품.
- H3-2K, H3-Context-IR, H3-Regenerate-2K에 대한 퍼스트파티(first-party) MiniMax 오픈 플랫폼.
- 로컬 서비스용으로 공식 레포에서 H3-Base 체크포인트를 다운로드하는 방법.
실제 평가 노트
로컬과 호스팅 환경을 의도적으로 분리하여 사용하세요. 탐색, 프롬프트 반복(prompt iteration), 참조 테스트, 그리고 데이터 지역성 제약 조건이 있는 모든 작업에는 로컬 H3-Base를 사용하세요. 더 풍부한 명령어 파싱(instruction parsing)을 위해서는 호스팅 H3-Context-IR로, 배포 해상도(delivery resolution)를 위해서는 H3-Regenerate-2K로 핵심 작업을 넘기세요. 적절한 분할은 GPU 용량, 처리 시간, 거버넌스, 그리고 호스팅 품질 향상이 전송, 지연 시간, 추가 항목 비용을 정당화하는지에 따라 달라집니다.
평가 세트는 예쁜 프롬프트가 아닌 실제 브리프(brief)에서 구축하고, 명령어 준수도, 주제 및 브랜드 일관성, 시간적 안정성(temporal stability), 텍스트 렌더링, 카메라 움직임 정확도, 오디오-비디오 동기화(audio-video sync), 대화 품질, 재생성 충실도(regeneration fidelity), 지연 시간, 실패율, 그리고 승인된 클립당 비용을 기준으로 점수를 매겨야 합니다. 동일한 에셋과 수용 기준을 가진 모델 간에 비교하세요.
참조 자료는 각 작업별로 준비해야 합니다: 아이덴티티를 위한 이미지 1개, 움직임을 위한 클립 1개, 음성 또는 분위기를 위한 오디오 샘플 1개. 저품질이거나 모순되는 에셋은 제거하고, 클립을 관련 액션으로 자르며, 각 에셋의 목표물과의 관계를 명령어에 명시적으로 기재해야 합니다. 가장 작고 충분한 세트부터 시작하면 어떤 참조 자료가 도움이 되었는지, 그리고 어떤 것이 모호성을 야기했는지를 분명히 알 수 있습니다.
비용 모델링에는 참조 비디오, 추가 이미지, Context-IR 토큰, 재생성(regeneration), 재시도, 거부된 생성물, 로컬 GPU, 스토리지 및 전송, 중재(moderation), 통합 엔지니어링, 그리고 인간 검토 비용이 포함되어야 합니다. 중요한 숫자는 요구되는 해상도에서 승인된 결과물당 비용입니다.
그리고 '기본 2K'를 읽을 때는 계층 구조를 명확히 이해해야 합니다. 이는 호스팅 상업적 경험(hosted commercial experience)을 설명하며, 768p는 다운로드 가능한 H3-Base 단계를 설명하고, H3-Regenerate-2K는 기본 정보와 원래 컨텍스트를 기반으로 최종 결과물을 재구축합니다. 이들을 별도의 워크플로우 단계로 테스트하면서 재생성이 텍스트, 브랜딩, 얼굴, 미세 디테일을 복원하는지, 아니면 단순히 픽셀을 추가하는지만 하는지 확인하세요.
만약 훨씬 더 긴 단일 패스 클립, 완전히 로컬 환경에서의 2K 후처리(finishing), 관대한 라이선스, 최소한의 GPU 지출, 또는 단순한 텍스트-투-비디오가 필요하다면, H3의 일반화된 아키텍처는 운영 비용 측면에서 얻는 이점보다 더 많이 들 수 있습니다. 대표적인 프롬프트로 짧은 개념 증명(proof of concept)을 해보는 것이 가장 저렴하게 알아낼 수 있는 방법입니다.
원문 출판: cometapi.com
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기