
MiniMax H3 vs Seedance 2.0: 네이티브 오디오를 포함한 2K 해상도 성능 비교
요약
MiniMax의 최신 비디오 모델 H3가 출시되었습니다. H3는 별도의 작업 없이 네이티브 스테레오 오디오를 포함하며, 2K 해상도의 고화질 비디오 생성이 가능한 범용 멀티모달 모델입니다.
핵심 포인트
- 네이티브 스테레오 오디오 자동 생성 기능 탑재
- 2K @ 24 fps 고해상도 렌더링 지원
- 텍스트, 이미지, 비디오, 오디오를 참조로 사용하는 범용 멀티모달 모델
- Seedance 2.0과 동일한 입력 구조로 비교 가능
MiniMax의 최신 비디오 모델인 H3가 POST videos/create에서 model: "Hailuo-3.0"으로 출시되었습니다. 이 모델은 MiniMax 라인업의 다른 모델들과 구별되는 두 가지 특징이 있습니다. 모든 생성물에 별도의 음성이나 음악 작업 없이 **네이티브 스테레오 오디오 (native stereo audio)**가 포함된다는 점과, 기본적으로 짧은 쪽 모서리가 1440픽셀인 2K @ 24 fps로 렌더링된다는 점입니다 (16:9 비율의 경우 2560×1440, 9:16 비율의 경우 1440×2560).
H3는 특정 작업 전용 모드들의 집합이라기보다 범용 멀티모달 모델 (multimodal model)입니다. 동일한 엔드포인트(endpoint)에서 프롬프트만 입력하거나, 시작 프레임(start frame), 또는 이미지, 비디오, 오디오 참조(references) 트레이를 입력으로 받을 수 있으며, 요청 구조는 Seedance 2.0이 이미 사용하는 방식과 동일합니다. 즉, model, resolution, duration을 직접 설정하면 됩니다.
아래의 세 가지 클립은 각 모드에서 편집 없이 단 한 번의 4초 실행으로 얻은 실제 결과물입니다. 소리를 켜주세요 — 세 클립 모두의 오디오는 모델에 의해 생성되었습니다.
세 번째 클립은 직접적인 비교를 위한 것입니다. 이 클립은 우리의 Seedance 2.0 omni 포스트에서 사용했던 것과 정확히 동일한 이미지, 비디오, 오디오 참조 및 프롬프트를 재사용합니다. 따라서 H3와 Seedance 2.0의 세 가지 티어(tiers)를 별도의 데모가 아닌 동일한 입력값에 대해 평가할 수 있습니다.
Text to video (텍스트-비디오 생성)
참조 데이터 없이 오직 프롬프트만 사용합니다. 여기서는 aspectRatio가 명시되어 있지만, H3는 참조가 제공되지 않을 경우 기본값으로 16:9를 사용합니다.
새벽녘 험준한 해안 절벽 위를 비행하는 항공 촬영 샷. 첫 금빛 햇살에 안개가 걷히며, 저 멀리 아래의 검은 바위 위로 하얀 파도가 부서진다. 외로운 바닷새 한 마리가 프레임을 가로지른다. 시네마틱 와이드 앵글, 자연스러운 컬러 그레이딩 (color grade). 부서지는 파도 소리, 바람 소리, 그리고 멀리서 들리는 갈매기 울음소리.
Your browser does not support the video element.
파도, 바람, 갈매기 소리는 모두 모델이 생성한 것이며, 오디오 트랙에 아무것도 추가되지 않았습니다.
A start frame, with speech (음성이 포함된 시작 프레임)
하나의 이미지를 첫 번째 프레임으로 제공하고, 프롬프트(prompt)가 다음에 일어날 일을 주도하도록 합니다. 아래의 초상화는 저희의 Seedance 2.0 omni post에서 사용된 것과 동일한 참조 이미지이므로, 두 모델을 동일한 입력값으로 비교할 수 있습니다.
fileID — 시작 프레임입니다. 먼저 POST /files를 통해 업로드하세요.
그녀는 카메라를 바라보며 미소 짓고, 따뜻하게 말합니다: "결국 왔군요 — 당신이 나를 바람 맞히는 줄 알았어요." 그녀의 뒤로 따뜻한 바(bar)의 조명이 보케(bokeh) 효과를 내며 빛나고, 카메라는 미세하게 핸드헬드(handheld) 흔들림이 있습니다. 그녀의 목소리 아래로 낮은 재즈 음악과 군중의 웅성거림이 깔립니다.
사용자의 브라우저가 비디오 요소를 지원하지 않습니다.
말하는 대사를 프롬프트에 명시하세요. H3는 텍스트로부터 전달 방식을 렌더링(render)하므로, 대사를 인용하고 그것이 말해지는 것이라고 명시하는 것이 트랙에 목소리를 입히는 방법입니다.
Omni 참조 — 이미지, 비디오, 그리고 오디오의 결합
직접적인 비교를 위해 Seedance 2.0 omni post와 동일한 세 가지 참조 자료 및 동일한 프롬프트를 H3에 실행했습니다. H3는 최대 9개의 이미지, 3개의 비디오, 3개의 오디오 클립을 수용하며, 총 파일 수는 12개로 제한됩니다. 각 파일은 프롬프트 내에서 @ 태그로 지정됩니다.
사용자의 브라우저가 비디오 요소를 지원하지 않습니다.
@video1 — 유지해야 할 장면, 로프(rope), 그리고 움직임입니다. 이 영상의 얼굴은 의도적으로 흐릿하게 처리되었습니다. 비디오 참조에 선명한 실제 얼굴이 있으면 콘텐츠 필터에 의해 거부되기 때문이며, 어차피 정체성은 @image1에서 가져옵니다.
@audio1 — 약 2초 분량의 주도할 음성입니다. 위의 초상화를 @image1으로 사용하는 것과 함께, 이것이 전체 입력 구성(tray)입니다.
@video1에 있는 여성을@image1으로 교체하되, 동일한 야외 배경, 로프, 그리고 점프 동작을 유지하세요. 그녀는@audio1의 목소리로 클립 전체에서 들리도록 "Count me jumping"이라고 명확하게 크게 말합니다.
사용자의 브라우저가 비디오 요소를 지원하지 않습니다.
여기에는 aspectRatio가 전송되지 않았습니다. 참조(references)가 첨부되면 H3는 기본적으로 Auto로 설정되며, 입력값의 9:16 비율에 맞춰 스스로 조정되었습니다.
비용 (What it costs)
H3는 2K 해상도의 출력물 1초당 12 크레딧을 부과합니다. 비디오 참조(video reference)는 생성된 클립 외에 별도로 그 자체의 길이에 따라 동일한 비율로 부과됩니다. 이미지 및 오디오 참조는 초당 추가 비용이 발생하지 않습니다.
| 요청 (Request) | 크레딧 (Credits) |
|---|---|
| 4초 클립, 참조 없음 | 48 |
| ... |
해당 추가 비용은 계획 단계에서 고려할 가치가 있습니다. 비디오 참조의 전체 길이에 대해 출력 지속 시간과 상관없이 비용이 부과되므로, 필요한 동작을 담은 가장 짧은 클립으로 비디오 참조를 트리밍(trim)하세요.
H3의 용도 (Where H3 fits)
Seedance 2.0은 여전히 4K에 도달할 수 있고 480p 및 720p에서 초당 비용이 더 저렴하므로, 대량 반복 작업(volume iteration)이나 최고 해상도가 필요한 경우에는 여전히 더 나은 선택입니다. H3는 단 한 번의 호출(single call)로 소리가 포함된 2K 영상을 원할 때 선택해야 합니다. 네이티브 오디오 트랙(native audio track)은 파이프라인(pipeline)에서 단계 하나를 완전히 제거해주며, 1440p에서의 24 fps는 최종 작업(finishing work)을 위한 실질적으로 차별화된 시작점입니다.
모든 파라미터, 참조 미디어(reference-media) 제한, 그리고 실시간 Try-It 콘솔에 대해서는 POST videos/create 참조 문서를 확인하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기