
【기술 해설】 MiniMax H3 (Hailuo 3.0) — API 엔드포인트 구조·프롬프트 설계·통합 패턴
요약
MiniMax H3(Hailuo 3.0) 멀티모달 비디오 생성 모델의 API 엔드포인트 구조와 프롬프트 설계 가이드를 설명합니다. 입력 구성에 따른 3가지 엔드포인트 활용법과 역할 지정(Role Designation)을 통한 정교한 영상 제어 패턴을 다룹니다.
핵심 포인트
- 입력 유형에 따라 Text, Image, Reference-to-Video 3개 엔드포인트로 분기
- Reference-to-Video 엔드포인트에서 파일별 역할(Identity, Motion 등) 명시 필수
- 역할 지정 없이 다중 파일을 투입하는 것은 예측 불가능한 결과를 초래하는 안티 패턴
- 텍스트와 오디오를 단일 컨텍스트에서 처리하여 2K 해상도 및 스테레오 오디오 생성
MiniMax H3는 2026년 7월 31일에 출시된 유니파이드 멀티모달 (Unified Multimodal) 비디오 생성 모델이다. 기술적으로는 Hailuo 3.0과 동일하다. 텍스트·이미지·동영상·음성을 단일 컨텍스트 (Context)에서 처리하며, 네이티브 2K (2560×1440) 영상 + 스테레오 오디오 (Stereo Audio)를 반환한다. 자세한 내용은 MiniMax H3를 참조할 것.
| 항목 | 값 |
|---|---|
| 해상도 | 2K (2560×1440) |
| ... | |
| 입력 구성에 따라 3개의 엔드포인트 (Endpoint)로 분기된다. |
Text-to-Video
입력: 텍스트 프롬프트 (Text Prompt)만. 미디어 없음.
Image-to-Video
입력: 텍스트 + 이미지 (시작/종료 프레임으로 지정). 2개 프레임 사이를 모델이 보간 (Interpolation).
Reference-to-Video
입력: 텍스트 + 이미지/동영상/음성을 참조 자료로 투입. 아이덴티티 (Identity) 고정, 모션 전이 (Motion Transfer), 스타일 매칭 (Style Matching), 음성 클론 (Voice Clone), 클립 편집. 가장 고기능인 엔드포인트.
# 라우팅 로직 (Routing Logic)
def select_endpoint(media_files, frame_designation):
if not media_files:
...
fal.ai에서는 3개의 엔드포인트가 개별적으로 공개되어 있다.
reference-to-video
엔드포인트의 핵심 설계. 각 파일에 프롬프트 내에서 역할을 명시적으로 부여한다.
| 역할 (Role) | 파일 유형 | 용도 |
|---|---|---|
identity | 이미지 | 캐릭터 얼굴/외형 고정 |
wardrobe | 이미지 | 착용할 의상 |
style | 이미지 | 색채/질감/미적 방향성 |
environment | 이미지 | 배경/장소 설정 |
motion | 동영상 | 동작/카메라 패스 (Camera Path) 복제 |
edit_target | 동영상 | 편집 대상인 기존 클립 |
voice | 음성 | 음성 특성 클론 |
music | 음성 | 리듬 구조에 의한 비주얼 동기화 |
ambience | 음성 | 환경음 참조 |
역할 지정은 프롬프트 텍스트 내의 자연어로 수행한다:
Image 1 = character identity reference.
Image 2-4 = wardrobe references.
Video 1 = camera movement reference.
...
안티 패턴 (Anti-pattern): 여러 파일을 역할 지정 없이 투입. 모델이 모호하게 해석하여 예측 불가능한 출력이 된다.
7개 요소의 템플릿이 가장 안정적인 결과를 낳는다.
esservation: # I2V 시에만. 첫 번째 줄에 기술
- "병의 형상, 라벨, 재질을 유지"
subject: # 피사체의 구체적 묘사
...
Preserve exact bottle shape, label text, cap design,
glass material, colours, and proportions.
Glass perfume bottle on marble surface.
...
Image 1 = character identity reference.
30s woman, short black hair, white linen shirt.
Walks quickly through narrow rain-soaked alley,
...
H3는 영상과 동일한 추론 패스 (Inference Path)로 스테레오 오디오를 생성한다. 사운드를 별도의 트랙으로 디렉팅 (Directing)한다.
# 좋은 예
Sound: espresso machine hissing (continuous),
cup placed on saucer at 0:04,
...
악기, SFX의 타이밍, 무음 구간을 명시할수록 오디오 품질이 향상된다.
Reference-to-Video Edit
재생성 없이 기존 클립을 부분 수정하는 기능.
# 워크플로우 (Workflow)
edit_input = {
"edit_target": existing_clip,
...
원칙: 1회의 패스 (Pass)로 1개 요소만 수정. 순차적 접근이 가장 안정적이다.
Phase 1: 768p → 프롬프트 + 리퍼런스 (Reference) 조합 테스트
Phase 2: 방향 확정 → 2K 최종판 렌더링
Phase 3: 인스트럭션 (Instruction) 편집 → 부분 수정 (재생성 회피)
모든 생성에 동일한 identity 이미지를 투입
+ 프롬프트로 외형 특징을 텍스트 기술 (듀얼 앵커 (Dual Anchor))
= 드리프트 (Drift) 방지
이미지만을 사용하는 단일 앵커 (Single Anchor) 방식에서는 드리프트 (Drift)가 발생합니다. 이미지와 텍스트를 함께 사용하는 듀얼 앵커 (Dual Anchor) 방식이 필요합니다.
| 모델 | 강점 | H3 대비 약점 |
|---|---|---|
| Kling 3.0 | 네이티브 4K | 옴니 리퍼런스 (Omni-reference) 제어 없음 |
| ... | ||
| 주의: H3는 출시 직후입니다. 독립 아레나 (Arena) 점수가 아직 확립되지 않았습니다. 비교 결과는 잠정적입니다. |
MiniMax 발표: "수일 내에" 법적 규제를 준수하여 가중치 (Weights)를 공개할 예정입니다. 일정 및 라이선스는 아직 미정입니다. 이것이 실현된다면 프런티어 (Frontier)급 비디오 모델 중 최초로 오픈 소스화되는 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기