
M3 Ultra 512GB에서 MiniMax-H3 실측: 소리 포함 5초 영상을 35분 만에 생성
요약
Apple M3 Ultra 512GB Mac Studio 환경에서 MiniMax-H3 모델을 로컬로 구동한 실측 결과입니다. 8bit 양자화된 모델을 통해 5초 분량의 영상과 음성을 생성하는 데 약 35분이 소요됨을 확인했습니다.
핵심 포인트
- M3 Ultra 512GB에서 MiniMax-H3 로컬 구동 가능 확인
- 5초 영상(124프레임) 생성 시 약 35분 소요
- MLX 이식 및 8bit 양자화 모델 사용
- 실행 중 피크 메모리 약 53.69GB 점유
Apple M3 Ultra / 512GB Mac Studio에서 MiniMax-H3를 구동했습니다.
결과를 먼저 말씀드리면, 1344×768 해상도, 124프레임, 30스텝의 음성 포함 영상을 로컬에서 생성할 수 있었습니다. API 대기 시간은 2089.131초(약 35분)였으며, 실측 피크는 53.686 GB였습니다.
다만, 이번에 구동한 것은 H3 전체가 아닙니다. 로컬에 공개된 H3-Base FL2VA를 제3자가 Apple Silicon용으로 이식 및 8bit 양자화(Quantization)한 구성입니다.
동일한 Mac에서 거대 모델을 테스트했던 지난번 Hy3 T512의 실측과는 달리, 이번에는 채팅이 아닌 영상과 음성 생성을 측정했습니다.
AI 생성 영상: MiniMax H3로 생성한 영상과 음성입니다. YouTube에서 보기 / 생성된 MP4 직접 재생하기 본문의 실험에서 생성한 파일입니다. AI 생성물임을 명시하였으며, 모델 라이선스 본문에도 링크를 포함했습니다.
결론: M3 Ultra 512GB에서 MiniMax-H3는 작동한다
| 항목 | 실측 |
|---|---|
| 모델 용량 | 69.296GB |
| ... | 2089.131초 (약 35분) |
| MLX 메트릭 최대값 | 53.686 GB |
| 음성 | 32kHz / stereo |
"M3 Ultra / 512GB에서 돌아가는가"에 대한 답은, 작동합니다. 다만 5초 분량의 생성을 기다릴 수 있는 용도이며, 평소 영상 편집 시 실시간으로 삽입하는 도구로는 적합하지 않습니다.
MiniMax-H3는 LLM이 아니다
MiniMax-H3는 영상과 네이티브 스테레오 음성을 한꺼번에 생성하는 모델입니다. 공개된 정보에 따르면 33B dense Omni Transformer이며, H3-Base는 4~15초, 24fps, 32kHz 스테레오, 768p 출력을 지원합니다.
이번에 사용한 것은 mlx-serve 26.8.2와 MiniMax-H3-FL2VA-MLX-Serve-8bit입니다. 공식 Apple Silicon 버전이 아니라, 동일한 제작자가 만든 MLX 이식 및 양자화 모델입니다.
실험 조건 (Mac Studio M3 Ultra / mlx-serve 26.8.2)
| 항목 | 내용 |
|---|---|
| 실험일 | 2026-08-06 |
| ... |
모델 14개 파일의 합계는 69,296,300,306 bytes, 즉 69.296GB였습니다. 다운로드를 위한 여유 공간과는 별도로 실행 중 메모리도 필요합니다.
릴리스된 macOS arm64 바이너리를 취득하여 mlx-serve --version이 26.8.2가 되는 것을 확인하고, 모델은 리비전(Revision)을 고정하여 취득합니다.
curl -L https://github.com/ddalcu/mlx-serve/releases/download/v26.8.2/mlx-serve-bin-macos-arm64.tar.gz -o /tmp/mlx-serve.tar.gz
echo "f075abd46894c46898eed8912af536feb2d12acb7abf5b5b793377816540ba0b /tmp/mlx-serve.tar.gz" | shasum -a 256 -c -
mkdir -p ~/bin/mlx-serve-v26.8.2
...
mlx-serve로 MiniMax-H3 구동하기
모델을 배치한 디렉토리를 지정하고, 외부로 공개되지 않도록 127.0.0.1로만 대기(Listen)했습니다.
mlx-serve \
--model ~/models/MiniMax-H3-FL2VA-MLX-Serve-8bit \
--serve \
...
구동 시 메모리 사전 예측치는 38.24GB였으며, 사용 가능한 메모리는 420.85GB였습니다.
스모크 테스트(Smoke Test): 64×64로 API 전체 통과 확인
64×64 해상도, 5프레임, 2스텝으로 스모크 테스트를 진행했습니다. 여기서는 화질이 아니라 모델 로드, RGB 프레임, 스테레오 PCM까지 정상적으로 반환되는지를 확인합니다.
결과는 HTTP 200, 15.906초였습니다. RGB는 61,440 bytes, 음성은 25,600 bytes로 기대치와 일치했으며, 영상 0.208초와 음성 0.200초의 차이는 8.3ms였습니다.
서버 프로세스의 최대 RSS는 27.589GB였습니다. 단순히 낮은 해상도에서만 성공하는 것이 아닌지 확인하기 위해, 서버를 재시작한 후 본 측정을 진행했습니다.
1344×768을 30스텝으로 생성
요청은 다음 조건입니다. fast: true
이는 mlx-serve 26.8.2의 고속화를 활성화합니다.
{
"prompt": "A small orange maintenance robot in a yellow raincoat walks slowly across a rain-soaked rooftop in Tokyo at night. Neon signs reflect in puddles. The camera tracks from a low side angle in one continuous cinematic shot. The robot stops beside a small sprouting plant, kneels, shields it from the rain with one hand, then looks toward a passing train in the distance. Realistic wet metal, subtle motion, no text, no cuts. overall_soundscape: steady rain on sheet metal, soft servo whirs synchronized with each step, a distant train passing from left to right, occasional low city hum. non_diegetic_music: sparse warm analog synth notes, quiet and restrained, no vocals.",
"num_frames": 124,
...
}
curl -sS --max-time 14400 \
-X POST http://127.0.0.1:11235/v1/video/generations \
-H 'Content-Type: application/json' \
...
| 항목 | 실측 |
|---|---|
| HTTP | 200 |
| API 소요 시간 | 2089.131 초 (약 35분) |
| sampling | 1978.777 초 |
| video decode | 93.816 초 |
| audio decode | 2.787 초 |
| MLX 메트릭 최대값 | 53.686 GB |
| 서버 최대 RSS | 21.529 GB |
첫 번째 스텝은 185.470초, 두 번째 스텝은 185.666초였습니다. 세 번째, 네 번째 스텝은 velocity cache가 적용되어 각각 102ms, 3ms까지 단축되었습니다.
메모리는 기동 시 사전 추정치인 38.24GB를 초과하여 실측으로는 53.686 GB까지 올라갔습니다. 모델이 약 69GB이고 실행 시 피크가 약 53.686 GB라는 점은 분리해서 보는 것이 좋을 것 같습니다.
ffmpeg로 영상과 음성을 MP4에 합치기
API는 RGB8 프레임과 PCM s16le 오디오를 base64로 반환합니다. 디코드 후, ffmpeg로 H.264 / AAC로 합쳤습니다.
ffmpeg \
-f rawvideo -pixel_format rgb24 -video_size 1344x768 -framerate 24 -i video.rgb \
-f s16le -ar 32000 -ac 2 -i audio.pcm \
...
다음 내용을 기계적으로 검사하고, 시작/중앙/끝 프레임은 로컬에서 육안으로 확인했습니다.
- RGB 바이트 수가
124 × 1344 × 768 × 3와 일치한다. - 영상 5.167초와 음성5.175초의 차이가 60ms 미만이다. - 프레임이 단색이 아니라 시간 방향으로도 변화한다. - 음성이 무음이 아니며, 좌우 2채널을 가진다.
- ffprobe가 H.264 영상과 AAC 음성 모두를 읽을 수 있다.
응답의 base64를 로컬 파일로 되돌리려면 다음과 같이 합니다. 이 버전의 API는 영상을 data에, 음성을 audio_data에 반환합니다. 생성된 MP4만 공개 링크로 하고, 원래의 base64 응답, RGB, PCM은 공개하지 않습니다.
python3 - <<'PY'
import base64, json
with open(
이번에는 생성된 MP4를 공개합니다. 2026-08-06에 확인한 동봉된 MiniMax H3 Community License는 이용 가능 지역에서 EU, 영국, 한국, 미국을 제외하며, 대상 외 지역에서 모델이나 출력을 표시 또는 배포하는 것을 금지하고 있습니다. 또한, AI 생성물임을 명시해야 한다는 조건도 있습니다. 이 기사에서는 AI 생성물임을 명기하였으며, 검증 시 고정했던 라이선스 본문으로 링크를 연결해 두었습니다. 이용 지역 및 전 세계 공개 처리에 대해서는 각자 확인하시기 바랍니다.
이는 법적 조언이 아닙니다. 사용하는 지역과 공개 방법은 모델에 동봉된 라이선스를 직접 확인하시기 바랍니다.
## 이번에 말할 수 있는 범위
- M3 Ultra / 512GB 환경에서 H3-Base FL2VA 8bit의 1344×768 생성을 끝까지 완료했다.
- 5.167초 분량 1개를 만드는 대기 시간은 약 35분이었으며, 피크(Peak)는
`53.686`
GB였다. - H3-Context-IR, Ref2VA, Regenerate-2K 등 공식 PyTorch 구현체는 시도하지 않았다.
다음에는 4bit 버전을 동일한 시드(seed)로 돌려, 모델 용량과 메모리를 줄였을 때 화질이 어디까지 변하는지 살펴보겠습니다.
### Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기