
PipeNetwork/minimax-h3-mlx
요약
MiniMax-H3를 Apple Silicon에서 실행할 수 있도록 MLX로 포팅한 Python 패키지를 소개합니다. 텍พย์, 이미지, 오디오, 비디오를 처리하는 옴니모달 모델을 MacBook Pro 환경에서 직접 구동하는 과정을 다룹니다.
핵심 포인트
- MiniMax-H3의 MLX 포팅 버전 공개
- Apple Silicon(M5 Max 등) 환경에서 로컬 실행 가능
- 텍스트 기반의 최대 15초 오디오 포함 비디오 생성 지원
- 모델 파일 크기는 약 115GB이며 생성 시 프롬프트 가이드 준수 필요
2026년 8월 4일 - Link Blog
PipeNetwork/minimax-h3-mlx. MiniMax는 이틀 전 MiniMax-H3를 출시했습니다. 그들은 이를 "범용적인 옴니모달 (omni-modal) 생성 시스템"이라고 설명하는데, 이는 실제로 텍스트, 이미지, 오디오 및 비디오를 수용하여 오디오가 포함된 최대 15초 길이의 비디오 클립을 생성할 수 있음을 의미합니다.
이 Python 패키지는 Apple Silicon에서 실행할 수 있도록 이를 MLX로 포팅합니다.
저는 제 M5 Max MacBook Pro에서 이를 실행하는 데 성공했습니다. 저장소(repo)를 클론하고 다음과 같이 모델을 실행했습니다:
# 먼저 모델을 다운로드합니다
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
--include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
...
다음은 제가 입력한 프롬프트로 얻은 비디오입니다:
a rainbow colored skunk leaps over a mossy log in a supermarket (무지개색 스컹크가 슈퍼마켓의 이끼 낀 통나무를 뛰어넘는다)
약 115 GB의 모델 파일을 다운로드했으며, 비디오 생성에는 45분이 조금 안 걸렸습니다.
비디오는 인상적이지만, 오디오는 이상한 말소리 같은 쓰레기(garbage)였습니다. 오디오가 어떠해야 하는지에 대한 프롬프트 가이드를 제공하지 않았기 때문입니다. 프롬프트 가이드(이번 실험 전에 읽지 않았던 것)에는 이를 제대로 작동시키기 위한 많은 정보가 담겨 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: Simon Willison's Weblog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기