
Minimax-H3 비디오 모델 출시, 수일 내 오픈 웨이트(Open Weights) 공개 예정
요약
MiniMax가 텍ID, 이미지, 비디오, 오디오를 통합 이해하는 멀티모달 생성 모델 H3를 출시했습니다. 2K 해상도 비디오와 스테레오 사운드를 생성하며, 조만간 오픈 웨이트(Open Weights)로 공개될 예정입니다.
핵심 포인트
- 텍스트, 이미지, 비디오, 오디오를 통합 이해하는 멀티모달 모델
- 최대 15초 길이의 2K 해상도 비디오 및 네이티브 스테레오 사운드 생성
- 주류 모델 대비 압도적인 비용 효율성 제공
- 수일 내에 오픈 웨이트(Open Weights) 공개 예정
https://x.com/MiniMax_AI/status/2083006198828417501?s=20 그들의 기사 인용: 오늘 우리는 범용 멀티모달 생성 모델인 MiniMax H3를 출시합니다. H3는 텍스트, 이미지, 비디오, 오디오 전반에 걸친 통합된 문맥(Unified Context)을 이해하며, 최대 15초 길이의 2K 해상도 비디오를 네이티브 스테레오 사운드와 함께 생성합니다. 초기 테스트 결과, H3는 지시 이행(Instruction Following), 정확한 텍스트 및 브랜드 렌더링, 그리고 V2V 모션 전이(Motion Transfer)에서 탁월한 성능을 보이며 다양한 사용 사례에 걸친 상업적 콘텐츠 제작 준비가 되었음을 보여줍니다. 정밀하고 제어 가능한 멀티모달 생성 및 편집 기능을 갖춘 H3는 광고, 브랜딩, 이커머스(E-commerce), 제품 디자인, UI/UX, 게임 등 다양한 분야를 위해 구축되었습니다. Contextual Omni Representation, H3-VAE, H3-Omni Transformer, In-Context Regeneration을 포함한 기술을 기반으로 하는 H3는 업계 최고의 가성비를 제공합니다. 우리는 기본적으로 2K 해상도를 제공합니다. 2K 해상도에서 H3의 초당 가격은 주류 모델의 3분의 1 미만이며, 768p 해상도에서는 주류 모델의 720p 가격의 절반 미만입니다. 폐쇄형 소스(Closed-source) 모델은 그동안 비디오 생성 분야를 지배해 왔으며, 대규모 언어 모델(LLM)과 같은 분야에 비해 반복 속도가 느리고 생태계가 덜 개방적이었습니다. 오픈 소스 커뮤니티를 지원하고, 더 넓은 범위의 AI 하드웨어와의 호환성을 가속화하며, 사용자가 자신만의 맞춤형 버전을 구축하기 쉽게 만들기 위해, 우리는 관련 법률 및 규정에 따라 수일 내에 모델 웨이트(Model Weights)를 공개할 계획입니다. 하드웨어 호환성은 H3 설계의 초기 단계부터 핵심적인 고려 사항이었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기