속보 AI🚨 MiniMax-H3 오픈 소스로 발표
요약
MiniMax가 텍스트, 이미지, 비디오, 오디오를 통합 이해하는 범용 멀티모달 생성 모델인 MiniMax-H3를 오픈 소스로 공개했습니다. 고압축 H3-VAE 아키텍처를 통해 효율적인 토큰 사용과 고품질 비디오 생성을 지원합니다.
핵심 포인트
- 텍스트, 이미지, 비디오, 오디오 통합 멀티모달 모델
- 네이티브 스테레오 오디오를 포함한 비디오 생성 가능
- 2K 해상도에서 최대 15초 분량의 출력 지원
- H3-VAE 아키텍처를 통한 고압축 및 효율적 토큰 사용
속보 AI🚨 MiniMax-H3 오픈 소스로 발표
텍스트, 이미지, 비디오 및 오디오를 통합적으로 이해하는 범용 멀티모달 생성 모델 (multimodal generative model).
주요 특징:
• 네이티브 스테레오 오디오 (Native stereo audio)를 포함한 비디오 생성
• 2K 해상도에서 최대 15초까지 출력
• 고압축 H3-VAE 아키텍처
• 문맥적 옴니 표현 (Contextual Omni Representation)을 통한 더욱 효율적인 토큰 (token) 사용
차세대 멀티모달 모델들 사이에서 주목받는 단계.
#MiniMax https://t.co/DgLjsZRbGF
AI 자동 생성 콘텐츠
본 콘텐츠는 X @DeepTechTR (AI/오픈소스)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기