Prism (Tencent Hunyuan + Fudan) 미리 보기 공개: 네이티브 2K 비디오 및 오디오, MIT 라이선스
요약
Prism은 Tencent Hunyuan과 Fudan의 협력으로 개발된 2K 네이티브 비디오 및 오디오 생성 모델입니다. 이 모델은 동적 희소 어텐션 트릭을 사용하여 학습 속도를 높이고, 높은 품질의 립 싱크와 사운드 디자인을 구현했습니다. MIT 라이선스를 따르며 관련 코드도 공개되었습니다.
핵심 포인트
- 2K 네이티브 비디오/오디오 생성 가능
- 동적 희소 어텐션으로 학습 효율 개선
- MIT 라이선스 및 학습/파인튜닝 코드 공개
- 고해상도(1080p/2K) 구동을 위해 다중 GPU 필요
HF에서 Prism을 접했는데, 프리뷰 체크포인트가 정말 좋아 보입니다. 이 모델은 비디오와 오디오를 한 번에 생성하며, 네이티브로 720p, 1080p, 그리고 2K 해상도에서 작동합니다. 프로젝트 페이지에서는 Kling 3, MiniMax H3, Wan 3.0, Seedance 2.5와 나란히 비교했는데, 솔직히 성능이 뒤지지 않습니다. 립 싱크(Lip sync)와 사운드 디자인(sfx, 음악, 다국어 음성 포함)이 데모에서 매우 탄탄해 보입니다.
논문은 주로 2K에서 학습하기 위한 동적 희소 어텐션(dynamic sparse attention) 트릭에 관한 것입니다. 이들은 전체 어텐션 대비 2.5배 빠른 학습 속도를 주장하며, 품질까지 더 좋다고 합니다. 알아두면 좋을 몇 가지 사항이 있습니다:
- 프리뷰 체크포인트 두 가지: alpha (안정적 버전)와 beta (모션 버전).
- 'Prism-pro'는 아직 할 일 목록에 남아있습니다.
- MOVA를 기반으로 하며 MIT 라이선스를 따릅니다. 또한 학습 및 파인튜닝 코드도 공개했습니다.
하드웨어 관련 주의사항: 720p는 단일 80GB GPU로 실행되지만, 1080p/2K는 80GB 카드 4개 이상이 필요합니다. 따라서 아직 로컬 모델은 아니며, ComfyUI 지원도 현재까지는 없습니다.
아직 초기 단계이지만, Tencent에서 MIT 라이선스를 적용한 2K 오디오-비디오 모델이 나온 것은 반가운 일입니다. 혹시 누군가 양자화(quantized) 버전이나 ComfyUI 버전을 만들 계획인지 궁금합니다. 여기 클립 중 하나를 공유합니다 (숲길의 산악 자전거, 오디오 포함). 모션 블러와 자전거 물리 효과가 꽤 잘 유지됩니다!!!
HF: https://huggingface.co/FrancisRing/Prism
프로젝트 페이지: https://francis-rings.github.io/Prism
코드: https://github.com/Tencent-Hunyuan/Prism
제출자: /u/Current-Row-159 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기