FastH3 V2/V3: 프로젝트 현황
요약
FastH3 V2와 V3의 프로젝트 현황을 공유하며, FastH3 V2가 공개된 이후 뛰어난 품질과 모션 일관성을 인정받았습니다. 최근에는 다양한 소비자 GPU를 위한 공식 양자화 가중치와 8GB VRAM용 Trim 모델이 출시되었습니다. 향후 초점은 참조 기반 비디오/오디오 지원을 목표로 하는 Omni Ref, 즉 FastH3 V3 개발에 맞춰져 있습니다.
핵심 포인트
- FastH3 V2는 뛰어난 품질과 모션 일관성을 보여주며 큰 주목을 받았습니다.
- 다양한 소비자 GPU를 위한 공식 양자화 가중치와 Trim 모델이 공개되었습니다.
- 현재 버전은 Ref2VA(참조 이미지 기반) 및 FL2VA 지원에 한계가 있습니다.
- 다음 목표는 참조 기반 비디오/오디오 생성을 지원하는 Omni Ref (FastH3 V3) 개발입니다.
https://preview.redd.it/pr5bl6rcezth1.png?width=834&format=png&auto=webp&s=dca7440c56e169b53a586182368829f848805c9a 3주 전에 FastH3 V2가 공개되었습니다: https://www.reddit.com/r/StableDiffusion/comments/1whh10i/open_weight_fastvideo_fasth3_v2/ 이 모델은 기본적으로 전체 H3의 품질과 동일하다고 주장되었으며: https://x.com/haoailab/status/2099969439466942725 https://haoailab.com/FastVideo/cookbook/minimax-h3/ 저도 동의합니다. 품질이 훌륭하고 모션 일관성이 정말 뛰어납니다. 이 작은 연구소에서 해낼 수 있을 거라고 생각하지 못했지만, 그들은 NVIDIA와 멋진 오픈 소스 모델 개발에 투자한 다른 사람들의 도움을 받았습니다. 대단합니다. 커뮤니티는 출시 당일에 이미 FastH3 V2를 단일 GPU 소비자용 기기에서 실행시켰습니다. --- 오늘, 그들은 다양한 소비자 GPU용 공식 양자화(quantized) 가중치를 공개했습니다: https://huggingface.co/organizations/FastVideo/activity/models 게다가 8GB VRAM처럼 아주 작은 GPU를 위한 새로운 Trim 모델도 있습니다. 포함된 이미지는 그들의 벤치마크를 보여줍니다. 더 자세한 내용은 여기에서 확인할 수 있습니다: https://x.com/haoailab/status/2107591980591227227 --- 불행하게도 이번에는 Ref2VA 모델(텍스트와 참조 이미지, 비디오 및/또는 오디오를 이용한 비디오)을 아직 훈련하지 못했고, FL2VA (첫/마지막 프레임) 지원도 없습니다. https://huggingface.co/FastVideo/FastVideo-FastH3-8-Step-V2#scope 이 체크포인트는 텍스트-투-오디오-비디오 생성을 지원합니다. FL2VA와 Ref2VA는 증류(distilled)되지 않았습니다. 어려운 모션, 미세한 디테일, 그리고 일부 오디오는 기본 MiniMax H3 모델보다 떨어질 수 있습니다. 하지만... 좋은 소식이 있습니다: https://huggingface.co/FastVideo/FastVideo-FastH3-8-Step-V2#acknowledgements Omni Ref가 다음 초점이 될 것입니다. 이것이 바로 Ref2VA의 이름입니다. 따라서 FastH3 V3에서는 참조 기반 비디오/오디오 지원을 볼 수 있을 것입니다. 네, 참조 지원이 있는 증류 모델이 개발되고 있습니다! (PS: Comfy는 두 모델 모두를 기본 모델 레이어를 통해 FL2VA로 라우팅하는 패치를 가지고 있습니다.)
하지만 Ref2VA가 훨씬 더 흥미롭기 때문에, 그것이 지원되기를 기대합니다!) /u/pilkyton 제출 [링크] [댓글들]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기