Kandinsky 6.0 공개: 3B 및 29B 두 가지 크기로 44kHz 동기 오디오가 포함된 5초 영상 생성
요약
Kandinsky 6.0은 비디오와 오디오를 결합한 확산 모델로, Lite 3B 및 Pro 29B 두 가지 크기로 제공됩니다. 이 모델은 텍스트나 이미지로부터 5초 분량의 클립을 생성하며, 특히 44kHz 동기화된 입술 싱크 오디오와 Full-HD 해상도를 지원합니다. 또한 AMD 그래픽카드를 위한 HelixSR 같은 초해상도 기술도 소개되어 다양한 환경에서의 활용 가능성을 높였습니다.
핵심 포인트
- Kandinsky 6.0은 T2AV/TI2AV를 지원하는 비디오/오디오 확산 모델입니다.
- 5초 분량의 Full-HD 클립과 44kHz 동기 오디오가 특징입니다.
- Hugging Face에 가중치가 공개되며, NVIDIA GPU 환경에서 테스트되었습니다.
- AMD용 HelixSR은 FSR 3.1을 활용하여 다양한 하드웨어에서 초해상도를 구현합니다.
Kandinsky 6.0은 비디오와 오디오를 결합한 확산 모델(diffusion model) 패밀리입니다. Lite 3B, Pro 29B의 두 가지 크기로, 텍스트에서 음성/비디오 생성(T2AV)과 이미지에서 음성/비디오 생성(TI2AV)을 지원하며, 5초 분량의 클립을 출력하고 오디오는 44kHz이며 입술 동기화가 되어 있습니다. 또한 플러그인식 초해상도 모델이 출력 해상도를 Full-HD 1920×1080으로 끌어올립니다.
2026년 10월 6일에 공개되며, 가중치(weight)는 Hugging Face에 올라옵니다. NVIDIA GPU와 Python 3.13/3.14가 필요합니다. 비증류 버전(non-distilled version)으로 5초 Full-HD 영상을 생성하는 데 H100은 402초, RTX 4090은 1247초, RTX 5060 Ti는 3530초가 걸립니다. 추론 시간을 단축할 수 있는 distill 버전도 있으며, ComfyUI, vLLM-omni 및 Diffusers와 연동됩니다.
AMD 그래픽카드로 DLSS 기반 초해상도 네트워크 구동하기
HelixSR은 NVIDIA의 DLSS Model E 네트워크를 AMD의 FSR 3.1 인터페이스에 연결하여, 게임 속 FidelityFX 초해상도 DLL을 직접 대체하는 방식으로 작동합니다. 이 네트워크는 자체 작성한 DirectX 12 계산 경로를 사용하므로 Tensor Core나 NVIDIA 드라이버, CUDA 또는 ROCm이 필요 없으며, Linux 환경에서는 Proton을 통해 구동됩니다.
공식적으로 테스트된 내용은
AI 자동 생성 콘텐츠
본 콘텐츠는 X GPU/AI 하드웨어의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기