빠른 이미지 및 비디오 생성을 위한 병렬 디코딩 증류 (Parallel Decoding Distillation)
요약
비디오 및 이미지 생성 모델의 느린 샘플링 속도를 개선하기 위한 새로운 궤적 기반 증류 방법인 PDD를 제안합니다. 기존 방식의 모드 붕괴 문제를 해결하며, 적은 계산 횟수로도 고품질의 다양한 결과물을 생성할 수 있습니다.
핵심 포인트
- 병렬 디코딩 증류(PDD)를 통한 생성 속도 가속화
- 기존 VSD 방식의 모드 붕괴 및 다양성 부족 문제 해결
- 사전 학습된 모든 확산 및 흐름 매칭 모델과 호환 가능
- 4-8 NFE 수준에서 SOTA 성능 및 높은 다양성 달성
비디오 확산 (Video Diffusion) 또는 흐름 모델 (Flow Models)에서의 생성은 느리고 반복적인 샘플링 과정으로 인해 계산 비용이 많이 듭니다. 현재의 최첨단 (SOTA) 가속화 방법들은 확산 모델을 몇 단계의 생성기로 증류 (Distill)하기 위해 변분 점수 증류 (Variational Score Distillation, VSD) 및 적대적 손실 (Adversarial Losses)에 크게 의존합니다. 고품질의 비디오 생성을 달성함에도 불구하고, 이러한 학습 손실 함수들은 최적화하기 매우 어려운 것으로 알려져 있으며 모드 붕괴 (Mode Collapse) 문제를 겪어 비디오의 다양성 상실과 움직임 부족을 초래합니다. 본 논문에서는 확산 및 흐름 매칭 (Flow Matching) 모델의 빠른 추론을 위한 단순화되고 확장 가능한 궤적 기반 증류 방법인 병렬 디코딩 증류 (Parallel Decoding Distillation, PDD)를 소개합니다. 우리의 아키텍처와 학습 절차는 모든 사전 학습된 모델과 호환되며, 다양한 함수 평가 횟수 (NFE)를 통한 샘플링을 지원합니다. PDD는 네트워크 평가당 여러 개의 디노이징 (Denoising) 단계를 예측함으로써 생성을 가속화합니다. 개념적으로, 이는 JVP (Jacobian-Vector Product)나 유한 차분 근사 (Finite-difference Approximations)를 사용하여 미분값을 회귀하지 않고 평균 속도 (Mean Velocity)의 표현을 학습합니다. 우리의 방법은 LTX-2.3 Text-to-Video/Audio, Wan 14B Text-to-Video, 그리고 Qwen-Image Text-to-Image에서 4-8 NFE로 SOTA 성능을 달성합니다. 또한, PDD는 생성된 비디오의 다양성 측면에서 상당한 개선을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기