PDMD: 비디오 확산 모델을 위한 투영 분포 매칭 증류 (Projected Distribution Matching Distillation)
요약
본 논문은 비디오 확산 모델의 학습 안정성 문제를 해결하기 위해 Projected Distribution Matching Distillation (PDMD)을 제안합니다. PDMD는 기존 DMD 업데이트에서 비평가 오류에 편향된 잔차를 투영하여 제거함으로써, 샘플 품질 저하와 아티팩트 발생을 방지하고 학습을 안정화시킵니다.
핵심 포인트
- PDMD는 비디오 확산 모델의 학습 불안정성을 개선합니다.
- 기존 DMD 대비 샘플 품질과 시각적 일관성이 향상되었습니다.
- 추가적인 손실 함수나 네트워크 변경 없이 구현이 용이합니다.
- VBench 및 VideoGen-Eval 등 주요 벤치마크에서 최고 성능을 달성했습니다.
최신 비디오 확산 모델은 긴 시공간 토큰 시퀀스에 걸쳐 수십 번의 노이즈 제거 평가를 필요로 합니다. 분포 매칭 증류(Distribution Matching Distillation, DMD)는 함수 평가 횟수(NFE)를 단 몇 번으로 줄입니다. 하지만 DMD 샘플은 학습 과정 중 저하될 수 있으며, 점진적인 과포화 및 아티팩트를 나타냅니다. 우리는 이러한 불안정성을 비평가(critic) 오류로 추적했으며, 이 오류는 연속적인 학생 업데이트에 진입하여 시간이 지남에 따라 축적됩니다. 우리는 비평가 오류를 필터링하기 위해 투영 분포 매칭 증류(Projected Distribution Matching Distillation, PDMD)를 소개합니다. PDMD는 DMD 업데이트에서 학생-비평가 엔드포인트 잔차와 평행한 성분을 투영하여 제거합니다. 고정된 노이즈 쿼리 하에서, 우리는 이 잔차가 비평가의 엔드포인트 오류에 대한 편향되지 않은 추정치임을 증명합니다. 고차원 가정 하에서, 이 투영은 비평가 오류의 일정한 분율을 제거하는 동시에 이상적인 DMD 신호의 소멸되는 분율만을 폐기합니다. 경험적으로, 이 투영은 학습을 안정화시키고 DMD가 저하되고 부자연스러운 질감을 형성하는 부분에서 샘플 품질을 개선합니다. PDMD는 추가 손실, 네트워크, 데이터, 모델 패스 또는 다단계 훈련 없이 DMD에 한 줄의 코드 변경만 필요로 합니다. Wan2.1을 사용하여, PDMD는 4 NFE에서 VBench 총점 83.73을 달성하여 매칭된 DMD보다 1.03 포인트 앞섭니다. MiniMax-H3 공동 비디오-오디오 생성에서, PDMD는 VideoGen-Eval 시각 총점 83.17을 달성하여 가장 강력한 증류 기준선(baseline)보다 0.41 포인트 높습니다. 또한 PDMD는 비교된 4 NFE 모델 중 모든 여섯 가지 오디오 지표에서 최고 성능을 달성합니다. 정성적 비교 및 사용자 연구 결과는 시각 품질, 움직임, 오디오 품질 측면에서 PDMD가 증류 기준선보다 우수함을 보여줍니다. 코드와 모델은 https://pdmd2026.github.io/에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기