ElasticTTT: 비디오 편집을 위한 사전 정보 보존형 테스트 시간 튜닝 (Prior-Preserving Test-Time Tuning)
요약
비디오 편집 시 발생하는 사전 정보 붕괴 문제를 해결하기 위해 ElasticTTT 프레임워크를 제안합니다. 생성 모델의 분포를 보존하면서도 효과적인 테스트 시간 튜닝을 가능하게 하여 원샷 비디오 편집에서 SOTA 성능을 달성했습니다.
핵심 포인트
- 표준 TTT의 단일 지점 최적화로 인한 사전 정보 붕괴 문제 규명
- 대상 분포 정규화를 통한 급격한 암기 최소값 방지
- 대조적 CFG를 활용하여 추론을 원본 편향으로부터 유도
- 비동기 노이즈 스케줄로 편집되지 않은 영역의 보존력 강화
- 원샷 비디오 편집 분야에서 최첨단(SOTA) 성능 입증
사전 학습된 확산 모델 (diffusion models)에 대한 테스트 시간 튜닝 (Test-Time Tuning, TTT)은 비디오 편집을 위한 강력한 패러다임으로 부상했습니다. 그러나 생성 모델의 분포 매핑 (distribution-mapping) 특성과 표준 TTT의 단일 지점 최적화 (single-point optimization) 사이에는 근본적인 불일치가 존재합니다. 본 논문에서 우리는 이러한 불일치가 extit{사전 정보 붕괴 (Prior Collapse)}를 유발한다는 것을 입증합니다. 이는 모델이 텍스트 조건 (text conditions)과 공간 잠재 변수 (spatial latents)를 버리고, 생성을 원본 비디오로 붕괴시키거나 서로 다른 영역의 특징들을 엉키게 만드는 퇴보적인 상태를 의미합니다. 이를 해결하기 위해, 우리는 사전 생성 분포 (prior generative distribution)를 보존하고 생성 탄력성 (generative elasticity)을 회복하는 새로운 프레임워크인 extbf{ElasticTTT}를 제안합니다. 구체적으로, 급격한 암기 최소값 (memorization minima)을 방지하기 위한 extit{대상 분포 정규화 (Target Distribution Regularization)}, 추론을 원본 편향 (source biases)으로부터 멀어지도록 유도하는 extit{대조적 CFG (Contrastive CFG)}, 그리고 편집되지 않은 영역을 보존하기 위한 extit{비동기 노이즈 스케줄 (Asynchronous Noise Schedule)}을 제안합니다. 이론적 분석을 뒷받침하는 광범위한 평가를 통해, ElasticTTT가 베이스 모델의 생성 사전 정보 (generative prior)를 성공적으로 보존하며 원샷 비디오 편집 (one-shot video editing)에서 최첨단 (state-of-the-art) 성능을 달성함을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기