VISTA: 비디오 주입 스타일화된 Text-to-Animation
요약
VISTA는 텍스트 프롬프트의 구조적 내용과 참조 비디오의 표현적 스타일을 결합하여, 별도의 (텍스트, 비디오, 모션) 트리플렛 없이도 스타일화된 3D 인간 모션을 생성하는 2단계 프레임워크입니다. Dual-channel Autoencoder와 마스크드 자기회귀 확산 백본을 사용하여 잠재 공간에서 작동하며, 전용 Late-fusion 경로로 스타일을 주입합니다.
핵심 포인트
- 텍스트 구조 + 비디오 스타일 결합으로 모션 생성
- 트리플렛 데이터 없이도 3D 인간 모션 구현 가능
- Late-fusion Dual-AdaLN 경로를 통한 스타일 주입
- 콘텐츠와 스타일의 독립적 제어 및 높은 정확도 달성
우리는 VISTA를 소개합니다. 이는 텍스트 프롬프트의 구조적 콘텐츠와 참조 비디오에서 추출한 표현적인 스타일을 융합하여, 공동으로 쌍을 이룬 (텍스트, 비디오, 스타일화된 모션) 트리플렛을 요구하지 않고도 스타일화된 3D 인간 모션을 생성하기 위한 2단계 프레임워크입니다. Dual-channel Autoencoder가 먼저 모션 시퀀스와 비디오 클립을 공유 잠재 공간(shared latent manifold)으로 매핑합니다. 이후 마스크드 자기회귀 확산 백본(masked autoregressive diffusion backbone)이 이 잠재 공간 내에서 작동하며, 전용 Late-fusion Dual-AdaLN 경로를 통해 비디오에서 파생된 스타일을 주입하는 동시에 텍스트 조건부 콘텐츠 구조를 보존합니다. 잠재 순환 일관성(latent cycle consistency)을 갖춘 크로스 배치 비쌍 학습 프로토콜(cross-batch unpaired training protocol)은 별개의 의미론적으로 풍부하고 스타일적으로 다양한 데이터셋 전반에 걸쳐 공동 학습을 가능하게 합니다. 제어 가능한 애니메이션 합성의 개념 증명으로서, 우리는 렌더링된 모션 캡처 참조 자료를 사용하여 VISTA를 검증합니다. VISTA는 비디오 조건부 방법 중 가장 높은 스타일 인식 정확도를 달성하는 동시에 경쟁력 있는 콘텐츠 정렬(content alignment)을 유지하며, 분해된 3-way Classifier-free guidance는 추론 시간(inference time)에 콘텐츠와 스타일의 균형을 독립적으로 사용자 제어 방식으로 보정할 수 있게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기