Fluid-Gen-Zero: 학습 없이 물리 기반 비디오 생성기 접지
요약
본 기사는 물리 기반 유체-객체 상호작용 비디오 생성을 위한 훈련이 필요 없는 프레임워크인 Fluid-Gen-Zero를 제시합니다. 이 프레임워크는 모션 다이내믹스를 물리 시뮬레이터에 위임하고, VLM 에이전트와 잠재 공간 안내를 통해 외관 모델링 능력을 결합하는 2단계 워크플로우를 사용합니다.
핵심 포인트
- 물리 기반 비디오 생성을 위한 트레이닝 프리 프레임워크 제시
- VLM과 물리 시뮬레이터를 연결한 2단계 에이전트 워크플로우 구현
- 객체 궤적 오류 및 유체 fEPE를 크게 감소시키며 성능 개선 입증
우리는 물리 인식 유체-객체 상호작용 비디오 생성을 위한 훈련이 필요 없는 프레임워크인 Fluid-Gen-Zero를 제시합니다. 이 프레임워크는 물리적 추론을 외관 합성으로부터 분리합니다. 우리의 핵심 통찰은 모션 다이내믹스(motion dynamics)를 물리 시뮬레이터에 위임하는 동시에, 사전 훈련된 비디오 생성기의 외관 모델링 능력을 보존하는 것입니다. 우리는 두 도메인을 다음과 같은 2단계 에이전트 워크플로우를 통해 연결합니다: 의도 해석 및 생성 클립을 구성하는 '생성 시간 계획(generation-time planning)' 단계에서 Vision-Language Model (VLM) 에이전트가 개입하고, '잠재 공간 안내(latent-space guidance)' 단계에서는 영역 인식 잠재 래핑(region-aware latent wrapping)을 통해 디노이징 과정에 시뮬레이션 신호를 주입합니다. 이 플러그 앤 플레이(plug-and-play) 설계는 현재의 비디오 파운데이션 모델과 호환됩니다. 또한, 우리는 유체-객체 상호작용 비디오 생성을 위한 벤치마크를 소개합니다. Tora (CogVideoX 기반), VACE 및 WanMove (Wan 기반) 전반에 걸쳐 Fluid-Gen-Zero는 시뮬레이션 정렬을 일관되게 개선하여, 객체 궤적 오류(object trajectory error)를 26.7%~81.5%, 유체 fEPE(fluid flow endpoint error)를 67.9%~84.0% 감소시키는 동시에 지각 품질(perceptual quality)을 크게 보존합니다. 인간 선호도 연구에서, 평가자들은 세 가지 백본에 걸쳐 동일한 비교에서 Fluid-Gen-Zero가 55.1%~74.4%의 비율로 우수했으며, 시뮬레이션 기반 방법과의 비교에서는 90.4%~94.2%의 비율로 우수한 것으로 평가했습니다. 코드는 승인 후 공개되고 데이터도 함께 공개될 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기