GraphVid: 상호작용 그래프를 통한 대화형 그래프 제어 비디오 생성
요약
GraphVid는 상호작용 그래프를 활용하여 정밀한 다중 객체 상호작용을 제어하는 새로운 이미지-to-비디오 생성 모델입니다. 구조화된 관계 주석이 포함된 GraphVid-Bench 데이터셋을 통해 기존 모델 대비 뛰어난 비디오 품질과 제어 성능을 입증했습니다.
핵심 포인트
- 상호작용 그래프를 통한 유연하고 정밀한 다중 피사체 제어 가능
- 대규모 상호작용 중심 비디오 데이터셋 GraphVid-Bench 구축
- 기존 Motion-I2V 대비 FID 및 FVD 지표 대폭 개선
- 적은 학습 데이터와 파라미터로도 높은 비디오 품질 구현
텍스트 프롬프트나 주로 픽셀의 움직임을 제한하는 모션 제어 (motion-control) 입력을 사용하여 정밀한 다중 객체 상호작용 (multi-object interactions)을 지정하는 것이 어렵기 때문에, 제어 가능한 비디오 생성 (Controllable video generation)은 여전히 도전적인 과제로 남아 있습니다. 실제로 궤적 기반 제어 (trajectory-based control)는 사용자가 여러 객체에 대해 정확한 트랙을 직접 그려야 하는 경우가 많으며, 이는 장면의 복잡성이 증가함에 따라 확장성이 떨어지고 폐쇄 (occlusion) 또는 중첩 (overlap) 상황에서 모호해집니다. 유연하면서도 정밀한 다중 피사체 제어 (multi-subject control)를 가능하게 하기 위해, 우리는 구조화된 상호작용 그래프 (interaction graphs)를 통해 대화형 제어를 지원하는 그래프 조건부 이미지-to-비디오 (graph-conditioned image-to-video) 생성 모델인 $\textbf{GraphVid}$를 소개합니다. 나아가, 우리는 상호작용 인지 비디오 생성 모델 (interaction-aware video generation models)의 학습을 가능하게 하기 위해 구조화된 관계 주석 (relational annotations)이 포함된 대규모 상호작용 중심 비디오 데이터셋인 $\textbf{GraphVid-Bench}$를 구축했습니다. 기존의 모션 제어 방법들보다 실질적으로 훨씬 적은 학습 데이터와 적은 학습 가능 파라미터 (trainable parameters)를 사용함에도 불구하고, GraphVid는 강력한 제어 가능성과 비디오 품질을 제공합니다. Motion-I2V와 비교했을 때, GraphVid는 FID를 최대 39.9%, FVD를 37.6% 감소시켰으며, PSNR (9.87=>15.98)과 SSIM (0.38=>0.61)을 개선했습니다. 우리의 결과는 구조화된 의미론적 인터페이스 (structured semantic interfaces)가 제어 가능한 비디오 생성을 위한 강력한 패러다임으로서 잠재력이 있음을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기