Wonder: 더 나은 비디오 월드 모델 (Video World Model)
요약
실시간 카메라 제어가 가능한 범용 비디오 월드 모델 Wonder를 소개합니다. 새로운 카메라 컨디셔닝, 희소 어텐션 기반 메모리 메커니즘, 증류 파이프라인을 통해 긴 시간 동안 일관된 비디오 생성을 지원합니다.
핵심 포인트
- 실시간 카메라 제어를 통한 상호작용 가능한 월드 구축
- 조밀한 좌표 필드를 활용한 새로운 카메라 컨디셔닝 도입
- 효율적인 희소 어텐션 기반 메모리 메커니즘 제안
- 16 FPS 속도로 분 단위의 일관된 비디오 합성 가능
우리는 실시간으로 카메라 제어가 가능한 월드 탐색을 위한 범용 비디오 월드 모델 (Video World Model)인 Wonder를 선보입니다. 이미지 또는 조건부 비디오 (conditional video)가 주어지면, Wonder는 사용자가 카메라를 움직여 상호작용하며 탐색할 수 있는 플레이 가능한 월드를 구축하며, 실시간 및 장기적인 관점에서 보이지 않았던 영역을 발견하거나 이전에 관찰했던 영역을 다시 방문할 수 있게 합니다. 이러한 능력을 달성하기 위해서는 제어 방법 (control method), 메모리 메커니즘 (memory mechanism), 그리고 학습 전략 (training strategy)의 시스템 수준 공동 설계 (system-level co-design)가 필요합니다. 우리는 렌더링을 통해 공간적으로 정렬된 움직임과 방향 단서를 제공하는 조밀한 좌표 필드 (dense coordinate field)를 활용한 새로운 카메라 컨디셔닝 (camera conditioning)을 도입하여, 모델이 카메라 움직임을 시각적 증거로 직접 해석할 수 있도록 합니다. 확장되는 생성 컨텍스트 (generation context)에 대해 빠르고 정확한 메모리 검색을 지원하기 위해, 우리는 효율적인 희소 어텐션 기반 (sparse attention-based) 메모리 메커니즘을 제안합니다. 이를 통해 모델은 실제 컨텍스트 길이에 관계없이 추론 시점에 소수의 관련 컨텍스트 토큰에 선택적으로 어텐션 (attend)할 수 있습니다. 나아가 우리는 셀프 포싱 스타일 (self-forcing-style)의 증류 파이프라인 (distillation pipeline)을 교정하기 위한 여러 기술을 개발하여, 학생 모델 (student model)이 제어 신호를 준수하는 능력뿐만 아니라 교사 모델 (teacher)로부터 다양한 생성 모드와 장기 메모리를 유지하는 능력을 향상시켰습니다. 이러한 구성 요소들이 결합되어 Wonder는 긴 롤아웃 (rollouts) 동안 일관된 기하학적 구조 (geometry), 외형 (appearance), 그리고 역학 (dynamics)을 유지하면서 16 FPS의 속도로 다양한 분 단위 (minute-scale) 비디오를 합성할 수 있습니다. 이미지-to-비디오 (image-to-video) 생성을 넘어, Wonder는 비디오 조건부 생성 (video-conditioned generation)을 자연스럽게 지원하여 기존의 동적인 장면을 실시간으로 재촬영할 수 있게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기