WorldCrafter: 암시적 3D 인식 메모리를 갖춘 일관된 비디오 월드 모델
요약
WorldCrafter는 암시적 3D 인식 메모리를 갖춘 비디오 월드 모델입니다. 이 모델은 카메라 질의가 가능한 메모리 인코더와 자세 조건부 판독 모듈을 통해, 다양한 시점의 증거를 효율적으로 압축하고 통합합니다. 이를 통해 단일 입력으로부터 장기적인 시간적 일관성을 유지하며 스트리밍 장면 탐색이 가능해졌습니다.
핵심 포인트
- 암시적 3D 인식 메모리를 도입하여 비디오 월드 모델의 한계를 극복했습니다.
- 다중 시점 증거를 제한된 토큰 예산으로 효율적으로 압축합니다.
- 자세 조건부 판독 모듈로 역사적 관측치를 목표 시점에 통합합니다.
- 장기적인 시간적 일관성과 카메라 제어 정확도가 향상되었습니다.
비디오 월드 모델(Video world models)은 동적 환경의 상호작용 탐색을 가능하게 하지만, 장기적인 시점과 다양한 시점을 넘어서 이전 관측치를 존중하는 데 어려움을 겪습니다. 우리는 이러한 목적을 위해 카메라 질의가 가능한 암시적 3D 인식 메모리(implicit 3D-aware memory)를 학습하는 비디오 월드 모델 WorldCrafter를 제시합니다. 핵심 통찰은 요청된 시점(viewpoint)이 다중 시점 증거(multi-view evidence)가 비디오 생성기의 제한된 토큰 예산으로 어떻게 압축되는지를 결정하도록 하는 것입니다. 메모리 인코더와 자세 조건부 판독 모듈(pose-conditioned readout module)은 비디오 생성기와 공동으로 학습되어, 명시적인 깊이 기반 대응 관계 없이 역사적 관측치를 고정된 목표 시점별 토큰 세트로 통합합니다. 이 메모리를 최근의 시간적 맥락(temporal context) 및 소수 단계 증류(few-step distillation)와 결합함으로써, WorldCrafter는 단일 입력 이미지나 텍스트 프롬프트로부터 스트리밍 장면 탐색을 가능하게 합니다. 정적 및 동적 장면 전반에 걸친 실험은 장기 시점 일관성 및 카메라 제어 정확도에서 상당한 향상을 보여주었으며, 미세 규모의 탐색 동안 시각적 품질을 유지합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기