MosaiChunk: 자기회귀 비디오 생성을 위한 시공간 메모리 합성
요약
본 논문은 장기 호라이즌의 자기회귀 비디오 생성에서 발생하는 시각적 디테일 손실 문제를 해결하기 위해 MosaiChunk라는 시공간 메모리 합성 메커니즘을 제안합니다. 이 방법은 과거의 역사적 키-값(KV) 엔트리를 모자이크 형태로 재구성하여, 고정된 비디오 생성기가 이를 직접 소비하고 콘텐츠를 복구할 수 있게 합니다.
핵심 포인트
- MosaiChunk는 시공간 메모리 메커니즘으로 디테일 손실을 방지합니다.
- 생성기는 고정하고, 역사적 섹션 선택만 학습하는 가벼운 라우터를 사용합니다.
- RememBench를 도입하여 T2V 및 I2V 재방문 일관성을 평가합니다.
- 슬라이딩-윈도우 대비 전체 청크 검색에서 성능 개선을 입증했습니다.
장기 호라이즌(long-horizon)의 자기회귀(autoregressive) 비디오 생성은 유한한 컨텍스트 윈도우에 의해 제한됩니다. 객체나 장면이 컨텍스트에서 벗어날 경우, 그 세밀한 시각적 디테일이 손실될 수 있으며 재출현 시 복구하기 어려울 수 있습니다. 이러한 시각적 디테일에 대한 접근을 유지하기 위해, 우리는 공간과 시간을 가로질러 선택된 역사적 키-값(KV) 엔트리들의 모자이크를 합성하는 시공간 메모리 메커니즘인 MosaiChunk를 도입합니다. 우리의 접근 방식은 고정된 비디오 생성기가 이러한 비연속적인 역사적 KV를 직접 소비하고 해당 시각적 콘텐츠를 복구할 수 있다는 관찰에서 동기 부여되었습니다. 따라서 우리는 생성기를 고정시키고, 주어진 활성 메모리 예산(active-memory budget) 하에 어떤 역사적 섹션을 모자이크에 포함할지 결정하는 가벼운 라우터(router)만을 학습합니다. 나아가 우리는 프롬프트 기반 텍스트-투-비디오(T2V)와 카메라 구동 이미지-투-비디오(I2V) 분할을 갖는 장기 호라이즌 재방문(revisits)의 벤치마크인 RememBench를 도입합니다. 우리의 실험은 MosaiChunk가 T2V 및 I2V 설정 모두에서, 매칭된 메모리 예산 하에 슬라이딩-윈도우 추론(sliding-window inference) 및 전체 청크 검색(whole-chunk retrieval) 대비 재방문 일관성(revisit consistency)을 지속적으로 개선함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기