DepthWorld: 로봇 조작을 위한 3D 월드 모델
요약
본 논문은 로봇 조작에 필요한 3D 월드 모델의 한계를 극복하기 위해 DepthWorld를 제안합니다. 기존 비디오 기반 모델이 RGB만으로 학습되어 일관된 3D 세계 구성에 어려움이 있었는데, 이를 해결하고자 스테레오 깊이를 결합하는 보정 파이프라인을 개발했습니다.
핵심 포인트
- 스테레오 깊이와 공동 요인 그래프를 결합하여 정확한 3D 데이터를 생성함.
- DROID 데이터셋 기반으로 DROID-3D라는 정밀하게 보정된 3D 데이터셋을 구축함.
- DepthWorld는 공간 잠재 타일링을 통해 RGB와 깊이를 동시에 예측하는 월드 모델임.
- 깊이 감독은 RGB 예측 성능 향상과 정확한 계측 깊이 제공이라는 두 마리 토끼를 잡음.
월드 모델(World models)은 정책 평가(policy evaluation), 개선 및 계획(planning)에 걸쳐 응용 분야가 있는 로보틱스에서 전통적인 시뮬레이터의 데이터 기반 대안을 제공합니다. 이러한 모든 사용 사례는 충실한 3D 기하학(geometry)에 의존하지만, 현재 비디오 기반 월드 모델은 RGB만으로 학습되며 프레임별로는 올바르게 보이지만 일관된 3D 세계로 구성되지 않는 결과물(rollouts)을 생성합니다. 이 격차를 해소하려면 두 가지 전선에서 발전이 필요합니다: 조작을 위한 대규모 3D 감독 데이터와 강력하게 사전 학습된 비디오 사전 지식(video priors)을 방해하지 않으면서 이를 흡수할 수 있는 아키텍처입니다. 우리는 학습된 스테레오 깊이(learned stereo depth)를 공동 요인 그래프(joint factor graph)와 결합하는 보정 파이프라인을 소개하며, 동일한 물리적 로봇에서 수집된 모든 에피소드를 풀링하여 공유 운동학 매개변수(shared kinematic parameters)와 장면별 외부 파라미터(per-scene extrinsics)를 복구합니다. DROID 데이터셋에 적용했을 때, 이는 조밀한 계측 깊이(dense metric depth)와 재보정된 다중 뷰 외부 파라미터를 제공하는 보정된 3D 데이터셋인 DROID-3D를 산출합니다 (외부 카메라의 90% 에피소드에서 <0.7 px 재투영 오차 달성). 그런 다음, 우리는 공간 잠재 타일링(spatial latent tiling)을 통해 다중 뷰 RGB와 깊이를 공동으로 예측하는 Stable Video Diffusion 기반 월드 모델인 DepthWorld를 학습시킵니다. 이 과정에서 사전 학습된 Variational Autoencoder (VAE)는 변경되지 않습니다. 깊이 감독은 동일한 RGB 전용 기준선 대비 +1.48 dB PSNR로 RGB 예측 자체를 개선할 뿐만 아니라, 다운스트림 기하학적 추론을 위한 정확한 계측 깊이를 동시에 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기