MonoVoc: 경량 단안 오픈 보캐블러리(Open-Vocabulary) 3D 가우시안을 위한 기하학(Geometry)과
요약
MonoVoc는 3D 기하학적 재구성과 의미론적 통합을 분리하여 메모리 효율을 극대화한 새로운 3D 가우시안 파이프라인을 제안합니다. 단안 비디오를 통해 경량화된 객체 수준의 의미론적 가우시안 맵을 생성하며, 기존 방식 대비 메모리 사용량을 10배 이상 절감합니다.
핵심 포인트
- 기하학적 재구성과 의미론적 통합의 명시적 분리
- 훈련이 필요 없는(training-free) 효율적인 파이프라인
- 기존 SOTA 대비 메모리 사용량 10배 이상 절감
- 단안 비디오를 활용한 오픈 보캐블러리 3D 검색 가능
오픈 보캐블러리 (Open-vocabulary) 3D 장면 이해는 차세대 상호작용 시스템에 필수적이며, 사용자가 자연어를 사용하여 재구성된 환경을 직관적으로 질의하고 탐색할 수 있도록 지원합니다. 그러나 현재의 3D 가우시안 (3D Gaussian) 프레임워크는 종종 제한적인 다중 뷰 캡처 요구 사항, 비용이 많이 드는 장면별 최적화, 그리고 밀집된 언어 특징 (language features)을 저장하는 데 따른 막대한 메모리 오버헤드로 인해 병목 현상이 발생합니다. 우리는 3D 기하학적 재구성 (geometric reconstruction)을 의미론적 통합 (semantic integration)으로부터 명시적으로 분리함으로써 이 패러다임을 근본적으로 재구상하는 새로운 훈련 불필요 (training-free) 파이프라인을 제시합니다. 표준 단안 비디오 시퀀스 (monocular video sequence)를 입력으로 주면, 우리의 방법은 효율적으로 컴팩트하고 해석 가능하며 완전히 검색 가능한 객체 수준의 의미론적 가우시안 맵 (semantic Gaussian map)을 출력합니다. 매핑 루프 내에 무거운 언어 임베딩 (language embeddings)을 얽어두는 대신, 우리는 기하학을 독립적으로 추출하고 경량화된 모듈형 후처리 프레임워크를 통해 의미론을 접지 (ground)합니다. Replica 데이터셋에 대한 광범위한 평가를 통해, 이 분리된 아키텍처가 강력한 렌더링 충실도 (rendering fidelity)와 경쟁력 있는 세그멘테이션 (segmentation) 정확도를 유지함을 입증했습니다. 결정적으로, 가우시안당 밀집 저장 방식을 모듈형 객체 수준 의미론적 임베딩으로 대체함으로써, 우리의 접근 방식은 SOTA 베이스라인과 비교하여 메모리 사용량을 10배(an order-of-magnitude) 이상 절감합니다. 이는 일상적인 단안 비디오로부터 오픈 보캐블러리 3D 검색 및 질의응답을 수행할 수 있는 매우 효율적이고 확장 가능하며 실용적인 솔루션을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기