암시적 및 명시적 기하학을 활용한 3D 인식 VLM
요약
VLM-IE3D는 RGB 비디오를 통해 암시적 및 명시적 3D 기하학 정보를 학습하여 VLM의 공간 인지 능력을 강화하는 프레임워크입니다. 추가적인 3D 입력 없이도 미세한 공간적 추론과 3D 작업을 수행할 수 있도록 설계되었습니다.
핵심 포인트
- 암시적(IGTs) 및 명시적(EGTs) 기하학 토큰 도입
- 2D 시각적 단서와 3D 기하학 표현을 융합하는 어댑터 탑재
- 3D 비디오 탐지, 시각적 접지, 공간 추론 등에서 우수한 성능 입증
- RGB 전용 설계로 추가 3D 데이터 없이 강력한 공간 이해력 제공
급격한 발전에도 불구하고, 2D 시각적 입력(visual inputs)을 기반으로 구축된 대부분의 기존 시각-언어 모델(VLMs)은 미세한 공간적 이해와 추론을 요구하는 다양한 3D 작업들을 처리할 때 종종 어려움을 겪습니다. 이러한 격차를 해소하기 위해, 우리는 RGB 비디오로부터 학습된 암시적(implicit) 및 명시적(explicit) 3D 기하학(geometries)을 모두 갖춤으로써 VLM의 3D 공간 인지 능력을 향상시키는 통합 프레임워크인 VLM-IE3D를 제안합니다. 우리의 VLM-IE3D는 입력 비디오로부터 고수준의 기하학적 사전 정보(geometric priors)를 포착하는 암시적 기하학 토큰(Implicit Geometry Tokens, IGTs)과, 재구성된 3D 속성으로부터 상세한 기하학적 구조를 인코딩하는 상호 보완적인 명시적 기하학 토큰(Explicit Geometry Tokens, EGTs)을 도입합니다. 이에 더해, VLM-IE3D는 두 종류의 기하학적 표현을 2D 시각적 단서(visual cues)와 효과적으로 융합하는 3D 인식 어댑터(3D-aware adapter)를 탑재하고 있습니다. 이러한 RGB 전용 설계는 추가적인 3D 입력 없이도 미세한 공간적 이해와 추론을 위한 강력한 3D 귀납적 편향(inductive biases)을 주입합니다. 광범위한 실험을 통해 VLM-IE3D가 3D 비디오 탐지(3D video detection), 3D 시각적 접지(3D visual grounding), 3D 밀집 캡셔닝(3D dense captioning) 및 공간 추론(spatial reasoning)을 포함한 다양한 3D 작업에서 일관되게 우수한 성능을 달성함을 보여줍니다. 코드와 모델은 https://github.com/Vegetebird/VLM-IE3D 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기