뒤돌아보지 않기: 자가 중심 비디오에서 3D 객체 메모리 내 지속성 이해
요약
본 논문은 체화된 어시스턴트가 일상 활동 중 객체 위치와 역사, 상황적 설명을 결합하여 지속적인 3D 객체 메모리인 Ledger를 구축하는 방법을 연구합니다. 이 시스템은 시야에서 벗어난 후에도 객체를 유지하며, 로컬라이제이션 노이즈를 줄이고 공간적 질문에 답할 수 있도록 합니다.
핵심 포인트
- Ledger: 위치, 역사, 상황 설명을 결합한 3D 객체 메모리 제시
- 시야 이탈 후에도 객체 정보를 유지하여 지속성 확보
- HD-EPIC 및 UCS-Bench 정확도 향상 입증 (42.6%, 38.5%)
- 시간적/상황적 설명의 상호 보완적 역할 분석
우리가 세상을 이동하고 일상적인 작업을 수행하면서, 나중에만 관련성이 생기는 객체들을 마주칩니다. 우리는 그것을 어디에 두고 왔는지 또는 용기 안에 무엇이 들어 있었는지를, 나중에 필요할 것이라는 것을 알지 못하더라도 기억할 수 있습니다. 여기서는 체화된 어시스턴트가 사람의 일상 활동을 관찰함으로써 유사한 메모리를 어떻게 구축할 수 있는지 연구합니다. 우리는 객체 위치, 그 역사, 그리고 상황적 설명을 결합한 지속적인 3D 객체 메모리인 Ledger를 제시합니다. 이는 기록 전반에 걸쳐 관측치를 연관시키고, 사람이 만지지 않는 객체를 포함하여 시야에서 벗어난 후에도 객체를 유지합니다. 이 시스템은 휴식 위치별로 각 객체의 관측치를 클러스터링하고, 반복적인 증거가 있을 때만 이동을 기록함으로써 로컬라이제이션 노이즈의 영향을 줄입니다. 짧은 설명은 객체의 내용물이나 지지 표면과 같은 세부 사항을 보존합니다. 이는 나중에 원본 이미지나 비디오에 접근할 필요 없이 공간적 질문에 답하기 위해 이러한 기록들을 저장합니다. 우리의 메모리는 HD-EPIC 정확도를 29.7%에서 42.6%로, UCS-Bench 정확도를 33.8%에서 38.5%로 향상시키고, 반환된 예측에서 Ego4D 객체를 0.99 m의 중앙 오차로 로컬라이즈합니다. 우리의 분석은 시간적 지속성(temporal persistence), 상황적 설명(contextual descriptions), 그리고 검색(retrieval)의 상호 보완적인 역할을 식별합니다. 여러 장면으로 구성된 100개의 스티치된 스트림에 대한 우리의 연구는 검색과 구축 모두에서 실패를 추가로 노출시킵니다. 장면에 따른 구축은 단일 장면 스트림에 비해 장면 변화 전반에 걸쳐 손실된 성능을 부분적으로 회복합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기