ESI-Bench: 인지-행동 루프를 완성하는 체화된 공간 지능을 향하여
요약
ESI-Bench는 에이전트가 능동적인 인지-행동 루프를 통해 보이지 않는 공간 정보를 탐색하고 추론하는 능력을 평가하는 새로운 벤치마크입니다. 실험 결과, MLLM은 수동적 관찰보다 능동적 탐색에서 우수한 성능을 보였으나, 부적절한 행동 선택이 오류를 유발하는 '행동 맹목'과 증거의 품질과 상관없이 성급하게 결론을 내리는 메타인지적 한계를 보였습니다.
핵심 포인트
- ESI-Bench는 OmniGibson 기반으로 10개 작업 범주와 29개 하위 범주를 포함하는 체화된 공간 지능 벤치마크임
- 능동적 탐색(Active exploration)이 수동적 대응 방식보다 실질적으로 우수한 성능을 나타냄
- 모델의 주요 실패 원인은 인지 능력 부족보다는 부적절한 행동 선택으로 인한 '행동 맹목(action blindness)'임
- 불완전한 3D 표현은 오히려 2D 베이스라인보다 공간 관계를 왜곡하여 성능에 악영향을 줄 수 있음
- 모델은 인간과 달리 증거의 품질과 관계없이 높은 확신을 가지고 결론을 내리는 메타인지적 격차를 보임
공간 지능 (Spatial intelligence)은 인지-행동 루프 (perception-action loop)를 통해 전개됩니다. 즉, 에이전트 (agents)는 관찰 (observations)을 획득하기 위해 행동하며, 행동의 함수로서 관찰이 어떻게 변화하는지에 대해 추론합니다. 단순히 보이는 것을 수동적으로 처리하는 것이 아니라, 수동적 감지 (passive sensing)만으로는 해결할 수 없는 가려진 구조, 역학 (dynamics), 포함 관계 (containment), 기능성 (functionality) 등 보이지 않는 것을 능동적으로 밝혀냅니다. 우리는 관찰자를 행위자 (actor)로 재설정함으로써, 완벽한 관찰 (oracle observations)을 가정했던 기존의 공간 지능 공식화에서 벗어납니다. 우리는 Spelke의 핵심 지식 체계에 기반하여 OmniGibson 위에 구축되었으며, 10개의 작업 범주와 29개의 하위 범주를 아우르는 체화된 공간 지능 (embodied spatial intelligence)을 위한 포괄적인 벤치마크인 ESI-BENCH를 소개합니다. 에이전트는 인지 (perception), 이동 (locomotion), 조작 (manipulation) 중 어떤 능력을 배치할지, 그리고 작업 관련 증거를 능동적으로 축적하기 위해 이들을 어떻게 순차적으로 배치할지를 결정해야 합니다. 우리는 최첨단 멀티모달 거대언어모델 (MLLMs)에 대해 광범위한 실험을 수행하였으며, 능동적 탐색 (active exploration)이 수동적 대응 방식보다 실질적으로 우수한 성능을 보인다는 것을 발견했습니다. 에이전트는 명시적인 지시 없이도 창발적인 공간 전략 (emergent spatial strategies)을 자발적으로 발견하는 반면, 무작위 다중 뷰 (random multi-view) 방식은 훨씬 더 많은 이미지를 소비함에도 불구하고 신호 (signal)보다는 노이즈 (noise)를 추가하는 경우가 많았습니다. 대부분의 실패는 약한 인지 능력 때문이 아니라 행동 맹목 (action blindness)에서 기인합니다. 즉, 부적절한 행동 선택이 부적절한 관찰로 이어지고, 이것이 다시 연쇄적인 오류 (cascading errors)를 유발합니다. 명시적인 3D 그라운딩 (3D grounding)은 깊이 민감 작업 (depth-sensitive tasks)에서의 추론을 안정화하지만, 불완전한 3D 표현 (3D representation)은 공간 관계를 왜곡함으로써 2D 베이스라인 (2D baselines)보다 더 해로운 것으로 증명되었습니다. 인간 대상 연구를 통해 추가로 밝혀진 바에 따르면, 반증 가능한 관점 (falsifying viewpoints)을 찾고 모순 상황에서 신념을 수정하는 인간과 달리, 모델은 증거의 품질과 관계없이 높은 확신을 가지고 성급하게 결론을 내립니다. 이는 더 나은 인지나 더 높은 수준의 체화된 상호작용만으로는 메울 수 없는 메타인지적 격차 (metacognitive gap)를 드러냅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기