
HumanCLAW: 시각-언어 모델(Vision-Language Models)이 신체를 통해 행동할 수 있는가?
요약
Meta와 공동 연구진이 시각-언어 모델(VLM)의 체화된 행동 능력을 평가하는 새로운 벤치마크인 HumanCLAW를 발표했습니다. 연구 결과, 현재의 VLM은 신체에 대한 자기 인식 능력이 부족하여 행동 결정 과제에서 매우 낮은 성능을 보였습니다.
핵심 포인트
- HumanCLAW 벤치마크: 행동 결정과 운동 제어를 분리하여 평가
- VLM의 한계: 최고 성능 모델도 16.8%의 낮은 성공률 기록
- 체화된 자기 인식 부족: 모델이 제어하는 신체를 추적하지 못함
HumanCLAW: 시각-언어 모델(Vision-Language Models)이 신체를 통해 행동할 수 있는가?
Meta와 공동 연구진은 행동 결정(action decisions)을 운동 제어(motor control)로부터 분리하는 벤치마크를 소개합니다. 1,218개의 체화된 에피소드(embodied episodes) 전반에 걸쳐, 어떤 VLM도 이를 해결하지 못했습니다 — 가장 성능이 좋은 모델조차 16.8%에 그쳤습니다. 모델들은 체화된 자기 인식(embodied self-awareness)이 부족합니다: 즉, 자신들이 제어하는 신체에 대한 추적 능력을 상실합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기