EgoLAP: 언어-행동 추론을 통한 자아중심적 인간 데이터 학습
요약
EgoLAP은 언어 기반의 행동 사고 사슬(CoT)을 활용하여 인간 및 로봇 궤적에서 공동으로 학습하는 VLA 사전 학습 프레임워크입니다. 이 모델은 동작 의도를 구조화된 언어 행동으로 표현하고, 이를 장면 기하학 및 물리 기반 추론과 결합합니다. 실험 결과, EgoLAP은 대체 행동 표현보다 로봇 제어로 인간 경험을 효과적으로 전이하며 높은 성능 향상을 입증했습니다.
핵심 포인트
- EgoLAP은 언어-행동 CoT를 통해 인간/로봇 궤적에서 공동 학습합니다.
- 동작 의도를 구조화된 언어 행동으로 표현하여 추상화합니다.
- 장면 기하학, 물리 기반 추론과 결합하여 로봇 제어를 향상시킵니다.
- 대체 행동 표현 대비 실세계 작업 진행도에서 2.3배의 성능 향상을 보였습니다.
자아중심적(Egocentric) 인간 데이터는 값비싼 로봇 시연을 넘어 로봇 학습을 확장할 수 있는 경로를 제공하지만, 구현체 격차(embodiment gap) 때문에 원시적인 인간 궤적은 제어에 대한 부적절한 감독 목표가 됩니다. 우리의 핵심 통찰력은 저수준 행동(low-level actions)이 구현체에 특화되어 있음에도 불구하고, 그 근본적인 동작 의도(motion intent)는 사람과 로봇을 가로질러 전이될 수 있는 작업 관련 구조를 포착할 수 있다는 것입니다. 우리는 공유된 언어 기반의 행동 사고 사슬(language-based action chain-of-thought)을 통해 인간 및 로봇 궤적으로부터 공동으로 학습하는 VLA 사전 학습 프레임워크인 EgoLAP을 소개합니다. EgoLAP은 동작 의도를 구조화되고 시간적으로 추상화된 언어 행동으로 표현하고, 이를 장면 기하학(scene geometry), 물리(physics), 객체 어포던스(object affordances)에 기반한 동작 수준의 추론과 쌍을 이룹니다. 광범위한 실제 세계 및 시뮬레이션 실험 전반에 걸쳐, EgoLAP은 대체 행동 표현보다 로봇 제어로 인간 경험을 더 효과적으로 전이하며 평균 실세계 작업 진행도 80.1%를 달성하여 대체 행동 표현 대비 2.3배의 성능 향상을 보였습니다. 또한 동작 수준의 추론은 서브태스크(subtask), 객체-박스(object-box), 시각적-추적(visual-trace) 추론을 결합한 복합 추론 형식보다 우수한 성능을 보였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기