EyeRobot 2.0: 손목 카메라 없이 정밀 조작을 위한 능동 시선 처리
요약
EyeRobot 2.0은 단일 스테레오 카메라만을 사용하여 능동 시선 기반 프레임워크를 제시하며, 인간의 시각 메커니즘을 모방합니다. 이 시스템은 두 개의 눈 관점을 회전시켜 작업 관련 특징에 계산을 집중시키고, 이를 통해 손목 카메라 없이도 정밀한 양손 조작이 가능함을 입증했습니다.
핵심 포인트
- 단일 스테레오 카메라만으로 능동 시선 기반의 정밀 조작 구현
- 능동 시각 고정(AVF)을 통해 계산 자원을 작업 관련 특징에 집중시킴
- EyeRobot 2.0은 손목 카메라 없이도 높은 성공률을 유지하여 성능 격차를 해소함
- 계층적 RL 학습 구조로 시선 서보잉과 타겟 셀렉터를 분리하여 훈련
인간의 시각에서 영감을 받아, 우리는 단일 스테레오 카메라만을 사용하여 미세한 양손 조작(bimanual manipulation)을 가능하게 하는 능동 시선(active gaze) 기반 프레임워크를 소개합니다. EyeRobot 2.0은 두 개의 눈 관점(eye viewpoints)을 회전시켜 그 시선을 장면 내의 3D 고정점(fixation point)에 물리적으로 맞춤으로써 작동합니다. 이렇게 얻어진 이미지는 이미지 중앙에 더 많은 비주얼 토큰(visual tokens)을 할당하여 중심부에서 포비아(foveally) 처리되며, 작업 관련 특징(task-relevant features)에 계산이 집중됩니다. 이러한 능동 시각 고정(Active Visual Fixation, AVF)은 작업 실행 중 신중하게 조정된 시선을 요구하며, 우리는 이를 하위 레벨의 시선 서보잉 정책(gaze servoing policy)을 목표 객체(goal object)에 조건화하여 먼저 훈련시키고, 그 다음 작업 진행 상황에 따라 고정점 목표를 방출하는 타겟 셀렉터(target selector)를 훈련시키는 방식으로 계층적으로 달성합니다. 두 모듈 모두 실제 데이터로 RL(강화학습)을 통해 훈련됩니다: 전자는 밀집된 기하학적 보상(dense geometric reward)으로, 후자는 BC 그리퍼 정책(BC gripper policy)과 공동 훈련되어 작업 수행 중 인간의 고정 시퀀스(fixation sequence)와 유사한 고정 시퀀스를 발견할 수 있게 합니다. EyeRobot 2.0은 또한 고정점을 활용하여 그리퍼 정보를 고정점 상대 SE(3) 프레임으로 정규화(canonicalizing)함으로써, 학습해야 할 액션 분포의 크기를 압축합니다. 우리는 7개의 실제 작업과 6개의 시뮬레이션 작업을 위해 원격 조작 데이터(teleoperation data)를 수집했으며, EyeRobot 2.0을 동일한 데이터로 훈련된 수동 스테레오 정책 및 에고 + 손목 카메라 정책과 비교하여 1000개 이상의 물리적 트라이얼과 1800개의 시뮬레이션 트라이얼을 수행했습니다. 손목 카메라를 제거하는 것은 표준 정책에게 비용이 많이 듭니다: 수동 스테레오만 사용할 경우, 실제 환경에서의 성공률은 52%에서 27%로 떨어집니다. EyeRobot 2.0은 단지 스테레오만을 사용하면서 이 격차를 해소하며, 실제 환경에서는 수동 스테레오보다 40%, 시뮬레이션 환경에서는 20% 더 뛰어난 성능을 보입니다. 이는 에고 + 손목 정책의 손목 시야가 명확할 때는 일치(69% 대 64%)하지만, 그리퍼로 인해 객체가 손목 카메라를 가릴 경우(occlude)에는 성공률이 두 배 이상 증가합니다(48% 대 22%).
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기