반사실적 비디오 생성을 통한 확장 가능한 휴머노이드 로코-매니퓰레이션
요약
본 논문은 인간형 로봇의 로코-매니퓰레이션 기술 학습을 위해 PRISM이라는 프레임워크를 제안합니다. 이 프레임워크는 소수의 실제 비디오로부터 V2V 생성을 통해 대규모의 '반사실적' 상호작용 데이터를 생성하고, 이를 물리적으로 그럴듯하게 리타겟팅하여 로봇 훈련에 활용합니다.
핵심 포인트
- PRISM은 적은 실사 비디오로 방대한 가상 데이터셋을 증폭합니다.
- V2V 생성을 통해 다양한 '반사실적' 상호작용 데이터를 생성합니다.
- 실제-대-가상 파이프라인으로 물리적으로 그럴듯한 궤적을 재구성합니다.
- 훈련된 정책은 실제 로봇에 배포되어 미세 조정 없이 일반화 성능을 입증했습니다.
다양한 물체를 운반하는 것과 같은 인간형 로봇의 로코-매니퓰레이션(loco-manipulation) 기술을 시각적 모방을 통해 가르치는 것은 범용 로봇으로 나아가는 유망한 경로입니다. 하지만 사람의 전신과 물체와의 가려지지 않은 상호작용이 명확하게 보이는 클립 등 다양하고 고품질의 상호작용 비디오를 수집하는 것이 이 접근 방식을 확장하는 데 실질적인 장벽을 제시합니다. 우리는 PRISM이라는 프레임워크를 제안하며, 이는 소수의 실제 비디오를 대규모의 다양하고 풍부한 훈련 세트로 증폭하여 이러한 한계를 극복합니다. PRISM은 먼저 몇 개의 예시 실제 비디오로부터 비디오-투-비디오(V2V) 생성을 통해 수백 개의 다양한 '반사실적' 인간-물체 상호작용 비디오를 생성합니다. 이후 접촉 기반의 실제-대-가상(real-to-sim) 파이프라인을 사용하여 인간과 물체의 움직임을 재구성하고, 이 불완전한 비디오 데이터를 물리적으로 그럴듯한 궤적으로 리타겟팅(retargeting)합니다. 이러한 반사실적 비디오 전반의 클래스 내 변동성(intra-class variability) 덕분에 우리는 각 카테고리 내에서 보지 못한 물체에도 일반화하는 단일 정책을 훈련할 수 있습니다. 우리는 이 정책을 실제 로봇에 배포하여, 어떠한 실제 세계에서의 미세 조정도 없이 전체 파이프라인을 시연합니다. 오직 온보드 깊이 관측만을 사용하여, 우리의 휴머노이드는 상자, 통, 빈, 공 등을 포함한 물체들을 새로운 인스턴스, 크기 및 초기 구성에 걸쳐 집고, 운반하고, 떨어뜨립니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기