휴머노이드 호라이즌: 병렬 학습, 동적 시작 및 보상 게이팅을 통한 전신 로코-매니퓰레이션의 태스크 호라이즌 확장
요약
본 연구는 복잡하고 장기적인 전신 로코-매니퓰레이션 태스크를 해결하기 위해 Humanoid Horizon이라는 통합 정책 프레임워크를 제안합니다. 이 프레임워크는 병렬 학습, 동적 시작 메커니즘, 보상 게이팅 세 가지 핵심 메커니즘을 결합하여 기존의 쉬운 보상 편향 및 치명적 망각 문제를 극복했습니다.
핵심 포인트
- 병렬 학습으로 모든 운반 단계에 지속적인 기울기 업데이트를 제공합니다.
- 동적 시작 메커니즘은 전이 커버리지를 넓히고 경계 강건성을 높입니다.
- 보상 게이팅을 통해 초기 배치 물체가 건드려지지 않도록 정책을 학습시킵니다.
다양한 표면에 크고 무거운 물체들이 흩어져 있는 복잡한 실내 환경에서는 휴머노이드 로봇이 단일하고 중단 없는 에피소드 내에서 각 항목을 순차적으로 탐색(navigate), 파지(grasp), 운반(transport)하고 목표 위치에 정확하게 배치해야 합니다. 이러한 장기 호라이즌의 전신 로코-매니퓰레이션 태스크는 현재 방법론들에게 여전히 중요한 과제로 남아 있습니다. 이전 접근 방식들은 종종 두 가지 주요 문제로 인해 어려움을 겪습니다: 초기 운반 단계에 대한 학습이 후기 단계를 희생시키는 쉬운 보상 편향(easy-reward bias)과, 후기 단계에 집중하는 것이 초기 단계 성능 저하를 초래하는 치명적 망각(catastrophic forgetting)입니다. 본 연구에서는 Humanoid Horizon을 소개합니다. 이는 세 가지 상호 연관된 메커니즘을 통해 이러한 한계를 극복하도록 설계된 통합 정책 프레임워크입니다. 병렬 학습 전략(Parallel Training Strategy)은 $N$개의 장면을 공유 정책에 의해 제어되는 $S$개의 동시 스테이지 스트림으로 구성하여, 모든 운반 단계가 지속적인 기울기 업데이트를 받도록 보장하고 순차적 최적화의 병목 현상을 제거합니다. 동적 시작 메커니즘(Dynamic Starting Mechanism)은 각 환경의 초기 상태를 상위 롤아웃(upstream rollouts)의 터미널 상태로 업데이트하여, 전이 커버리지를 점진적으로 넓히고 스테이지 경계에서의 강건성(robustness)을 향상시킵니다. 보상 게이팅(Reward Gating)은 후기 스테이지 스트림에서 직전에 배치된 물체가 설정 임계값을 초과하여 이탈할 경우, 에피소드의 나머지 부분에 대한 보상을 0으로 설정합니다. 따라서 공유 정책은 방금 배치한 물체를 건드리지 않도록 학습하며, 초기 배치가 에피소드 전체 동안 유지됩니다. 종합적으로 이러한 전략들은 두 개의 물체 LHM-Humanoid 벤치마크에서 스테이지별 성공률 80%를 초과 달성했습니다 (350개의 학습 장면, 66개의 홀드아웃 장면). 순차적으로 운반되는 물체의 수가 두 개를 넘어서면서 성공률은 호라이즌에 따라 감소하지만, 그 저하 폭은 모든 베이스라인에서 보이는 급격한 하락에 비해 완만합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기