InterEvolve: 휴머노이드 로코-매니퓰레이션의 테스트 시간 보상 프로그램 진화
요약
InterEvolve는 휴머노이드 로코-매니퓰레이션의 테스트 시간 진화를 연구한 시스템입니다. 이 시스템은 재훈련 없이도 기존 컨트롤러가 가진 광범위한 역량을 활용하여 새로운 과제를 해결합니다. 객체 인식 기반 행동 모델과 단계적 보상 프로그램, 수치 최적화기를 결합하여 지속적으로 성능을 개선하고 새로운 전략을 탐색하는 것이 핵심입니다.
핵심 포인트
- 재훈련 없이도 기존 컨트롤러의 역량으로 신규 과제 수행 가능
- 객체 잔여물을 활용한 FB 행동 모델로 보상 생성 및 변환
- LLM과 수치 최적화기를 이용해 프로그램 구조를 수정하고 상수 조정
- 진화된 기술을 물리적인 로봇(Unitree G1)에서 자율적으로 검증
우리는 휴머노이드 로코-매니퓰레이션(loco-manipulation)에 대한 테스트 시간 진화를 연구했습니다. 이는 컨트롤러가 훈련된 적 없는 과제를, 기존 기술을 재활용하고, 자체 시도에서 개선하며, 학습한 것을 유지하는 방식으로 해결하는 것입니다. 재훈련 없이 이러한 과정이 가능합니다. 우리의 핵심 통찰은 광범위한(broad) 컨트롤러가 이미 새로운 과제가 필요로 하는 많은 역량을 보유하고 있으며, 이 역량은 계획(planning)과 제어(control) 사이의 인터페이스를 통해 접근 가능하다는 것입니다. 이 인터페이스는 접촉이 풍부하고 다단계적인 상호작용을 지정할 만큼 표현력이 높으면서도, 실행 가능하고 측정 가능하여 실행 피드백이 경험으로부터 계획을 안내할 수 있게 합니다. InterEvolve는 두 가지 구성 요소로 이 인터페이스를 구현합니다. 첫째, 우리는 객체 인식(object-aware) 순방향-역방향(forward-backward, FB) 행동 기반 모델을 개발했습니다. 이 모델은 고정된 신체 이전 상태(frozen body prior)에 대한 객체 잔여물(object residuals)을 통해 새로운 보상(reward)을 신체 또는 객체에 대해 로코-매니퓰레이션 행동으로 변환합니다. 둘째, 우리는 과제를 보상 프로그램(reward programs)으로 지정합니다. 이는 완료 조건과 조정 가능한 상수(tunable constants)를 가진 단계적 보상을 의미합니다. 대규모 언어 모델(LLM) 에이전트가 실행 피드백과 검증된 프로그램 기술 라이브러리(skill library)에 의존하여 컨텍스트 내에서 프로그램 구조를 수정하고, 수치 최적화기(numerical optimizer)가 그 상수를 조정합니다. 모든 후보군이 병렬 시뮬레이션 시나리오를 거쳐 검증될 때마다, 이 프로그램은 현재 과제에 대해 컨트롤러의 기존 운동 역량을 유도하고, 재활용하며, 조합하는 새로운 방법을 탐색하며 반복적으로 개선됩니다. 실험 결과는 인간이 설계한 보상이 FB 모델의 로코-매니퓰레이션 역량 중 상당 부분을 활용하지 못하게 하는 반면, InterEvolve가 진화시킨 프로그램들은 이를 해제하여 때로는 새로운 전략을 통해 합니다. 나아가 이는 시뮬레이션에서 다양한 과제, 복잡한 장면, 장기적인 구성에 대한 행동을 생성하며, 진화된 기술은 물리적인 Unitree G1 위에서 근원적 온보드 인식(egocentric onboard perception)으로 자율적으로 실행됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기