EmbodiedRSI: 가설 기반 공동 진화를 통한 능동적 지속 로봇 학습
요약
EmbodiedRSI는 로봇 파운데이션 모델의 성능 저하 문제를 해결하기 위해 개발된 자가 진화형 에이전트 하네스입니다. 이 시스템은 Fast-Slow Dual-System Architecture를 사용하여 탐색 지점을 자율적으로 결정하고, 물리적 상호작용을 개선된 코드와 스킬로 전환합니다. 이를 통해 로봇의 코드-스킬 공동 진화를 안내하며 높은 성공률을 달성했습니다.
핵심 포인트
- EmbodiedRSI는 자가 진화형 에이전트 하네스로, 탐색 지점을 자율 결정합니다.
- Fast-Slow Dual-System Architecture를 활용하여 가설 그래프를 유지하고 실험을 선택합니다.
- 코드와 스킬의 공동 진화를 통해 로봇 학습 효율성을 높였습니다.
- RoboCasa365 및 LIBERO-Pro 벤치마크에서 높은 성공률을 입증했습니다.
로봇 파운데이션 모델은 강력한 시각 운동 제어(visuomotor control)를 제공하지만, 물체 위치나 작업 지침이 변경될 때 성능이 저하될 수 있습니다. 추가적인 개선을 위해서는 종종 대규모 로봇 데이터에 대한 사후 학습(post-training)이 필요하며, 이는 원격 조작(teleoperation)과 같은 방법을 통해 수집하기에는 비용이 많이 들 수 있습니다. 에이전트 기반 하네스(Agentic harnesses)는 모델 주변에 적응할 수 있지만, 현재의 자가 진화형 하네스는 어떤 코드 및 스킬 변경을 추구할지 결정할 때 로봇 실험을 비효율적으로 사용합니다. 우리는 EmbodiedRSI를 소개합니다. 이는 다음 탐색 지점을 자율적으로 결정하고 그 결과로 발생하는 물리적 상호작용을 개선된 코드와 스킬로 전환하는 자가 진화형 에이전트 하네스입니다. EmbodiedRSI는 Fast-Slow Dual-System Architecture를 통해 이를 실현하며, 이 아키텍처에서 경쟁하는 코드 및 스킬 가설(hypothesis)들이 가설 그래프(Hypothesis Graph)에 유지됩니다. 정보 가치 실험 선택(Value-of-Information Experiment Selection)은 이러한 가설들을 구별할 수 있는 물리적 실험을 선택합니다. 그 결과는 코드-스킬 공동 진화(Code-Skill Co-Evolution)를 안내합니다. Slow System은 계층적 메모리(Hierarchical Memory)를 구축하고, 보상 기반 메모리 학습(Reward-Grounded Memory Learning)은 나중 Fast-System 개선에 대한 가치에 따라 효과적인 메모리를 선택합니다. RoboCasa365에서 EmbodiedRSI는 전체 성공률 77.0%와 Composite-Unseen에서 71.3%를 달성했으며, 이는 최고 기준선(baseline)의 40.1%와 비교됩니다. EmbodiedRSI는 또한 LIBERO-Pro에서 전체 성공률 86.8%에 도달합니다. 벤치마크 성능을 넘어, EmbodiedRSI는 제로샷으로 실제 로봇에 전이되어 여러 까다로운 작업에서 71.3%의 전체 성공률을 달성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기