자율 로봇 정책 개선을 위한 스킬 공간 슈팅
요약
본 논문은 로봇이 물리 세계에서 실패와 새로운 상황을 접하며 스스로 개선할 수 있는 방법을 제시합니다. '스킬 공간 슈팅(skill-space shooting)'이라는 기법을 통해, 재사용 가능한 스킬들을 활용하여 작업 정책의 수정 사항을 탐색하고 이를 정책 개선으로 전환함으로써 자율적인 학습과 일반화를 가능하게 합니다.
핵심 포인트
- 로봇은 물리 세계에서 스스로 실패를 경험하며 개선되어야 한다.
- 스킬 공간 슈팅은 재사용 가능한 스킬을 이용해 정책 개선을 유도한다.
- 이 방법은 작업 내외에서 확장 가능하고 일반화된 학습을 지원한다.
물리 세계에 배치되는 로봇은 새로운 상황과 실패를 접하면서 초기 훈련 수준 이상으로 개선할 수 있어야 합니다. 이러한 개선이 다양한 작업(task) 전반에 걸쳐 확장되기 위해서는, 각 수정 사항마다 인간의 시연을 요구하지 않으면서 경험을 효과적으로 활용해야 합니다. 최근 에이전트 기반 시스템(agentic systems)은 파운데이션 모델(foundation models)을 사용하여 학습된 행동들을 자율적으로 조합함으로써 작업을 완료하는 방식을 통해 이러한 인간 노력에 대한 의존도를 줄이는 방법을 제공합니다. 그러나 이 방식으로 작업을 완료하는 것만으로는 작업 정책(task policy)이 자체적인 실패를 극복하도록 가르치지 못하며, 이를 위해서는 이러한 행동들을 정책을 위한 학습 가능한 수정 사항으로 전환해야 합니다. 우리의 통찰은 이러한 많은 수정 사항들이 익숙한 짧은 행동들, 즉 스킬(skills)이라는 것입니다. 이 스킬들은 작업을 거쳐 반복되며, 파운데이션 모델이 장면으로부터 추론할 수 있는 행동들을 설명합니다. 우리는 스킬 공간 슈팅(skill-space shooting)을 소개하는데, 이는 파운데이션 모델의 안내를 사용하여 이러한 재사용 가능한 스킬들(reusable skills)을 통해 수정 사항을 탐색하고 성공적인 시도들을 정책 개선으로 전환하는 방법을 사용합니다. 실제 세계 실험 결과는 자율적으로 행동하는 정책들의 반복적인 개선을 보여주며, 또한 스킬들은 새로운 작업을 개선하는 데 필요한 교육량을 줄이기 위해 공유될 수 있습니다. 재사용 가능한 스킬들을 수정 감독(corrective supervision)의 원천으로 만듦으로써, 스킬 공간 슈팅은 작업 내외에서 확장 가능하고 일반화 가능한 정책 개선을 가능하게 합니다. 추가 결과 및 비디오는 https://skill-space-shooting.github.io를 참조하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기