균형 잡힌 데이터 식단(Data Diet): 로봇 제어용 메가 스케일 RL의 탐색 병목 현상 해결
요약
본 논문은 로봇 제어용 메가 스케일 강화학습(RL)의 탐색 병목 현상을 해결하기 위해 Success Guided Sampling (SGS)이라는 적응형 샘플러를 제안합니다. SGS는 학습 경험을 정책 능력의 최전선 주변 작업 구성에 집중시켜, 대규모 병렬 시뮬레이션 환경에서 데이터 효율성을 극대화합니다. 이를 통해 복잡한 다중 지형 이동 및 접촉 기반 조립 작업에서의 성능 향상을 입증하고 실제 하드웨어로 전이 가능함을 보여줍니다.
핵심 포인트
- SGS는 RL 훈련을 정책 능력의 최전선에 집중시켜 데이터 효율성을 높입니다.
- 대규모 병렬 시뮬레이션 환경에서 학습 경험 낭비를 줄여 효과적인 확장을 가능하게 합니다.
- 까다로운 다중 지형 사족 보행 및 접촉 기반 조립 작업 해결 능력을 입증했습니다.
- 학습된 정책을 RGB 기반으로 증류하여 실제 하드웨어에 제로샷 전이할 수 있습니다.
범용 로봇은 민첩한 이동부터 정교한 조작에 이르기까지 광범위한 작업을 수행해야 합니다. 시뮬레이션-실제 강화학습 (RL)이 이러한 목표를 위한 유용한 도구임이 입증되었지만, 현재의 RL 파이프라인은 형태가 지정된 보상(shaped rewards)이나 데모 등의 작업별 구조적 사전 지식(structural priors)에 의존하는 엔지니어링 집약적인 방식입니다. 최근 연구에서는 다양한 시뮬레이터 리셋을 대규모 병렬 시뮬레이션과 결합하여 여러 조작 문제에서 이러한 엔지니어링 부담의 상당 부분을 완화할 수 있음을 보여주었습니다. 하지만, 이 패러다임을 더 정밀하거나 동적인 문제에 무턱대고 확장하는 것은 여전히 간단하지 않습니다. 시뮬레이터 리셋은 탐색에는 도움이 될 수 있지만, 이 분포 위를 균일하게 샘플링하는 것은 정책이 이미 숙달했거나 아직 시도할 수 없는 작업 구성(task configurations)에 학습 경험의 증가하는 비율을 낭비합니다. 이는 배치 내 많은 학습 신호가 학습 중에 낭비되기 때문에 RL을 위한 병렬 환경 확장의 기대 효과를 보기 어렵게 만듭니다. 이를 완화하기 위해, 우리는 Success Guided Sampling (SGS)이라는 간단한 적응형 샘플러를 도입했습니다. SGS는 RL 훈련을 정책 능력의 최전선(frontier) 주변 작업 구성에 집중시킵니다. 이렇게 함으로써 대규모 시뮬레이션 RL이 배치 내 경험을 최대한 활용할 수 있게 하여, 대규모 병렬 시뮬레이션으로 훨씬 더 효과적인 확장을 가능하게 합니다. 최대 $2^{20}$ (백만 개 이상)의 병렬 환경을 사용한 실험 전반에 걸쳐, SGS는 RL이 기존 방법들이 해결하지 못했던 까다로운 다중 지형 사족 보행 이동 및 접촉 기반 조립 작업을 해결할 수 있도록 합니다. 마지막으로, 우리는 학습된 조작 정책들을 RGB 기반 정책으로 증류하고 실제 하드웨어에서 여러 까다로운 조립 작업에 대한 제로샷 전이(zero-shot transfer)를 시연합니다. 프로젝트 웹사이트: https://sgs-rl.github.io/.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기