성공을 위한 다양한 방법: VLA 일반화를 위한 다양성 주도 RL 미세 조정
요약
본 논문은 VLA(Vision-Language-Action) 정책의 일반화 한계를 극복하기 위해 DRIVE라는 새로운 RL 미세 조정 기법을 제안합니다. DRIVE는 성공적인 행동 다양성을 명시적 목표로 삼아, 궤적 비교를 통해 성공 조건부 내재 보상을 도출합니다. 이 방법은 기존 RL 대비 다양한 환경에서 높은 OOD 성능 향상을 입증했습니다.
핵심 포인트
- DRIVE: VLA 일반화를 위한 다양성 주도 RL 미세 조정 기법 제시
- 행동 다양성을 명시적 목표로 삼아 성공 조건부 내재 보상 도출
- LIBERO-Plus, ManiSkill3 등에서 평균 OOD 성능 향상 입증
- 물리적 배포 환경(AgileX PiPER-X)에서도 높은 성능 개선 확인
강화학습 (RL) 미세 조정은 폐쇄 루프 경험을 통해 비전-언어-행동 (VLA) 정책을 개선하지만, 미세 조정 분포를 넘어선 일반화는 여전히 제한적입니다. 우리의 분석에 따르면, RL은 탐색 행동을 전반적으로 축소하는 동시에, 성공적인 궤적을 다양화하고, 더 적은 롤아웃으로 성공을 유도하며, 지도 학습 미세 조정보다 더 많은 잠재 작업 유효 솔루션 공간을 커버합니다. 광범위한 성공 모드 커버리지는 분포 변화 하에서 대체 전략을 제공할 수 있습니다. 이에 영감을 받아, 우리는 성공적인 행동 다양성을 명시적인 RL 목표로 전환하는 DRIVE (Diversity-driven RL fIne-tuning for VLA gEneralization)를 소개합니다. DRIVE는 일치된 작업 조건 하의 롤아웃들을 그룹화하고, 시간 정렬을 통해 그 궤적들을 비교하며, 상대적인 행동 다양성으로부터 성공 조건부 내재 보상(success-conditioned intrinsic reward)을 도출합니다. 이 설계는 다양한 실패나 피상적인 타이밍 차이를 보상하지 않으면서도 실현 가능한 솔루션의 더 넓은 커버리지를 장려합니다. LIBERO-Plus, ManiSkill3, 그리고 RoboTwin 2.0 전반에 걸쳐, DRIVE는 $ ext{vanilla RL}$ 미세 조정 대비 평균 도메인 외(OOD) 성능을 $ ext{π}0$에서 5.3점, $ ext{π}{0.5}$에서 2.0점 향상시킵니다. 이중 팔 AgileX PiPER-X 플랫폼에서는 DRIVE가 평균 OOD 성공률을 64.1%에서 73.3%로 (+9.2점) 추가 증가시켜, 물리적 배포 환경에서도 지속되는 성능 향상을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기