WCM: 시각-언어-행동 (VLA) 강화학습을 위한 월드 크리틱 모델 (World Critic Model)
요약
로봇 조작을 위한 VLA 모델의 강화학습 성능을 높이기 위해 월드 크리틱 모델(WCM)을 제안합니다. WCM은 미래 잠재 상태 예측과 가치 추정을 동시에 수행하여 로봇 제어의 시간적 역학을 효과적으로 포착합니다.
핵심 포인트
- 기존 크리틱 방식의 상태 근사 문제 해결
- LeJEPA 아키텍처 기반의 경량 월드 모델링 도입
- Pi0, OpenVLA 등 최첨단 VLA 백본과 호환 가능
- 다양한 벤치마크 및 실제 로봇 작업에서 SOTA 성능 입증
시각-언어-행동 (Vision-Language-Action, VLA) 모델의 강화학습 (Reinforcement Learning, RL) 사후 학습은 로봇 조작 분야에서 강력한 가능성을 보여주었습니다. RL 방법론 중 크리틱 기반 (critic-based) 접근 방식은 주로 단일 프레임 관측값 또는 단일 프레임 VLM 백본 잠재 변수 (latents) 상에서 작동하는 가치 추정기 (value estimator)에 의존하는데, 이는 로봇 제어의 부분 관측 가능성 (partially observable) 특성과 근본적으로 불일치합니다. 관측 이력을 크리틱에 통합하려는 단순한 접근 방식은 고차원 시각 공간에서 지수적인 복잡도를 초래하며, 순수 스칼라 리턴 회귀 (scalar-return regression)가 시계열적 역학 (cross-temporal dynamics)을 학습하기 위한 충분한 감독을 제공하지 못하기 때문에 여전히 실패합니다. 우리는 그 근본 원인을 상태 근사 (state approximation) 문제로 식별했습니다. 즉, 명시적인 월드 모델링 (world modeling) 목적 함수가 없으면, 크리틱의 표현 (representation)이 정확한 가치 추정에 필요한 시간적 구조를 포착할 수 없습니다. 이를 해결하기 위해, 우리는 경량 LeJEPA 아키텍처를 기반으로 구축된 월드 크리틱 모델 (World Critic Model, WCM)을 제안합니다. WCM은 미래의 잠재 상태 (latent state)를 예측하는 것과 가치를 추정하는 것을 공동으로 수행하며, 이를 통해 크리틱의 표현이 단순히 스칼라 리턴을 회귀하는 것이 아니라 시간적 역학을 포착하도록 명시적으로 학습됩니다. WCM은 온-폴리시 (on-policy) 및 오프-폴리시 (off-policy) 학습 파이프라인 모두에 원활하게 통합되며, Pi0, Pi0.5, OpenVLA-OFT를 포함한 최첨단 VLA 백본과 호환됩니다. 4개의 벤치마크에 걸친 149개 작업에 대한 광범위한 실험을 통해, WCM이 분포 내 (in-distribution) 및 분포 외 (out-of-distribution) 설정 모두에서 일관되게 최첨단 성능을 달성하며, 특히 강력한 일반화 이득을 보여줌을 입증했습니다. 나아가 우리는 OpenVLA-OFT 및 Pi0.5를 오프-폴리시 RL과 함께 사용하여 7개의 실제 조작 작업에서 WCM을 검증하였으며, 다양한 설정에서 안정적인 배포가 가능함을 확인했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기