Patch Policy: 조밀한 시각적 표현을 통한 효율적인 체화된 제어 (Efficient Embodied Control)
요약
Patch Policy는 VLM의 계산 오버헤드 없이 사전 학습된 조밀한 패치 토큰을 로봇 정책에 직접 활용하는 효율적인 구조를 제안합니다. 블록 인과적 어텐션 마스크를 통해 시각적 디테일을 유지하면서도 가볍고 빠른 추론 속도를 구현했습니다.
핵심 포인트
- 조밀한 패치 토큰을 활용해 시각적 디테일과 효율성 동시 확보
- 블록 인과적 어텐션 마스크로 시간적 인과성 및 계산 효율 유지
- 기존 전역 풀링 방식 대비 40%의 상대적 성능 개선 달성
- OpenVLA-OFT 대비 약 0.7%의 파라미터만으로 18% 높은 성능 기록
Vision Transformers (ViTs)로부터 사전 학습된 조밀한 시각적 특징(dense visual features)은 강력하지만, 로봇 학습(robot learning) 분야에서는 충분히 활용되지 못하고 있습니다. 현대의 로봇 정책(robot policies)은 각 관측값(observation)을 하나의 단일 전역 토큰(global token)으로 압축하거나, 처음부터 학습된 시각적 백본(visual backbones)에 의존함으로써, 세밀한 공간적 디테일과 대규모 시각적 사전 학습(visual pre-training)의 이점을 모두 희생합니다. 대규모 시각-언어-행동 모델(VLAs)과 같이 조밀한 패치 특징(dense patch features)을 사용하는 정책들이 존재하기는 하지만, 이들은 수십억 개의 파라미터를 가진 시각-언어 모델(VLM) 백본의 전체 비용을 그대로 물려받아 무겁고 느린 경향이 있습니다. 우리는 Patch Policy를 통해 이 간극을 메웁니다. Patch Policy는 트랜스포머 기반 정책이 전체 VLM의 계산 오버헤드 없이도 사전 학습된 조밀한 패치 토큰(patch tokens)을 직접 소비할 수 있게 하는 최소한의 구조적 확장입니다. 그 핵심은 표준 정책의 시간적 인과성(temporal causality)을 유지하면서도, 모델이 다른 상태 정보와 함께 관측당 많은 패치 토큰에 주의(attend)를 기울일 수 있도록 하는 블록 인과적 어텐션 마스크(block-causal attention mask)입니다. Patch Policy는 가볍고 빠르며 매우 효과적입니다. 4개의 시뮬레이션 환경과 3개의 실제 환경 스위트 전반에 걸쳐, 우리의 방법은 최첨단 전역 풀링된 표현(global-pooled representations)을 사용하는 정책보다 40%의 상대적 개선을 달성했습니다. 또한, 약 0.7%의 파라미터만을 사용하면서도 미세 조정된 OpenVLA-OFT를 18% 상회하는 성능을 보여주었습니다. 우리는 Patch Policy가 로봇 공학 커뮤니티가 고주파수 반응형 제어(high-frequency, reactive control)에 필요한 학습 효율성이나 추론 속도를 희생하지 않으면서도, 시각적 표현 학습(visual representation learning)의 지속적인 발전을 손쉽게 활용할 수 있는 파이프라인을 제공한다고 믿습니다. 영상은 https://patch-policy.github.io 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기