Agile-WAM: 접촉이 풍부한 로봇 제어를 위한 민첩한 촉각 세계 행동 모델
요약
본 논문은 접촉이 풍부한 로봇 제어를 위해 민첩한 촉각 세계 행동 모델(Agile-WAM)을 제시합니다. Agile-WAM은 시각 및 촉각 관측값을 공유 잠재 공간으로 인코딩하고, 다중 시간 지평 예측을 통해 미세한 접촉 역학을 포착합니다. 실제 실험에서 기존 최고 성능의 기준 모델 대비 높은 성공률과 낮은 추론 지연 시간을 달성하며 강력함을 입증했습니다.
핵심 포인트
- Agile-WAM은 시각/촉각 관측값을 공유 잠재 공간으로 인코딩합니다.
- 다중 시간 지평 예측을 도입하여 미세한 접촉 역학 포착에 유리합니다.
- 실제 세계 실험에서 기존 최고 성능 대비 높은 성공률과 낮은 추론 지연 시간을 달성했습니다.
세계 행동 모델(World Action Models, WAMs)은 기존의 시각 운동 정책을 넘어 미래 세계 상태와 로봇 동작을 공동으로 예측함으로써, 효과적인 제어를 지원하는 물리 역학을 학습할 수 있게 합니다. 하지만 최근의 촉각 WAM들은 접촉이 풍부한 물리 역학을 포착하기 위해 대규모 사전 훈련된 생성 백본(generative backbones)에 의존하는 경우가 많아, 추론 효율성과 유연한 배포를 제한합니다. 본 논문에서는 접촉이 풍부한 로봇 제어를 위한 민첩한 촉각 세계 행동 모델인 extbf{Agile-WAM}을 제시합니다. Agile-WAM은 시각 및 촉각 관측값을 공유 잠재 공간(shared latent)으로 인코딩하며, 이는 직접적인 비전-촉각-대-행동 흐름 일치화(vision-tactile-to-action flow-matching) 과정의 원천 역할을 합니다. 이 과정을 통해 행동 청크(action chunks)와 미래 시각/촉각 잠재 공간을 공동으로 생성할 수 있습니다. 핵심적인 관찰은 비전 신호와 촉각 신호가 본질적으로 다른 시간 척도에서 진화한다는 것입니다. 즉, 인접한 시각 프레임은 매우 유사한 경우가 많지만, 촉각 신호는 접촉 발생 시 급격하게 변화할 수 있습니다. 따라서 우리는 Agile-WAM에 다중 시간 지평(multi-horizon) 다중 모드 예측을 도입하여, 더 큰 시간적 오프셋에서 시각 잠재 공간에 대한 감독(supervision)을 제공하는 동시에 다음 프레임의 촉각 잠재 공간을 예측함으로써 미세한 접촉 역학을 포착합니다. 9개의 시뮬레이션 및 5개의 실제 세계 접촉이 풍부한 조작 작업 전반에 걸쳐, Agile-WAM은 높은 성공률을 달성하며 가장 강력한 기준 모델(baseline)을 능가하는 강력하고 견고한 성능을 입증했으며, 낮은 추론 지연 시간도 유지했습니다. 특히 5개의 실제 세계 실험에서, Agile-WAM은 전체 성공률에서 $ extbf{29.4%}$의 상대적 이득을 얻는 동시에 $ extbf{11.9 ms}$의 추론 지연 시간을 달성했습니다. 이러한 결과는 다중 모드 WAM이 정밀하고 고주파 로봇 제어에 적합한 민첩한 아키텍처로 구현될 수 있음을 보여줍니다. 더 자세한 내용은 저희 프로젝트 페이지에서 확인할 수 있습니다: https://hanchuzhou.github.io/TARO_project_page/.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기