DexTacWAM: 정교한 조작을 위한 시각-촉각 세계-행동 모델
요약
DexTacWAM은 정교한 조작을 위해 시각 정보와 촉각 정보를 결합한 새로운 세계-행동 모델(WAM)입니다. 손가락 및 자세 인식 촉각 압축기를 통해 얻은 촉각 잠재 변수를 비디오 확산 세계 모델에 주입하여, 접촉 역학까지 고려하는 시각-촉각 세계 모델링을 구현했습니다. 이 모델은 다양한 정교한 조작 과제에서 기존 최고 성능의 기준 모델 대비 높은 성능 향상을 입증했습니다.
핵심 포인트
- 시각 중심적 WAM의 한계를 극복하고 촉각 정보를 통합함.
- 손가락 및 자세 인식 촉각 압축기를 통해 촉각 잠재 변수를 추출함.
- 접촉 역학 예측을 통해 기존 모델 대비 높은 성능 향상을 달성함.
- 사전 학습된 비디오 지식을 데이터 효율적으로 다중 손가락 접촉으로 확장 가능함을 입증함.
정교한 조작(dexterous manipulation)은 종종 비전만으로는 부분적으로만 관찰 가능한 접촉 역학(contact dynamics)에 의존합니다. 최근의 세계-행동 모델(World-Action Models, WAMs)은 예측적 비디오 세계 모델링과 행동 생성을 결합하지만, 여전히 주로 시각 중심적이며 따라서 이러한 접촉 역학을 직접적으로 모델링할 수 없습니다. 우리는 각 손가락 끝을 독립적으로 인코딩하고, 그 결과로 얻은 특징들을 손가락 및 자세 인식 촉각 압축기(finger- and pose-aware tactile compressor)를 통해 집계하며, 이 촉각 잠재 변수(tactile latent)를 비디오 확산 세계 모델(video diffusion world model)에 주입하여 결합된 시각-촉각 세계 모델링을 수행하는 visuo-tactile WAM인 DexTacWAM을 제시합니다. 22 자유도(DoF)의 양손 플랫폼에서 접촉이 풍부한 여섯 가지 정교한 조작 과제 전반에 걸쳐, DexTacWAM은 모든 과제에서 가장 높은 점수를 달성했으며 평균 점수는 70.6점으로, 가장 강력한 기준 모델 대비 38.0점 상승했습니다. 제거 실험(Ablations) 결과는 이 성능 향상이 촉각 조건화만 하는 것이 아니라 접촉의 진화(contact evolution)를 예측된 세계 상태의 일부로 모델링했기 때문임을 보여줍니다: 촉각 세계 모델링을 제거하자 네 가지 과제의 평균 점수가 74.7점에서 26.6점으로 감소했지만, 동일한 촉각 특징과 행동 전문가(action expert)는 유지되었습니다. 사전 학습된 비전 VAE를 사용하여 4시간 동안 촉각 인코더 적응(tactile-encoder adaptation)을 수행하자, 우리의 지속적인 시각-촉각 학습은 촉각 중간 학습 과정 없이도 약 과제당 100개의 데모를 사용하여 사전 학습된 비디오 모델을 촉각으로 확장했으며, 이 과정에서 시각 전용 대응 모델 대비 시각 예측 품질을 0.5 dB 이내로 유지했습니다. 압축기는 사전 융합 접촉 재현율(pre-fusion contact recall)의 89.4%를 유지하면서도 학습 속도를 2.26배, 추론 속도를 1.29배 빠르게 만들었습니다. 종합적으로 이러한 결과들은 사전 학습된 비디오 사전 지식(priors)이 데이터 및 컴퓨팅 효율적인 방식으로 분산된 다중 손가락 접촉 역학으로 확장될 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기