
N0-VTLA
요약
N0-VTLA는 미세한 접촉 조작을 위해 잠재 촉각 토큰을 예측하는 시각-촉각-언어-행동 모델입니다. 9개의 실제 로봇 작업 완수 및 20개의 시뮬레이션 작업에서 63.8%의 성공률을 기록했습니다.
핵심 포인트
- 시각, 촉각, 언어, 행동을 통합한 멀티모달 모델
- 잠재 촉각 토큰 예측을 통한 정밀한 접촉 조작 구현
- 실제 로봇 작업 9종 전원 완수
- 시뮬레이션 환경에서 63.8%의 성공률 달성
N0-VTLA
미세한 접촉 중심의 조작 (contact-rich manipulation)을 위해 잠재 촉각 토큰 (latent tactile tokens)을 예측하는 시각-촉각-언어-행동 (vision-tactile-language-action) 모델로, 9개의 실제 로봇 작업을 모두 완수하고 20개의 시뮬레이션 작업에서 63.8%의 성공률을 달성했습니다. https://t.co/sYWacli8Pk
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기