FutureX · Physical AI Daily — Issue 70 (07/27)
요약
NeoteAI와 푸단 대학교가 30,000시간 분량의 시각-촉각 데이터를 공개하며 촉각 파운데이션 모델을 발표했습니다. 시각-촉각 통합 모델인 VTLA와 TWAM은 기존 시각 전용 모델 대비 월등한 조작 성공률을 기록하며 체화된 AI(Embodied AI)의 새로운 지평을 열었습니다.
핵심 포인트
- 30,000시간 규모의 대규모 시각-촉각 상호작용 데이터셋 공개
- VTLA 모델을 통해 커넥터 삽입 등 정밀 조작 성공률 대폭 향상
- 72억 파라미터 규모의 TWAM 월드 모델로 시뮬레이션 성공률 84.5% 달성
- 다양한 로봇 구현체와 장기 과제를 아우르는 통합 표현 모델 제시
오늘의 하이라이트
· NeoteAI (중국 Embodied-AI 스타트업)와 푸단 대학교(Fudan University)가 30,000시간 분량의 시각-촉각(visuo-tactile) 데이터를 공동 오픈소스로 공개하며, 촉각 파운데이션 모델(tactile foundation model)과 함께 VTLA 및 TWAM을 일괄 출시함
· Fei-Fei Li, Abbeel 등이 공동 저술한 T-Rex 숙련된 손(dexterous-hand) 모델이 시각 전용(vision-only) 베이스라인의 35% 대비 **65%**의 성공률을 기록함
· NHTSA가 의무적인 브레이크 페달 규정 폐지를 제안함에 따라, 로보택시(robotaxis)의 연간 2,500대 용량 상한선이 종료될 가능성이 있음
· Qianxun Intelligent (중국 Embodied-AI 스타트업)가 15억 위안(RMB) 규모의 Series A+ 투자를 유치하며, 3개월간 4차례 라운드를 거친 총 투자액이 45억 위안을 넘어섬
· Uber Eats가 Serve와 파트너십을 맺고 미국 시장 전역에 최대 2,000대의 인도(sidewalk) 배달 로봇을 배치할 예정임
I. 연구 진척 상황 (Research Progress)
30,000시간의 시각-촉각(visuo-tactile) 데이터: 촉각을 "보조 양식(auxiliary modality)"에서 파운데이션 모델 수준으로 격상 · 조작 (manipulation)
촉각 감지(tactile sensing)의 스케일링은 오랫동안 동일한 병목 현상에 갇혀 있었습니다. 젤 변형(gel-deformation) 이미지, 정전 용량 매트릭스(capacitive matrices), 6축 힘 벡터(six-axis force vectors)는 각각 자신만의 "방언"을 사용하기 때문에, 서로 다른 장치에서 나온 데이터를 단일 모델로 통합할 수 없었습니다. NeoteAI (중국 Embodied-AI 스타트업)와 푸단 대학교(Fudan University)의 신뢰할 수 있는 Embodied AI 연구소(Institute of Trustworthy Embodied AI)는 공유 데이터 파운데이션과 두 가지 모델 트랙을 통해 이 문제에 정면으로 대응합니다. NeoData는 30,000시간 이상의 시각-촉각 상호작용 비디오, 약 140만 개의 조작(manipulation) 클립, 33억 개의 타임스텝(timesteps)으로 구성되며, Franka, Piper, UR5e를 포함한 6종의 로봇 구현체(embodiments)와 450개의 실제 장기 과제(long-horizon tasks)를 아우릅니다. 이 중 첫 5,000시간이 이미 오픈소스로 공개되었습니다. 동반 모델인 NeoForce 통합 표현 모델(unified-representation model)은 센서 유형 전반에 걸쳐 신호를 정규화합니다. VTLA의 접근 방식은 지연되는 현재의 촉각 판독값을 버리고 50단계 미래의 촉각 진화를 예측하는 방식을 취합니다. 이를 통해 커넥터를 꽂는 작업에서 시각 전용 방식의 60% 대비 **85%**의 성공률을 달성했으며, 주요 제거(key removal) 작업에서는 35% 대비 99%의 성공률을 기록했습니다.
TWAM은 대신 촉각(touch)을 월드 모델(world model)에 통합하며, 비디오, 촉각, 행동을 위한 세 개의 비동기 전문가(asynchronous experts)를 사용하여 세 가지 시퀀스를 공동으로 예측합니다. 72억(7.2 billion) 개의 파라미터를 가진 이 모델은 논문에서 인용한 가장 강력한 월드 모델 베이스라인의 36%와 비교하여, 평균 시뮬레이션 성공률 **84.5%**에 도달했습니다.
NeoteAI × 푸단 대학교 신뢰할 수 있는 체화된 AI 연구소(Fudan University Institute of Trustworthy Embodied AI) · 3개의 기술 보고서 동시 발표 · 분석: JiqiZhixin (Synced) 출처 (WeChat, CN)
T-Rex: 촉각에 전용 고속 차선을 부여하여, 숙련된 손(dexterous-hand)의 성공률을 두 배로 높이다 · 조작(manipulation)
저자 명단에는 Fei-Fei Li, Trevor Darrell, Jitendra Malik, Pieter Abbeel, Ken Goldberg, 그리고 NVIDIA GEAR Lab의 Jim Fan이 드물게 함께 이름을 올렸습니다. 하지만 여기서의 초점은 범용적인 두뇌가 아니라 숙련된 손(dexterous hand)에 있습니다. 이 논문은 직관에 반하는 발견으로 시작합니다. 촉각 힘 신호(tactile force signals)를 사전 학습된 VLA에 직접 결합하면 실제로는 성공률이 17%에서 6%로 떨어집니다. 즉, 촉각은 단순히 덧붙여질 수 있는 것이 아닙니다. T-Rex의 해결책은 전문가 혼합 트랜스포머(Mixture-of-Transformer-Experts) 설계입니다. 14.1억(1.41B) 파라미터의 행동 전문가(Action Expert)는 저주파 모션 플래닝(motion planning)을 처리하고, 6.2억(0.62B) 파라미터의 촉각 전문가(Tactile Expert)는 고주파 정밀 조정(refinement)을 처리합니다. 또한 10단계 확산 디노이징(diffusion denoising) 프로세스는 4단계에서 분할되며, 실시간 촉각 신호는 후반 단계에서만 주입됩니다. 촉각 자체는 먼저 VQ-VAE를 통해 압축되어, 과거 힘 이력(force history) 16프레임을 센서의 제로 드리프트(zero-drift)를 필터링하는 64개의 이산 코드워드(discrete codewords)로 변환합니다. 12개의 실제 숙련된 조작(dexterous manipulation) 작업 전반에 걸쳐, 평균 성공률은 가장 강력한 시각 전용(vision-only) 베이스라인의 35% 대비 **65%**에 달하며, 자물쇠 따기(lock-picking)의 경우 70% 대 0%를 기록했습니다. 촉각 입력을 제거하면 성능은 다시 42%로 떨어집니다.
Stanford / Berkeley BAIR / NVIDIA GEAR 등 · 분석: QbitAI 출처 (WeChat, CN)
Riemann-1.0: 232,000시간과 21개의 embodied(체화된) 모델을 아우르는 world-action model · world-model
Kunlun Tech의 부문인 Riemann Dynamics는 1인칭 인간 비디오, UMI 원격 조작(teleoperation) 시연, 그리고 이기종 로봇 궤적(heterogeneous robot trajectories)을 21가지 embodiment(체화) 유형에 걸친 232,000시간의 학습 데이터로 통합한 Riemann-1.0을 출시했습니다. 이는 3단계 점진적 embodied 사전 학습(embodied pretraining)을 갖춘 완전 인과적 world-action 모델링 아키텍처를 기반으로 구축되었습니다. 연구팀은 LIBERO에서 99% 이상의 성공률을 기록했으며, RoboCasa의 365개 가사 시나리오에서는 이전 방법보다 8%포인트 향상된 성능을 보였고, 장기적 일반화(long-horizon generalization) 측면에서 60%의 이득을 얻었다고 보고했습니다. 또한, 대량의 이기종 데이터를 추가함으로써 이전에는 실제 로봇 데이터가 반드시 필요하다고 여겨졌던 옷 접기 같은 작업에서도 눈에 띄는 개선이 이루어졌다고 주장합니다. ⚠️ 업체 주장
Kunlun Tech · Riemann Dynamics · 분석: KejiQianyanquaner 출처 (WeChat, CN)
MoWorld: 중국 NPU에서 엔드투엔드(end-to-end)로 실행되는 실시간 4D world model · world-model
주류 인터랙티브 월드 모델 (interactive world models)은 일반적으로 실시간 추론 (inference) 시 5~10 FPS가 최대치이며, 고성능 NVIDIA GPU에 종속되어 있습니다. Moxin Technology (중국 칩 스타트업)와 Zhejiang University의 Pan Yunhe 학술 교수 팀의 협업으로 탄생한 MoWorld는 훈련 (training), 증류 (distillation), 엣지 배포 (edge deployment)로 이어지는 전체 파이프라인을 중국산 NPU로 옮겼습니다. 이 모델의 14B MoE 모델은 최대 50 FPS에 도달하며, 이는 전통적인 GPU 설정 대비 전체 추론 비용의 30%~50% 수준입니다. 핵심 기술로는 생성 길이를 125 프레임에서 2,000 프레임까지 점진적으로 확장하는 커리큘럼 기반 교차 프레임 사전 학습 (curriculum-based cross-frame pretraining), 그리고 50단계의 디노이징 (denoising) 단계를 4단계로 압축하고 양방향 DiT를 자기 주도형 인과적 DiT (self-driven causal DiT)로 재작성하는 통합 잠재 공간 증류 (unified-latent-space distillation)가 있습니다.
Moxin Technology × Zhejiang University · arXiv 2607.06216 source · Analysis: AIGC Studio source (WeChat, CN)
두 대의 휴머노이드 로봇이 최초로 원격 수술을 완료하다 · manipulation
UC San Diego의 엔지니어링 및 수술 팀은 원격 조종 휴머노이드 로봇 (teleoperated humanoid robots)을 사용한 전임상 연구 (preclinical study)에서 두 건의 수술을 완료했습니다. 한 사례에서는 휴머노이드 로봇이 수술을 주도하고 인간 외과의가 보조하여 담낭을 제거했으며, 다른 사례에서는 두 대의 휴머노이드 로봇이 협력하여 대형 비인간 영장류를 대상으로 동일한 절차를 수행했습니다. 'Surgie'라는 코드명을 가진 이 로봇은 키가 약 5피트(약 152cm)이고 무게가 60파운드(약 27kg)인 반면, 기존의 수술 로봇 시스템은 일반적으로 약 **1,800파운드(약 816kg)**에 달하며 전용 수술실과 수술 전 준비를 위한 전체 팀이 필요합니다. 연구진이 공략하는 지점은 바로 이 격차입니다. 휴머노이드 로봇은 표준 도구를 사용하여 표준 수술실에서 작동할 수 있으므로, 전통적인 장비를 수용할 수 없는 원격 지역 사회나 수색 및 구조 (search-and-rescue) 환경에서도 사용이 가능할 잠재력을 가지고 있습니다.
UC San Diego (Michael Yip et al.) · 전임상 연구 (Preclinical study) · 보고: Earth.com source
HEAR: 소리 중심의 조작 (manipulation) 작업을 위한 "청각" 경로 추가 · manipulation
거의 모든 기존의 VLA (Vision-Language-Action) 인지 및 제어 메커니즘은 장면이 시간적으로 연속적이고 어느 정도의 시스템 지연 (latency)을 허용할 수 있는 시각 (vision)을 중심으로 설계되었습니다. 반면 HEAR는 성공 기준이 주로 소리에 달려 있는 조작 작업을 목표로 하며, 시각-소리-언어-행동 (vision-sound-language-action) 패러다임을 제안합니다.
IRMV Lab · IJRR 2026 채택 · 분석: IRMVLab source (WeChat, CN)
Act2Answer: VLA는 상식 (common sense)을 잃은 것이 아니다 — 단지 손에 닿지 않을 뿐이다 · benchmark
"블록을 정답 위에 놓으세요"와 같이 간단한 작업으로 VLA의 세계 지식 (world knowledge)을 테스트하면 직관에 반하는 결과가 나타납니다. VLM을 로봇 정책 (robot policy)으로 미세 조정 (fine-tuning)한 후에도, 그 지식은 잊혀지지 않으며 — 중간 레이어 표현 (intermediate-layer representations)에 잠재된 상태로 남아 있지만 — 실제 사용을 위해 액션 엔드 (action end)로 전달될 수는 없습니다. 따라서 평가 질문은 "여전히 기억하는가"에서 "실제로 사용할 수 있는가"로 전환됩니다.
분석: XiaohuXueLLM 출처 (WeChat, CN)
오늘의 다른 논문들: 로봇 본체를 교체할 때 재학습 없이 태스크 간 및 형태 간 일반화 (cross-task and cross-embodiment generalization)에 집중한 Ant Group의 Lingbo 팀의 오픈 소스 VLA 업데이트인 LingBot-VLA 2.0, 그리고 표준 행동 복제 (behavior-cloning) 미세 조정이 VLM의 시각적 및 의미적 사전 지식 (visual and semantic priors)을 덮어쓴다는 것을 발견하고, 대신 앵커 정렬 (anchored alignment)을 사용하여 분포 외 일반화 (out-of-distribution generalization)를 보존하는 Anchor-Align.
오픈 소스 · 도구 · 벤치마크
· NeoData / NeoForce: 30,000시간 분량의 시각-촉각 상호작용 데이터셋 및 교차 센서 통합 표현 모델로, 처음 5,000시간 분량이 이미 공개되었습니다 출처 (WeChat, CN)
· DreamX-World 1.0: Amap의 DreamX 팀이 개발한 5B 파라미터 규모의 상호작용형 세계 모델 (interactive world model)로, 코드와 가중치가 완전히 오픈 소스로 공개되었으며 카메라 내비게이션, 영역 재방문, 프롬프트 가능 이벤트 (promptable events)를 지원합니다. 8개의 RTX 5090 GPU에서 16 FPS 스트리밍으로 생성됩니다 출처 (WeChat, CN)
· Dreamer 4의 JAX/Flax 재구현 (reimplementation): 제3자가 DeepMind가 완전히 공개하지 않았던 학습 레시피 (training recipe) 세부 사항을 채워 오픈 소스로 공개함으로써, 월드 모델 (world model) 재현을 위한 진입 장벽을 낮추었습니다 출처 (WeChat, CN)
II. 투자 및 거래 (Funding & Deals)
Qianxun Intelligent | 시리즈 A+ | 15억 위안 (RMB) | 3개월간 총 45억 위안 (RMB) 이상 유치 · embodied
이번 라운드에는 일류 달러 펀드(USD funds)와 대형 산업 투자자들이 참여했으며, 거래에 근접한 투자자들은 이번 배분을 "매우 구하기 힘든(highly sought-after)" 것으로 묘사했습니다. 이는 Qianxun의 3개월 만에 진행된 네 번째 라운드입니다. 지난 2월에는 두 번의 라운드를 통해 약 20억 위안을 조달하며 기업 가치를 100억 위안 이상으로 끌어올렸고, 한 달 후에는 200억 위안 이상의 기업 가치로 다시 10억 위안을 조달했습니다 (Shunwei Capital과 Yunfeng Capital이 공동 주도했으며, Lei Jun과 Jack Ma가 동일한 embodied-AI 기업에 모두 주요 투자를 진행한 첫 사례가 됨). 이로써 이번 라운드까지 누적 조달 금액은 **45억 위안 (RMB)**을 넘어섰습니다. 회사는 동시에 자체 개발한 Spirit v1.6이 Berkeley, Stanford, NVIDIA가 공동 출시한 RoboArena 리더보드에서 Cosmos 3와 Pi0.5를 제치고 1위를 차지했다고 주장했습니다. 조달된 자금은 embodied 파운데이션 모델 (foundation model)의 반복 개선, 글로벌 실세계 데이터 인프라 구축, 그리고 다양한 산업에 걸친 배포 확장에 사용될 예정입니다. 회사의 데이터 수집 시스템은 현재 100개 이상의 도시에서 거의 1,000개의 웨어러블 기기를 사용하여 동시에 데이터를 수집하고 있습니다. 출처: 36Kr source
Motion Brain | 추가 Pre-A 펀딩 | 약 1억 위안 (RMB) | 6개월 만에 기업 가치 10배 이상 상승 · world-model
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기