FutureX · Physical AI Daily — Issue 58 (07/15)
요약
Xiaomi의 월드 모델을 활용한 로봇 데이터 생성 프레임워크와 ABot-N1의 시각-언어 내비게이션 연구를 소개합니다. 월드 모델을 실시간 제어가 아닌 데이터 공장으로 활용하여 로봇의 OOD 작업 성공률을 크게 높였습니다.
핵심 포인트
- Xiaomi U0: 월드 모델을 데이터 생성 도구로 활용해 OOD 성공률을 36.9%에서 63.2%로 향상
- Xiaomi 휴머노이드 로봇: 현장 교육을 통해 너트 체결 성공률 98% 달성
- ABot-World Studio: RTX 5090 기반의 범용 월드 모델 워크숍 오픈 소스 공개
- ABot-N1: 좌표 드리프트 문제를 해결하기 위한 범용 내비게이션 파운데이션 모델 제안
오늘의 하이라이트
· 자동차 공장에서 4개월간의 현장 교육(on-the-job training)을 거친 Xiaomi의 휴머노이드 로봇의 너트 체결 성공률이 **98%**로 상승했으며, 이는 인간 기준치보다 단 1%포인트 모자란 수치입니다.
· Amap은 단일 RTX 5090에서 1시간 이상 연속 추론(continuous inference)이 가능한 범용 월드 모델(world model) 워크숍인 ABot-World Studio를 출시하고 오픈 소스로 공개했습니다.
· HiPhi(Huawei가 지원하는 EV 브랜드) G9가 베이징에서 120 km/h 속도로 평가받는 L3 자율주행 도로 테스트 면허를 취득한 첫 번째 차량이 되었습니다.
· 하루 만에 두 건의 촉각/정교한 손(tactile/dexterous-hand) 관련 거래가 발생했습니다: Xense Robotics는 1억 위안 이상을 투자받았으며, DexRobot의 수억 위안 규모 Series A는 Shanghai Electric이 주도했습니다.
· Xiaomi의 U0는 월드 모델을 데이터 공장(data factory)으로 취급하여, pi0.5의 분포 외(out-of-distribution) 성공률을 36.9%에서 63.2%로 끌어올렸습니다.
I. 논문 (Papers)
Xiaomi-Robotics-U0: 월드 모델은 제어 루프(control loop)에 속하지 않는다 — 대신 로봇 데이터 공장으로 사용하라 · world-model
이 논문은 "로보틱스에서 월드 모델을 실제로 어떻게 사용해야 하는가"라는 질문에 실용적인 해답을 제시합니다. 추론 시점에 로봇을 위한 실시간 계획(real-time planning)을 수행하는 대신, 훈련 전에 로봇이 본 적 없는 시나리오를 "제조"합니다. Xiaomi(중국의 가전 및 EV 기업)는 월드 파운데이션 모델(world foundation model)을 사용하여 다중 뷰 일관성(multi-view-consistent), 기하학적 일관성(geometrically coherent), 체화 제약(embodiment-constrained) 상호작용 데이터를 생성하는 통합 체화 합성 프레임워크(unified embodied synthesis framework)를 제안합니다. 이는 실제 로봇 데이터에서 가장 비용이 많이 드는 격차인 분포 외(out-of-distribution) 시나리오를 직접적으로 채워줍니다. 결과적으로, 추가적인 실제 로봇 데이터 수집 없이도 pi0.5의 분포 외 작업 성공률이 36.9%에서 63.2%로 거의 두 배 가까이 상승했습니다.
Xinghang Li et al. (Xiaomi) · arXiv 2607.11643 source · Commentary: ICCV source (WeChat, CN)
ABot-N1: 시각-언어 내비게이션(Vision-Language Navigation, VLN)을 범용 파운데이션 모델로 전환 · autonomy
커뮤니티에서 오늘 가장 많이 논의된 논문입니다 (HF↑76). 대부분의 기존 내비게이션 파운데이션 모델(Navigation Foundation Models)은 관측값(Observations)을 행동(Actions)으로 직접 매핑하는 단일 정책(Monolithic Policies) 형태이며, 이는 좌표 드리프트(Coordinate Drift)에 취약하고 롱테일 의미론(Long-tail Semantics) 처리에 어려움을 겪습니다. ABot-N1은 심층 공간 추론(Deep Spatial Reasoning)을 다중 작업 범용성(Multi-task Generality)으로부터 분리한 후 이를 통합하며, 다양한 형태(Embodiments)와 시나리오에 걸쳐 일반화되는 VLN 백본(Backbone)을 목표로 합니다. 이는 오늘 Amap(Alibaba의 매핑 자회사)이 아래의 두 논문과 함께 발표한 동일한 ABot 시리즈에 속합니다.
Ruiyan Gong et al. (Amap) · arXiv 2607.10383 source
ABot-3DWorld 0: 문장, 이미지 또는 비디오를 탐사 가능한 3D 월드로 전환 · world-model
이 모델은 오늘 출시된 Amap의 ABot-World Studio의 기반이 되는 3D 생성 엔진이며, 모델이 오픈 소스로 공개되었습니다. 핵심은 **공간 생성 프리미티브 (Spatial Generative Primitive, SGP)**라고 불리는 압축된 표현 방식입니다. 이는 고품질 파노라마와 공간 포인트 클라우드(Spatial Point Cloud)가 쌍을 이루어 임의의 3D 공간을 균일하게 설명하는 데 사용됩니다. 이는 텍스트, 이미지, 비디오 입력을 단일한 실시간 탐사 가능 월드 표현(World Representation)으로 수렴시켜, 로봇 학습 및 시뮬레이션 데이터 수집에 직접적으로 기여합니다.
Mingchao Sun et al. (Amap) · arXiv 2607.11673 source
ABot-AgentOS: 로봇에게 평생 기억(Lifelong Memory)을 갖춘 "운영 체제" 부여 · benchmark
HF↑66. VLM/VLA 모델은 진보된 인지(Perception) 및 행동 예측(Action Prediction) 능력을 갖추고 있지만, 장기 과제(Long-horizon tasks)를 수행하기 위한 범용 런타임 계층(Runtime layer)은 여전히 부족합니다. 즉, 추론(Reasoning), 메모리(Memory), 도구 호출(Tool calling), 결과 검증(Result verification), 그리고 교차 체화(Cross-embodiment) 실행을 관리할 주체가 여전히 필요합니다. 본 논문은 이 계층을 교차 모달 평생 기억(Cross-modal lifelong memory)을 갖춘 범용 로봇 에이전트 운영 체제(Agent OS)로 추상화합니다. 이는 논문들이 간과하는 경향이 있지만 실제 현장 배포 시 매일 발생하는 문제인 "상위 계층 오케스트레이션(Upper-layer orchestration)"의 공백을 해결합니다.
Jiayi Tian et al. (Amap) · arXiv 2607.10350 source
EgoSteer: 1인칭 인간 비디오를 통해 정교한 손(Dexterous hands)에 "조종 가능성(Steerability)" 부여 · vla
조종 가능성(Steerability) — 즉, 지시받은 대로 수행하고 지시가 내려지면 경로를 변경하는 능력 — 은 범용 정책(General-purpose policies)이 갖추어야 할 역량이지만, 정교한 손 시스템에는 크게 결여되어 있습니다. 병목 현상은 데이터에 있습니다. 언어와 정렬되고(Language-aligned) 행동이 정밀한(Action-precise) 대규모 시연 데이터가 부족합니다. EgoSteer는 1인칭 인간 비디오를 사용하여 정교한 손 VLA 모델의 사전 학습(Pretraining)을 확장하고, 이후 아주 적은 양의 실제 로봇 데이터로 사후 학습(Post-training)을 진행하는 풀스택 솔루션을 제공합니다.
Yifan Zhong et al. · arXiv 2607.09701 source
Mixture of Frames Policy: 행동 디노이징(Action denoising)은 단 하나의 좌표계에서만 일어나서는 안 된다 · manipulation
조작(Manipulation)은 본질적으로 다중 프레임(Multi-frame)적입니다. 미세한 말단 장치(End-effector) 운동은 도구 좌표계(Tool frame)에서 표현하는 것이 가장 간단한 반면, 운반(Transport), 바로잡기(Righting), 그리고 전신 협응(Whole-body coordination)은 베이스 좌표계(Base frame)에서 다루는 것이 더 합리적입니다. 본 논문은 정책이 여러 참조 좌표계(Reference frames)에서 별도로 디노이징을 수행한 후 그 결과를 혼합하도록 하며, 양손 모바일 조작(Bimanual mobile manipulation)을 목표로 합니다. 이는 단순히 파라미터를 늘리는 것이 아니라, 확산/흐름 정책(Diffusion/flow policy)의 행동 표현에 대한 구조적 교정입니다.
Dian Wang et al. (Stanford) · arXiv 2607.11884 source
VIA: 파운데이션 모델이 인터페이스를 "바라보고" "클릭함으로써" 로봇을 제어하게 하기 · vla
일반적인 파운데이션 모델 (Foundation models)은 이미 강력한 시각 및 추론 능력을 갖추고 있지만, 약점은 폐루프 제어 (Closed-loop control)입니다. Sadigh 교수 연구팀의 접근 방식은 엔드투엔드 정책 (End-to-end policy)을 직접 학습시키는 것이 아니라, 파운데이션 모델에 시각적 상호작용 인터페이스를 중간 계층 (Middle layer)으로 제공하여 모델이 에이전트 (Agent) 방식으로 로봇을 조작하게 하는 것입니다. 이는 "모델이 잘하는 것"과 "로봇이 필요로 하는 것"을 재정렬하는 작업입니다.
Hengyuan Hu 외 (Stanford) · arXiv 2607.11119 source
Cycle-World: 장기 비디오 월드 모델 (Video world models)의 드리프트 (Drift)를 억제하기 위한 "역방향 예측" 활용 · world-model
장기 비디오 생성을 위한 자기회귀 확산 (Autoregressive diffusion) 모델에서는 오류가 단계별로 누적되어 구조적 붕괴 (Structural collapse)로 이어지는데, 이는 비디오 월드 모델을 시뮬레이터로 사용하고자 하는 모든 팀이 마주하게 되는 장벽입니다. 본 논문은 역방향 예측 순환 일관성 제약 (Backward-prediction cycle-consistency constraint)을 추가하여, 모델이 "미래로부터 현재를 복구할 수 있는지"를 스스로 확인하게 함으로써 장기 생성 드리프트 (Long-horizon generation drift)를 억제합니다.
Zihan Su 외 · arXiv 2607.11836 source
오늘의 다른 논문들: 인간 수준의 정교한 원격 조작을 향하여, 손 안에서의 재파지(regrasping) 및 손가락 보행(finger gaiting)을 위한 원격 조작 시스템 (arXiv 2607.11481 source); WALA, 동작 라벨이 지정된 시연(action-labeled demonstrations)과 동작이 없는 비디오(action-free video)로부터 실행 가능한 잠재 동작(latent actions)을 동시에 학습하기 (arXiv 2607.11397 source); WarpMPC, GPU에서 수십만 개의 MPC 하위 문제를 병렬로 해결하기 (arXiv 2607.11603 source); TAC-LOCO, 동적 이동-조작(loco-manipulation)을 위한 사족 보행 전신 제어(whole-body control)에 촉각 통합하기 (arXiv 2607.10132 source); 최소주의적 리타겟팅 가이드 RL 레시피, 휴머노이드 전신 제어의 "리타겟팅 + 강화학습 (RL)" 레시피가 정교한 조작(dexterous manipulation)으로 전이되는지 테스트하기 (arXiv 2607.11874 source); 월드 액션 모델(World Action Models)에서 체화된 뇌(Embodied Brains)로, 월드 액션 모델에서 오픈 월드 물리 지능(physical intelligence)을 향한 로드맵 (arXiv 2607.11689 source).
오픈 소스 · 도구 · 벤치마크
· Horizon Robotics 시뮬레이션-학습 생성 엔진: 오픈 소스로 공개됨; 동일한 장면을 MuJoCo, Genesis, IsaacSim에서 동시에 실행 가능 — 로봇 학습을 위해 단일 장면 에셋을 여러 시뮬레이터에서 재사용할 수 있게 된 첫 사례 source (WeChat, CN)
· ABot-World 시리즈: ABot-World Studio와 함께, Amap은 두 가지 모델 가중치를 오픈 소스로 공개함 — ABot-World0 (대화형 비디오 생성) 및 ABot-3DWorld0 (3D 장면 생성) source (WeChat, CN)
· GigaWorld-1: 생성형 월드 모델 (Generative World Models)을 사용하여 실제 로봇의 시도(trial runs) 중 일부를 대체함으로써, 실제 로봇 정책 평가 (Policy Evaluation) 비용을 절감하는 접근 방식 출처 (WeChat, CN)
II. Funding & Deals
Xense Robotics (千觉机器人) | 신규 라운드 | 1억 위안 이상 · 하드웨어 (Hardware)
최고의 Embodied Intelligence (체화된 지능) 산업 플레이어와 **Chigo (중국 가전 제조업체)**로부터 전략적 투자를 받았으며, Tianji Capital이 후속 투자를 진행했습니다. Shanghai Jiao Tong University의 부교수이자 ICRA 2021 최우수 논문상(Best Paper Award)의 유일한 글로벌 수상자인 Ma Daolin이 2024년 5월에 설립한 이 회사는 멀티모달 촉각 센서 (Multimodal Tactile Sensors)를 시각-촉각 데이터 및 모델과 결합한 통합 솔루션을 구축하며, 현재 300개 이상의 선도적인 산업 고객에게 서비스를 제공하고 있다고 밝혔습니다. 이번 투자금은 고정밀 3색광 시각-촉각 센서의 산업화에 사용될 예정입니다. 촉각 감지 (Touch sensing)는 이제 "논문 속의 하나의 양상 (modality)"에서 실제 주문이 발생하고 공급망 내 자리를 잡는 구성 요소로 이동하고 있습니다. 이는 이번 주에 1억 위안 이상을 조달한 두 번째 촉각 감지 기업입니다. 출처: Sensor Expert Network 출처 (WeChat, CN)
DexRobot (灵巧智能) | 시리즈 A | 수억 위안 · Embodied (체화된)
Shanghai Electric으로부터의 투자. 이 회사는 로봇 엔드 이펙터 (end-effectors) 및 정교한 조작 시스템 (dexterous manipulation systems)을 전문으로 하며, 로봇이 물리적 세계와 상호작용하는 과정에서의 "마지막 1센티미터" 문제를 해결하는 것을 미션으로 설명합니다. 이번 자금은 정교한 손 (dexterous hands)의 제품 반복 개선 (product iteration)과 여러 산업에 걸친 대규모 배포를 위해 사용될 예정입니다. 순수 금융 VC가 아닌 산업 자본 (Industrial capital)이 엔드 이펙터에 직접 베팅하는 것은 "정교한 작업을 수행할 수 있는 손"에 대한 실제 산업적 수요를 시사합니다. 출처: Robotics Open Community source (WeChat, CN)
LimX Dynamics (逐际动力) | Pre-IPO 라운드 | 약 2억 달러 | 포스트 머니 기업 가치 (Post-money valuation) 150억 위안 · 휴머노이드 (humanoid)
이번 주 초 해당 라운드에 대한 공개가 있은 후, 회사는 오늘 공식적으로 클로징을 확인하고 기업 가치를 확정했습니다. 투자자로는 IDG Capital, Lens Technology, Hefei Binhu Financial Holdings Group, GGG Group 및 Redstone VC, Huashan Capital, Legend Capital 등이 포함됩니다. 회사는 지난 6개월 동안 누적 4억 달러를 조달했다고 밝혔습니다. 참고로, Crunchbase 데이터에 따르면 글로벌 로보틱스 스타트업 펀딩은 2026년 상반기에 188억 달러에 달하며, 이는 이미 2025년 연간 총액인 150억 달러를 넘어섰습니다. 출처: Shanghai Securities News source (WeChat, CN)
Quadric | 시리즈 C (Series C) | 4,600만 달러 · 하드웨어 (hardware)
에지 추론 (edge inference)을 위한 프로그래밍 가능한 AI 칩 플랫폼을 구축합니다. 로봇 컴퓨팅 (robot compute) 솔루션은 여전히 범용 GPU (general-purpose GPUs)에 크게 의존하고 있으며, 프로그래밍 가능한 에지 칩 (programmable edge chips)은 이러한 의존성을 해결하기 위한 하나의 경로입니다. 출처: Pulse 2.0 source
NovaTech (South Korea) | 신규 라운드 (New round) | 70억 원 (~$5 million) · 인접 분야 (adjacent)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기