FutureX · Physical AI Daily — Issue 59 (07/16)
요약
Xiaomi가 380억 파라미터 규모의 월드 파운데이션 모델 'U0'를 오픈 소스로 공개했습니다. U0는 텍스트-이미지 생성부터 Embodied Video Generation까지 통합된 프레임워크를 제공하며, World Arena 벤치마크 1위를 달성했습니다.
핵심 포인트
- Xiaomi U0 모델은 38B 파라미터 규모의 멀티모달 자기회귀 모델임
- Embodied Video Generation 부문 World Arena 벤치마크 1위 기록
- 단일 프레임워크로 이미지 생성, 편집, 로봇 시나리오 생성을 통합
- 월드 모델이 확장 가능한 데이터 엔진 역할을 할 수 있음을 검증
오늘의 주요 뉴스
· Xiaomi, **380억 개의 파라미터 (38-billion-parameter)**를 가진 월드 파운데이션 모델 (world foundation model) U0를 오픈 소스로 공개, Embodied Video Generation 부문 World Arena 리더보드 1위 달성
· Walden, Toyota와 Nvidia의 지원을 받아 3억 달러 규모의 투자 유치 및 스텔스 모드 종료, 기업 가치 11억 달러 기록
· RoboParty, CATL이 단독 주도하여 총 약 5억 위안 규모의 두 차례 라운드 투자 유치 완료
· XPeng의 2세대 VLA, 재학습 (retraining) 없이 독일 인증 통과, 유럽 배포를 향해 질주
· LimX Dynamics, COSA 0.5 휴머노이드 브레인 시스템 출시, "모델이 곧 브레인은 아니다"라고 주장
I. 연구 논문 (Research Papers)
Xiaomi U0: 월드 파운데이션 모델을 Embodied Synthesis Engine으로 직접 전환하기 · world-model
"데이터 공장으로서의 월드 모델 (world models as data factories)"에 대한 어제의 프리뷰에 이어, Xiaomi는 오늘 모델을 공식적으로 오픈 소스로 공개하고 논문을 발표했습니다. U0는 **380억 개의 파라미터 (38-billion-parameter)**를 가진 멀티모달 자기회귀 모델 (multimodal autoregressive model)로, 오픈 소스인 EMU3.5 (Qwen-3-32B)로부터 초기화되었으며, 통합된 다음 토큰 예측 (next-token prediction)을 통해 텍스트-이미지 생성 (text-to-image generation), 이미지 편집 (image editing), Embodied Scene Generation, 교차 Embodiment 전이 (cross-embodiment transfer), 그리고 Embodied Video Generation을 단일 프레임워크로 통합합니다. 이는 여러 로봇 Embodiment에 걸쳐 고품질의 다중 뷰 장면 생성 (multi-view scene generation)을 지원하는 최초의 모델이며, Embodied Video Generation 부문의 World Arena 벤치마크에서 1위를 차지했습니다. 또한 범용 정책 (generalist policy) π₀.₅의 실제 조작 작업에 대한 분포 외 (out-of-distribution) 성공률을 36.9%에서 63.2%로 끌어올렸습니다. Anti-diagonal decoding과 결합할 경우, 1024² 이미지 생성 속도는 네이티브 자기회귀 생성 (native autoregressive generation)보다 약 83배 빠릅니다. 핵심 요점은 파운데이션 월드 모델 (foundation world model)이 Embodied World Model인 동시에 확장 가능한 데이터 엔진 (scalable data engine) 역할을 할 수 있다는 아이디어를 검증했다는 점입니다.
Xiaomi Robotics · arXiv 2607.11643 source · 분석: Shuyuan AI source (WeChat, CN)
FlowWAM: 월드 액션 모델을 통합하기 위해 "보편적 행동 언어"로서 광학 흐름(optical flow) 사용 · world-model
월드 액션 모델(WAM)을 위한 통합된 행동 표현(action representation)으로 **광학 흐름 (optical flow)**을 사용합니다. 이는 사전 학습된 비디오 생성기(video generators)와 잘 정렬(align)되면서도 제어를 위한 충분한 움직임 단서(motion cues)를 제공합니다. 이는 "비디오 생성기를 위해 정렬 가능(alignable)하면서도 구동 가능(drivable)한 행동 표현을 어떻게 찾을 것인가"라는 질문에 답하기 위한 시도입니다.
Yixiang Chen 외 · arXiv 2607.13017 source
VistaVLA: VLA에 명시적인 3D 장면 표현 추가 · vla
기존의 VLA는 언어와 2D 이미지를 행동으로 직접 매핑하며, 장면 수준의 3D 표현이 부족하고 공간적 배치 및 기하학적 제약 조건에 대한 추론에 어려움을 겪습니다. VistaVLA는 **3D 가우시안 (3D Gaussians)**을 사용하여 기하학적 구조와 의미론(semantics)을 접지(grounding)함으로써, 조작 정책(manipulation policies)이 공간적 관계를 명시적으로 추론할 수 있도록 합니다.
Mohan Liu 외 · arXiv 2607.12356 source
TrustVLA: 추론 시점에 VLA의 "시각적 백도어" 방어 · vla
최종 사용자는 VLA의 배포 파이프라인을 감사(audit)할 수 없습니다. 오염된 모델은 깨끗한 영상에서는 정상적으로 동작하다가, 작은 시각적 트리거(visual trigger)가 나타나는 순간 실패가 표면화되기 전에 장기적 정책(long-horizon policies)을 하이재킹할 수 있습니다. 본 연구는 재학습 없이 백도어 트리거를 식별하고 억제하는 메커니즘 가이드 방식의 추론 시점 방어 (inference-time defense) 메커니즘을 제안합니다. 이는 VLA 연구에서 보기 드물지만 매우 중요한 안전성(safety) 측면입니다.
Pinhan Fu 외 · arXiv 2607.12571 source
Jetson-PI: Jetson에서 VLA가 실시간 제어를 수행하도록 하기 · vla
VLA는 연산량이 많아 Jetson Orin과 같은 저전력 보드에 배포할 경우 높은 지연 시간 (latency)과 낮은 제어 빈도 (control frequency)를 유발합니다. 본 연구는 "lookahead-aligned asynchronous inference (미리보기 정렬 비동기 추론)"를 사용하여 온보드 실시간 제어를 가능하게 하며, 물리적 로봇의 온디바이스 (on-device) 배포 시 발생하는 실제 병목 현상을 해결합니다.
Zebin Yang et al. · arXiv 2607.12659 source
GaitSpan: 걸을 수 있는 휴머노이드가 처음부터 달리는 법을 배울 필요는 없다 · locomotion
휴머노이드 로봇이 조깅이나 달리기를 하기 위해 보행 (locomotion)을 처음부터 다시 배울 필요는 없습니다. GaitSpan은 보행에서 달리기로 보행 패턴 (gait)이 "성장"할 수 있게 하여, 미리 설정된 보행 타이밍에 의존하거나 동작 클립 (motion clips)을 모방하는 기존 방식에서 발생하는 기술 파편화 (skill fragmentation)를 방지합니다.
Kwan-Yee Lin et al. · arXiv 2607.12114 source
오늘의 다른 논문들: ChunkFlow는 청크형 액션 헤드 (chunked action heads)에서의 경계 지터 (boundary jitter)를 제거합니다 (arXiv 2607.12992 source); Reducing Temporal Redundancy는 속도 향상을 위해 VLA 추론 시간의 중복성을 줄입니다 (arXiv 2607.12287 source); ExToken은 구조화된 탐색 (structured exploration)을 사용하여 VLA 강화학습 미세 조정 (reinforcement fine-tuning) 효율을 개선합니다 (arXiv 2607.12931 source); DenseReward는 합성된 실패 사례로부터 조밀한 보상 (dense rewards)을 학습합니다 (arXiv 2607.13033 source); Robust In-Hand Manipulation은 외부 인지 없이도 견고한 인핸드 조작 (in-hand manipulation)을 달성합니다 (arXiv 2607.12105 source); Hy-Embodied-VLM-1.0은 Tencent의 Hunyuan 팀이 개발한 효율적인 Embodied VLM입니다 (arXiv 2607.12894 source); MAMMOTH는 모달리티 누락 상황에서도 작동하는 견고한 오프로드 엔드투엔드 (end-to-end) 정책입니다 (arXiv 2607.12965 source); TerraZero는 데모가 필요 없는 제로 데모니스트레이션 (zero-demonstration) 셀프 플레이 주행 시뮬레이터입니다 (arXiv 2607.13028 source).
오픈 소스 · 도구 · 벤치마크
· WorldArena 2.0 Challenge: Jiqizhixin(중국 AI 미디어 매체) 등이 출시한 월드 모델 (world models)을 위한 "실전 시험"입니다. 트랙 2(Track 2)는 월드 모델을 온라인 강화학습 (reinforcement-learning) 루프 안에 배치하여—정책 액션 (policy actions)을 받고, 다음 관측값 (next observation)을 예측하며, 보상 (reward)을 반환하는 방식—모델이 단순히 비디오 클립을 생성하는 것을 넘어 "훈련 환경 (training environment)으로서 기능할 수 있는지"를 테스트합니다 source (WeChat, CN)
· Ruka-v2: $1,500 미만의 가격을 가진 오픈 소스 건 (tendon-driven) 구동 방식의 정교한 손 (dexterous hand)입니다. 업그레이드된 손목과 e-flesh 소프트 핑거팁 (soft fingertips)을 갖추고 있으며, 글쓰기, 페이지 넘기기, 펜 잡기 등이 가능합니다 source (WeChat, CN)
II. Funding and Deals
Walden Robotics | 스텔스 모드에서의 첫 라운드 | $3억 달러 | 기업 가치 $11억 달러 · 산업용
Toyota와 Deviation Capital이 공동 주도하였으며, Nvidia, Boeing, Samsung, Prologis, CoreWeave 등이 참여했습니다. 이 회사는 지난 1월 Toyota Research Institute (TRI)에서 스핀오프(spin-out)되었으며, 설립자이자 CEO인 Russ Tedrake는 MIT 교수이자 TRI의 대형 행동 모델 (Large Behavior Models) 부문 전 책임자로, Diffusion Policy와 대형 행동 모델 (Large Behavior Models)을 기반으로 하는 "풀스택 물리적 AI (full-stack physical AI)" 접근 방식을 추구하고 있습니다. 가장 주목할 점은 기업 가치가 아닙니다. 이 회사의 로봇은 지난 2월부터 Toyota North America 공장에서 생산에 투입되었으며, 파일럿 단계에서 생산 라인으로 전환되는 데 2개월 미만이 소요되었습니다. 이들은 자동차, 항공우주, 반도체, 전자, 물류 및 생명 과학을 포함하여 노동력이 제한된 산업을 목표로 합니다. 출처: The AI Insider source
RoboParty | Angel++ 라운드 + Pre-A 라운드 | 약 5억 위안 (RMB) · embodied
CATL이 Pre-A 라운드를 독점적으로 주도하였으며, Shunwei Capital, Matrix Partners China, Xiaomi의 전략적 투자 부문이 참여했습니다. 두 라운드를 합쳐 총액은 약 5억 위안 (RMB)에 달합니다. 이 회사는 **오픈 소스 풀스택 임바디드 플랫폼 (open-source full-stack embodied platform)**을 구축하고 있으며, 설립 팀은 Harbin Institute of Technology 출신의 22세 청년들로 구성되어 있습니다. CATL이 직접 라운드를 주도했다는 것은 배터리 및 산업 자본이 "하드웨어-부품" 체인을 따라 임바디드 플랫폼의 상류(upstream)로 진출하고 있음을 시사합니다. 출처: Embodied Emergence (중국 임바디드 AI 미디어) source (WeChat, CN)
Monumental (네덜란드) | 신규 라운드 | 3,200만 달러 · industrial
Khosla Ventures가 주도하였으며, 두 명의 전 Palantir 직원이 설립한 기업입니다. 이 자금은 유럽 전역과 미국으로 150대의 벽돌 쌓기 로봇 (brick-laying robots) 함대를 확장하는 데 사용될 예정이며, 영국과 같은 지역의 건설 직종 내 노동력 부족 문제를 해결할 것입니다. 출처: Tech Funding News source
Cytronic | Seed round | 1,350만 달러 · industrial
Axios가 독점 보도하였습니다. 대규모 자동화가 아직 도달하지 못한 중소형 창고 세그먼트를 목표로 창고 풀필먼트 (order picking, 주문 피킹) 로봇을 구축합니다. 출처: Axios source
Yuejiang Technology | 차기 ChiNext IPO 심사 예정 | 광둥-홍콩-마카오 대만구(Greater Bay Area) 최초의 "H-to-A" 상장 · embodied
협동 로봇 (collaborative robots) 및 휴머노이드 로봇 (humanoid robots) 제조사인 Yuejiang은 다음 주 심사 위원회에 출석할 예정이며, 광둥-홍콩-마카오 대만구(Greater Bay Area)에서 최초로 "H-to-A" 상장(홍콩 상장에서 A주 상장으로 전환)을 완료하는 기업이 될 것입니다. 출처: 21jingji (중국 금융 매체) source
Deyi Medical | Series A++ round | 수천만 위안 (RMB) · embodied
Tiantu Capital 산하의 펀드가 독점 투자하였습니다. 이 회사는 AI-plus-healthcare 형태의 embodied 로봇을 구축하며, 올해 들어 현재까지 두 번의 펀딩 라운드를 마감했습니다. 출처: Tiantu Capital source (WeChat, CN)
III. 상용화 및 배포 (Commercialization and Deployment)
Agibot의 Genie G2 누적 판매 15,000대 돌파, JD Logistics와 함께 G2 Max 출시 · humanoid ⚠️ vendor claim
Agibot(Zhiyuan Robotics, 중국 휴머노이드 스타트업)에 따르면, 자사의 Genie G2는 6월 말까지 생산 라인에서 15,000대를 돌파했으며, Longqi Technology 공장의 생산 라인에 배치되었습니다. 10,000대에서 15,000대에 도달하는 데 약 3개월이 소요되었습니다. 참고로, Omdia 데이터에 따르면 지난해 전 세계 휴머노이드 출하량은 약 13,000대였으며, 이는 이 단일 배치만으로도 이미 지난해 전 세계 총량을 넘어섰음을 의미합니다. Agibot은 지난해 전 세계 휴머노이드 시장 점유율의 거의 40%를 차지했습니다. 이와 결합된 "데이터 수집 2.0(Data Collection 2.0)" 듀얼 트랙 수집 방식(실제 로봇 및 시뮬레이션)은 sim-to-real(시뮬레이션에서 실물로의 전환) 격차를 줄이는 것을 목표로 하며, Aishida와의 파트너십에서도 핵심적인 역할을 합니다. 다만, Aishida는 전체 휴머노이드 유닛이 아닌 Cooper 사족 보행 로봇을 조립한다는 점에 유의해야 합니다. 오늘, JD Logistics와 Agibot은 임바디드 로봇(embodied robot)인 Genie G2 Max를 공동 출시했습니다. 생산량에서 앞서 나가는 것이 곧 "기술적 도약"을 의미하는 것은 아닙니다. 대량 생산 수치는 무엇보다도 데이터를 축적하기 위한 유리한 조건입니다. 출처: Zhizhen Guan (중국 로보틱스 미디어) source (WeChat, CN)
Unitree의 G1, 해외로 나가 "벽돌을 쌓다": 일본 건설사가 현장에 휴머노이드 배치 · humanoid
일본의 한 건설사가 Unitree의 G1 휴머노이드 로봇을 건설 현장에 배치했습니다. 이는 중국 휴머노이드 로봇이 단순한 무대 시연이 아닌, 실제 산업 현장인 해외로 진출한 또 다른 사례입니다. 출처: IT Home (중국 테크 미디어) source
Gausium, IDC 선정 세계 1위 상업용 청소 로봇 공급업체로 선정 · industrial
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기