FutureX · Physical AI Daily — Issue 77 (08/03)
요약
NVIDIA GEAR 팀이 44,000시간의 인간 비디오를 활용해 로봇 월드 모델을 학습하는 DreamDojo를 공개했습니다. 잠재 액션(latent actions)을 통해 액션 라벨이 없는 비디오에서도 제어 능력을 학습하며, 단일 H100 GPU에서 실시간 구동이 가능합니다.
핵심 포인트
- DreamDojo는 44,711시간의 1인칭 비디오를 사용하여 기술 다양성을 극대화함
- 32차원 잠재 액션 벡터를 통해 인간 비디오와 로봇 데이터를 연결
- 단일 H100 GPU에서 10.81 fps로 실시간 원격 조종 가능
- 유럽 휴머노이드 유니콘 탄생 및 Disney의 피지컬 AI 스타트업 지원 소식 포함
오늘의 하이라이트
· NVIDIA의 DreamDojo가 44,000시간의 1인칭 인간 비디오를 통해 범용 로봇 월드 모델 (world model)을 학습합니다.
· 유럽 최초의 휴머노이드 유니콘 탄생: Humanoid가 1억 5,200만 달러를 유치했으며, Bosch가 위탁 생산(contract manufacturer)을 맡고 Schaeffler가 주문을 진행합니다.
· 중국, 자율주행 "청색 표시등 (blue indicator lights)" 규제 강화: 새로 등록된 차량 모델은 공장 설치가 금지되며, 이와 동시에 국가 표준 GB 4785 개정이 시작되었습니다.
· Disney의 액셀러레이터가 사상 처음으로 두 개의 피지컬 AI 파운데이션 모델 (physical AI foundation-model) 기업을 동시에 지원합니다: Physical Intelligence 및 FieldAI
· 서울 강남의 로보택시 (robotaxi) 서비스가 유료 요금제로 전환한 지 2개월여 만에 1,000회 탑승을 돌파했습니다. 현재 운행 차량은 단 2대뿐입니다.
I. 연구 진척 상황 (Research Progress)
DreamDojo: 44,000시간의 인간 비디오를 월드 모델 (world model)에 주입한 후, 단일 GPU에서 실시간으로 증류 (distilling) · 월드 모델 (world-model)
월드 모델의 고질적인 문제는 "볼 수는 있지만 명령할 수는 없다"는 점입니다. 액션 라벨 (action labels)이 없는 인간의 비디오는 물리적 상식은 가르칠 수 있지만 액션 제어 (action control)는 가르칠 수 없습니다. NVIDIA의 GEAR 팀이 개발한 DreamDojo는 연속적인 잠재 액션 (continuous latent actions)을 통해 이 문제를 우회합니다. 7억 개의 파라미터를 가진 시공간 트랜스포머 VAE (spatiotemporal Transformer VAE)가 인접한 두 프레임을 입력받아, 그 사이에서 발생한 액션을 32차원 벡터로 압축하여 통합된 프록시 라벨 (proxy label)로 사용함으로써 인간의 비디오와 로봇 데이터를 연결합니다. 학습 데이터셋은 총 44,711시간의 1인칭 비디오로 구성되어 있으며, 9,869개의 장면 카테고리, 6,015개의 태스크, 43,237개의 객체를 포함합니다. 팀의 설명에 따르면, 이 데이터셋의 기술 다양성은 이전의 가장 큰 유사 데이터셋보다 96배 더 큽니다.
인간-비디오 사전 학습 (human-video pretraining), 타겟 구현체 (target embodiments, Fourier GR-1, Unitree G1)에 대한 사후 학습 (post-training), 그리고 4단계 디노이징 증류 (four-step denoising distillation)로 구성된 3단계 파이프라인을 거친 후, 이 모델은 단일 H100에서 초당 10.81 프레임 (10.81 fps)으로 실행되며 VR 컨트롤러를 통해 실시간 원격 조종 (teleoperation)이 가능합니다. 절제 연구 (ablations) 결과, 잠재 액션 사전 학습 (latent-action pretraining)은 추가 하드웨어가 필요한 정답 액션 사전 학습 (ground-truth action pretraining)과 거의 일치하는 성능을 보였습니다 (실험실 내 PSNR 20.83 대 21.02).
NVIDIA GEAR · arXiv 2602.06949 source · Analysis: AI随想录 source (WeChat, CN)
Xiaomi-Robotics-1: 100,000시간의 UMI 궤적을 기반으로 구축된 모바일 조작 (mobile-manipulation) 파운데이션 모델 · vla
Xiaomi Robotics는 자사 VLA의 사전 학습 데이터 소스를 교체했습니다. 실제 로봇 원격 조종 대신, **UMI 핸드헬드 그리퍼 (UMI handheld gripper)**와 1인칭 카메라를 사용하여 가정, 슈퍼마켓, 산업 현장, 사무실 및 야외 환경 전반에 걸쳐 100,000시간 이상의 실제 조작 궤적 (manipulation trajectories)을 수집했습니다. 이를 확장할 수 있었던 핵심은 어노테이션 (annotation)이었습니다. 팀은 궤적을 동일한 길이의 세그먼트로 나눈 다음, Qwen3.5-27B를 사용하여 "장면 상태가 어떻게 변했는지"에 대한 설명을 자동으로 생성했으며, 생산자-소비자 파이프라인 (producer-consumer pipeline)을 통해 약 2주 만에 전체 데이터셋에 라벨을 붙였습니다. 이 모델은 Qwen3-VL과 확산 트랜스포머 (diffusion Transformer)를 결합한 MoT 아키텍처를 사용합니다. 논문에 따르면 데이터 양과 파라미터 수가 증가함에 따라 성능이 계속 향상되며, 더 강력한 사전 학습이 사후 학습 중 미학습 환경에서의 더 나은 실제 로봇 성능과 상관관계가 있음을 보고했습니다.
Xiaomi Robotics · Analysis: 大语言模型和具身智体及自动驾驶 source (WeChat, CN)
Qwen-AgentWorld: embodied AI의 월드 모델을 언어 에이전트로 가져오기 · world-model
현재의 LLM 에이전트 연구는 거의 독점적으로 정책(policy) 측면(상태(state) → 행동(action))만을 최적화하고 있으며, 상호작용 루프의 나머지 절반인 환경이 어떻게 반응하는지에 대한 모델링은 오랫동안 심각하게 간과되어 왔습니다. Qwen 팀은 CPT→SFT→RL의 3단계 파이프라인을 통해 MCP, Search, Terminal, SWE, Android, Web, OS 등 7가지 환경 유형의 시뮬레이션을 통합하는 "언어 월드 모델(language world model)"을 학습시켰으며, GUI 시나리오는 픽셀 대신 접근성 트리(accessibility trees)를 통해 텍스트로 표현됩니다. 이 논문은 해당 모델이 에이전트 강화학습(agentic RL)을 위해 실제 환경을 대체할 수 있는 확장 가능하고 섭동 주입(perturbation-injectable)이 가능한 시뮬레이터로 기능하거나(보고에 따르면 실제 환경에서의 학습보다 성능이 뛰어남), 다음 상태 예측(next-state prediction)을 메타 추론(meta-reasoning)으로 내재화하는 "웜업(warm-up)" 역할을 할 수 있다고 주장합니다. 두 가지 모델 크기인 35B-A3B와 397B-A17B가 동시에 공개되었습니다.
Qwen team · arXiv 2606.24597 source · Analysis: 小胡学 LLM source (WeChat, CN)
자율 주행을 위한 잠재 월드 모델(latent world models)에 관한 조사: 지표는 프레임이 얼마나 사실적으로 보이는가가 아니라, 결정을 얼마나 신뢰할 수 있는가여야 한다 · autonomy
이 조사(survey)는 비디오 생성(video generation), 점유 예측(occupancy prediction), 잠재 계획(latent planning), 그리고 VLA 추론(VLA reasoning)이 서로 다른 출력을 생성함에도 불구하고, 이들이 공통된 계산 기질(computational substrate)로서 **잠재 표현(latent representations)**을 점점 더 많이 공유하고 있으며, 이로 인해 단일 프레임워크 내에서 서로 비교 가능해지고 있다고 주장합니다. 이에 따라 저자들은 방법론을 신경 시뮬레이션(neural simulation), 잠재 계획 및 강화학습(latent planning and reinforcement learning), 생성적 데이터 합성(generative data synthesis), 인지 추론(cognitive reasoning)의 네 가지 범주로 분류하고, 세 가지 개념적 지표인 **폐쇄 루프 안전 격차(closed-loop safety gap), 시간적 일관성(temporal coherence), 신중한 추론 비용(cautious-reasoning cost)**을 제안합니다. 이는 월드 모델(world models)이 "그럴듯해 보이는 미래를 생성하는 것"에서 "안전한 결정을 지원할 수 있는 미래를 생성하는 것"으로 나아가도록 촉구합니다. 또한 이 논문은 논쟁의 여지가 있는 지점에 대해서도 솔직하게 언급합니다. 즉, 행동에 따른 시간적 진화(temporal evolution)를 학습하지 않고 단순히 맑은 날의 이미지를 비 오는 밤의 이미지로 바꾸는 방법론은 엄격한 의미의 월드 모델이라기보다 조건부 생성 모델(conditional generative models)에 더 가깝다는 것입니다.
Rongxiang Zeng, Yongqi Dong (RWTH Aachen University · Delft University of Technology) · IEEE T-ITS 제출, 심사 중 · 분석: 飞行汽车研究 source (WeChat, CN)
오픈 소스 · 도구 · 벤치마크
· WorldScore 리더보드(leaderboard): 3D, 4D 및 비디오 생성 모델을 단일 프로토콜 하에 두는 "월드 생성(world generation)"을 위한 통합 벤치마크입니다. 테스트 세트는 3,000개의 샘플(정적 2,000개 / 동적 1,000개)로 구성되어 있으며, 3개의 제어 가능성(controllability) 지표 + 4개의 품질(quality) 지표 + 3개의 역학(dynamics) 지표를 기준으로 점수를 매겨 정규화됩니다. Hugging Face에서 호스팅되고 있으며 여전히 제출이 가능하며, 현재 스냅샷에는 34개의 모델 항목이 포함되어 있습니다 source (WeChat, CN)
II. Funding and Deals
Humanoid (영국 SKL Robotics) | 시리즈 A (Series A) | 1억 5,200만 달러 | 포스트 머니 기업가치 (post-money valuation) 13억 5,000만 달러 · humanoid ⚠️ 단일 출처 계정
Prime Movers Lab이 주도하고 Schaeffler, Bosch, Fubon Financial Holding Ventures, Aglaé Ventures가 참여했습니다. 이 회사의 누적 투자액은 현재 2억 7,000만 달러에 달하며, 자체 발표에 따르면 유럽 최초의 휴머노이드(humanoid) 중심 유니콘 기업입니다. 여기서 중요한 것은 기업가치가 아니라 이번 라운드의 산업 구조입니다. Schaeffler는 이미 상업적 파트너십 계약을 체결했으며 자사 제조 시설 전반에 수천 대의 유닛을 배치할 계획인 반면, Bosch는 하드웨어 설계, 생산 및 공급망을 담당하는 위탁 생산 파트너 (contract manufacturing partner) 역할을 수행할 예정입니다. 즉, 스타트업이 모델과 로봇 본체를 소유하고 산업 그룹이 이를 구축 및 배치하는 방식으로, 이는 미국의 "빅테크 및 벤처 캐피털" 모델과는 구별되는 경로입니다. 제품 라인업 또한 폼 팩터(form factor)에 대한 집착을 의도적으로 낮추고 있습니다. 핵심 플랫폼인 HMND-01 Alpha는 바퀴형(wheeled)과 이족 보행형(bipedal) 버전 모두로 계획되어 있으며, 이번 라운드 자금의 일부는 바퀴형 휴머노이드의 생산 규모를 확대하는 데 할당되어 2026년 4분기에 제조, 물류 및 소매 고객 사이트에 Beta 유닛을 배치할 계획입니다. 회사는 지난 5월 약 24억 달러의 예상 연간 반복 매출 (ARR)에 해당하는 약 34,000건의 사전 주문을 공개했으나, 이 수치는 경영진의 발표에 근거한 것입니다. 사전 주문은 인도(delivery)가 아니며, 구매 의사 금액을 확정된 매출로 간주해서는 안 됩니다. 출처: 机器人电报 source (WeChat, CN)
DeepRobotics AI (深度机智) | 신규 라운드 | 1억 위안 이상 (4개월 만에 세 번째 라운드) · world-model ⚠️ 단일 출처 계정
국유 자본 플랫폼, 산업 자본 및 주요 금융 기관이 공동으로 참여했으며, 기존 주주들도 후속 투자를 진행했습니다. 회사는 다음 라운드가 이미 마무리 단계에 있다고 밝혔습니다. 이는 5월에 진행된 1억 위안 이상의 라운드(Zhongguancun Capital, Chengtong Sci-Tech Innovation Fund 등)와 6월에 진행된 수억 위안 규모의 라운드(China Life Yangtze River Delta Sci-Tech Innovation Fund 주도)에 이은 것입니다. 이 회사는 2025년 Beijing Zhongguancun Academy와 Zhongguancun Institute of Artificial Intelligence에 의해 공동 인큐베이팅되었으며, '인간 학습 (human learning)' 방식을 채택하고 있습니다. 즉, 로봇의 궤적 (robot trajectories)을 맞추는 대신 1인칭 인간 데이터로부터 임바디드 파운데이션 모델 (embodied foundation model)인 PhysBrain을 직접 구동합니다. 자체 공개 자료에 따르면, Z-WM_v1은 WorldArena에서 이전 최고 점수인 64.24를 넘어 64.96점을 기록했습니다. SimplerEnv의 WidowX 테스트에서는 평균 성공률 80.2%를 기록했으며 (π0.5의 57.1% 대비), LIBERO에서는 평균 98.8%를 기록했습니다. 회사는 수천만 위안 규모의 실제 주문을 확보했다고 밝혔습니다. 이 모든 벤치마크 및 주문 수치는 회사의 공개 자료를 바탕으로 하며, 독립적으로 재현되지 않았습니다. 출처: 具身智能最前沿 source (WeChat, CN)
Zhongke Yuandongli (中科原动力) | Series B2 | 수억 위안 | 포스트 머니 기업 가치(post-money valuation) 10억 위안 이상 · 산업
지난주 이번 라운드에 대한 공개에 이어, 투자자 및 기업 가치 세부 사항이 현재 확인되었습니다: 이번 라운드는 Chery Holding Group의 계열사인 Anhui Chery Intelligent Technology에 의해 독점적으로 자금이 조달되었으며, 이는 회사가 지금까지 공개한 라운드 중 가장 큰 규모로, 포스트 머니 기업 가치(post-money valuation)가 **10억 위안(RMB)**을 초과합니다. 이는 회사의 10번째 펀딩 라운드입니다. 출처: Robo百科 source (WeChat, CN)
Unitree Robotics | STAR Market IPO | 8월 5일 수요예측(Bookbuilding) · humanoid
이전에 설정된 8월 10일 청약 날짜에 이어, 공모 일정이 더욱 앞당겨졌습니다: 여러 매체는 수요예측(bookbuilding) — 공모가를 결정하는 과정 — 이 8월 5일에 진행될 것이라고 보도했습니다. 투자설명서(prospectus)는 이미 FCC 규제 대상 목록을 직접적으로 다루었으며, 현재 판매 중인 모델은 인증을 완료했으나, 신규 모델은 미국 시장 진입에 필요한 인증을 획득하지 못할 위험이 있다고 명시했습니다. 출처: Sohu IPO周报 source
III. 상용화 및 배포 (Commercialization and Deployment)
서울 강남의 로보택시(robotaxi), 유료 운행 시작 2개월여 만에 1,000회 주행 돌파, 운영 차량은 단 2대 · autonomy
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기