FutureX · Physical AI Daily — Issue 61 (07/18)
요약
중국의 Embodied Intelligence 정책 지원과 휴머노이드 로봇 산업의 급성장 소식을 전합니다. 또한 로봇 파운데이션 모델의 컨텍스트 길이를 8K 타임스텝으로 확장한 RoboTTT 연구와 휴머노이드 행동 모델을 위한 스케일링 법칙 연구를 소개합니다.
핵심 포인트
- 시진핑의 WAIC 참석으로 Embodied Intelligence에 대한 강력한 정책적 지지 확인
- Xynova가 Meituan 주도로 5억 위안 규모 투자를 유치하며 유니콘 등극
- RoboTTT 연구를 통해 로봇 모델의 컨텍스트 길이를 8K로 확장하여 성공률 87% 향상
- 휴머노이드 행동 파운데이션 모델(BFM) 최적화를 위한 스케일링 레시피 제안
오늘의 주요 뉴스
· 시진핑(Xi Jinping)이 처음으로 WAIC에 참석하여 AI가 **물리적 세계 (physical world)**로 진입하는 기조를 설정하며, Embodied Intelligence (Embodied Intelligence)에 대해 현재까지 가장 높은 수준의 정책적 지지를 제공함
· AgiBot의 Genie G2 Max가 JD Logistics와 파트너십을 체결 — 휴머노이드 로봇이 실제 생산 창고 환경에 투입된 첫 사례
· Zoox가 짙은 연기에 대한 오판 이후 로보택시 (robotaxi) 함대에 대해 105대의 차량을 대상으로 소프트웨어 리콜을 실시함
· **Xynova (중국의 정교한 손(dexterous-hand) 스타트업)**가 Meituan이 주도하는 5억 위안 규모의 Series A+ 투자를 유치함. 이는 7개월 만에 15억 위안을 끌어모은 것으로, 정교한 손 분야의 새로운 유니콘이 됨
· OFweek: 중국 본토의 휴머노이드 로봇 생산량은 상반기에 30,000대를 넘어섰으며, 출하량은 약 23,000대임
I. 연구 진척 상황
RoboTTT: 로봇 정책의 "컨텍스트 (Context)"를 3단계 규모로 확장하기 · vla
로봇 파운데이션 모델 (Robotic foundation models)은 이전에는 단일 단계 또는 짧은 이력의 시각-행동 컨텍스트 (visual-action context)만을 소비할 수 있었습니다. RoboTTT는 추론 속도를 늦추지 않으면서 이 창을 기존 정책보다 3단계(three orders of magnitude) 더 긴 **8K 타임스텝 (timesteps)**까지 확장한 최초의 사례입니다. 이 접근 방식은 VLA 내부에 테스트 시간 훈련 (test-time training, TTT)을 내장합니다. 즉, 일련의 "빠른 가중치 (fast weights)"가 훈련과 추론 과정 모두에서 지속적으로 그래디언트 업데이트 (gradient updates)를 수행하며, 긴 이력을 가중치 공간 (weight space)에 압축하여 필요할 때 검색할 수 있도록 합니다. 실제 로봇 조작에서의 전체 성공률은 단일 단계 베이스라인 대비 87% 향상되었으며, 모델은 모든 베이스라인이 실패한 5분 길이의 10단계 조립 작업을 독립적으로 완료했습니다. 또한 8K 컨텍스트는 1K 사전 훈련(pretraining) 컨텍스트보다 62% 더 우수한 성능을 보였습니다. 저자들은 "컨텍스트 길이 (context length)"를 로봇 파운데이션 모델을 위한 새로운 스케일링 축 (scaling axis)으로 제안합니다.
Yunfan Jiang 외 (NVIDIA GEAR) · arXiv 2607.15275 source · HF↑11
휴머노이드 "행동 파운데이션 모델 (Behavior Foundation Models)"을 위한 스케일링 레시피 · locomotion
휴머노이드 "행동 파운데이션 모델 (Behavior Foundation Models)"을 위한 스케일링 레시피 · locomotion
전신 휴머노이드 제어 (Whole-body humanoid control)는 자연스러운 협응, 실시간 응답성, 그리고 환경 간 일반화 (cross-environment generalization)를 동시에 요구합니다. 연구팀은 행동 파운데이션 모델 (BFMs)의 스케일링 법칙 (scaling laws)을 재검토하였으며, 세 가지 요소가 반드시 공동 최적화되어야 함을 발견했습니다: 다양한 제어를 전역 좌표계 (global coordinate frame) 하의 **모션 트래킹 (motion tracking)**으로 통합하는 것, 온라인 롤아웃 (online rollout) 횟수와 참조 모션 다양성 (reference motion diversity) 사이의 비율, 그리고 확장 가능한 휴머노이드 트랜스포머 (Humanoid Transformer) 아키텍처입니다. 시뮬레이션과 실제 하드웨어 모두에서, 전역 모드 (global mode)를 사용할 때 주요 지점 포즈 오차 (MPKPE)가 기존 컨트롤러 대비 82% 감소했습니다.
Weishuai Zeng 외 · arXiv 2607.15163 source
DriftWorld: "Drift"를 통해 로봇 월드 모델을 30+ FPS로 밀어붙이기 · world-model
계획 (planning)을 위해 월드 모델 (world models)을 사용하는 것은 대량의 롤아웃을 빠르게 생성할 것을 요구하지만, 확산 기반 (diffusion-based) 월드 모델은 매 호출마다 다단계 샘플링 (multi-step sampling)이 필요하여 비용이 많이 듭니다. 대신 DriftWorld는 학습 과정에서 "액션 조건부 드리프트 (action-conditioned drift)"를 학습하므로, 추론 시 **단 한 번의 순전파 (single forward pass)**만으로 미래 프레임을 생성합니다. 이는 확산 기반 베이스라인 (diffusion baselines)보다 평균 17배 빠르며 30+ FPS에 도달하는 동시에, Bridge-V2, RT-1, Push-T와 같은 벤치마크에서 더 적은 추론 시간으로 SOTA 의사결정 성능을 달성합니다. 오프라인 "정책 스코어러 (policy scorer)"로 사용될 경우, 그 점수는 실제 성공률과 최대 0.99의 상관관계를 보입니다.
Susie Lu 외 · arXiv 2607.15065 source · Analysis: 世模人 source (WeChat, CN)
월드-액션 모델이 "생각은 맞지만 행동은 틀릴 때": 새로운 유형의 적대적 공격 · world-model
월드-액션 모델 (World-action models, WAMs)은 행동 생성 (action generation)과 미래 예측 (future prediction)을 결합하며, 이 분야에서는 일반적으로 "상상된 미래에 대해 행동을 검증하는 것"이 모델을 더 안전하게 만든다고 가정해 왔습니다. BadWAM은 이러한 가정의 견고함이 틀렸음을 증명합니다. 아주 미세한 시각적 섭동 (visual perturbations)만으로도 "상상 (imagination)"과 "실행 (execution)" 사이의 정렬 (alignment)을 해제할 수 있습니다. 공격적인 모드 (aggressive mode)에서는 폐루프 성공률 (closed-loop success rate)이 96.5%에서 43.1%로 즉시 급락하는 반면, 스텔스 모드 (stealth mode)에서는 모델이 그럴듯해 보이는 미래를 여전히 "상상"하면서도 실제로는 정렬되지 않은 행동을 실행하여, 상상 기반의 안전 점검 (safety checks)을 완전히 우회합니다.
Qi Li et al. · arXiv 2607.15207 source · HF↑34
RxBrain: 언어 추론과 "시각적 상상"을 하나의 체화된 인지 기반 모델로 통합 · world-model
장면 이해 (scene understanding)에 집중하는 VLM이나 미래 프레임만을 예측하는 생성형 월드 모델 (generative world models)과 달리, Tencent Hunyuan의 RxBrain은 체화된 계획 (embodied plans)을 단일 시퀀스로 표현합니다. 언어는 작업 분해 (task decomposition), 제약 조건 (constraints), 결정 로직 (decision logic)의 추상적인 골격을 제공하며, 시각적 상상 (visual imagination)은 월드 상태 예측 (world-state prediction)을 사용하여 각 단계를 구체적인 물리적 상태에 접지 (grounding)시킵니다. 이 모델은 통합된 Mixture-of-Transformers를 채택하여 단일 모델 내에서 언어/이미지/비디오 전반의 이해와 생성을 가능하게 합니다. 이를 연속적인 행동 (continuous action)으로 확장했을 때, 대규모 행동 데이터 사전 학습 (action-data pretraining) 없이도 실제 로봇에서 사용 가능한 성능을 달성합니다.
Haotian Liang et al. (Tencent Hunyuan) · arXiv 2607.14187 source
Reflex: 스트리밍 추론을 통해 추론과 동시에 Flow-Matching VLA 출력 가능, 실시간 제어 달성 · vla
Flow-matching VLA는 연속 제어 (continuous control)를 위한 높은 정밀도를 제공하지만, 반복적인 디노이징 (iterative denoising)은 본질적으로 실시간 로보틱스와 상충됩니다. 전역 타임스텝 (global timesteps)을 주입하면 KV-cache가 깨지게 되어, 느린 재계산과 "수학적으로 부정확한 캐시 재사용" 사이에서 하나를 선택해야만 합니다. Reflex는 스트리밍 추론 (streaming inference)을 통해 이 프로세스를 재구조화하여, 연속 제어의 정밀도를 유지하면서도 지연 시간을 실시간 실행 가능한 수준으로 압축합니다.
Yuanchun Guo, Bingyan Liu · arXiv 2607.14695 source
MIDAS Hand: 3,000달러 미만의 3D 프린팅 오픈 소스 다지형 손 · manipulation
다지형 조작 (dexterous manipulation)의 병목 현상은 알고리즘뿐만이 아닙니다. 인간과 유사한 손 크기, 제조 및 유지보수의 용이성, 촉각 센싱 (tactile sensing), 그리고 통제된 비용 사이의 균형을 맞춘 하드웨어의 부재도 원인입니다. MIDAS Hand는 직접 구동 방식의 낮은 백드라이브 토크 (low back-drive torque)와 **283개의 통합 3축 촉각 유닛 (triaxial tactile units)**을 갖춘 16-DoF (13개 활성) 오픈 소스 손을 제공합니다. 총 무게는 700g이며, 부품 명세서 (bill-of-materials) 비용은 3,000달러 미만이고, 3D 프린팅된 부품은 3시간 이내에 조립 가능합니다. 이 프로젝트는 설계 파일, 제어/촉각 API, 시뮬레이션 모델, 그리고 원격 조작 (teleoperation) 파이프라인과 함께 공개되었습니다.
Alvin Zhu et al. · arXiv 2607.14487 source
오늘의 다른 논문들: Open-AoE, 오픈 소스 1인칭 조작 (manipulation) 데이터셋 및 툴체인 (arXiv 2607.14183 source); Wan-Streamer v0.3, "비디오 = 세계 + 이벤트 스트림"이라는 프레임을 가진 실시간 전이중 (full-duplex) 오디오-비디오 상호작용 모델 (arXiv 2607.15038 source); Instant NuRec, 자율 주행 장면 시뮬레이션을 가속화하는 NVIDIA의 피드포워드 (feed-forward) 3D 가우시안 재구성 (3D Gaussian reconstruction) (arXiv 2607.14203 source); Never Too Late for Force, VLA 사후 학습 (post-training)을 가속화하기 위해 반응형 힘 주입 (reactive force injection)을 사용하는 방법 (arXiv 2607.14236 source); KineFuse, 가려진 물체의 손 안 포즈 추적 (in-hand pose tracking)을 위한 운동학 인지 촉각 융합 (kinematics-aware tactile fusion) (arXiv 2607.14842 source); Active Real-World Factor-Based Evaluation, 일반 로봇 정책을 위한 능동적 실물 로봇 인자 분해 평가 (active real-robot factorized evaluation) (arXiv 2607.14439 source); Beyond Visual Grasping, 탐지부터 실행까지 아우르는 복합 파지 (grasping) 벤치마크 (arXiv 2607.14341 source).
오픈 소스 · 도구 · 벤치마크
· HY-World 2.0: Tencent Hunyuan의 오픈 소스 체계적 멀티모달 세계 모델 (multimodal world model)으로, 이해—합성—재구성의 4단계 파이프라인을 통해 실행되며 폐쇄형 상용 모델과 대등한 성능을 보인다고 주장함 source (WeChat, CN)
· MoWorld 3D: 중국 국가 AI 응용 시범 기지 (Embodied Intelligence)가 발표한 최초의 협업 세계 모델로, Huawei Cloud 컴퓨팅과 공동 개발됨 source (WeChat, CN)
· EmbodiedCLUE-World 2.0: 북경대학교(Peking University)의 PF-Cosmos가 주도하는 체화된 세계 모델(embodied world-model) 평가 벤치마크의 업데이트된 버전으로, 물리 법칙과 실행 가능한 조작 워크플로우(executable manipulation workflows)를 강조합니다. 출처 (WeChat, CN)
II. 금융 및 거래 (Financing & Deals)
Xynova (중국 정교한 손(dexterous-hand) 스타트업) | 시리즈 A+ | 5억 위안(RMB) | 유니콘 기업 등극 · 체화된 (embodied)
Meituan이 주도하고 NIO Capital, China Merchants Capital, 그리고 익명의 주요 인터넷 기업이 후속 투자를 진행했으며, 기존 전략적 투자자인 Xiaomi의 추가 지원이 있었습니다. Xynova는 휴머노이드 로봇을 위한 **정교한 손(dexterous hands)**을 제작합니다. 2024년 말에 설립된 이 회사는 2년도 채 되지 않아 총 약 15억 위안(RMB) 규모의 4차례 펀딩 라운드를 완료했습니다. 주력 제품인 Flex 2는 23자유도(degrees of freedom)를 갖춘 하이브리드 "건(tendon)-구동 + 직접 구동(direct-drive)" 아키텍처를 사용하며, 전체 손 무게는 400g 미만, 손가락 끝 힘은 20N을 초과합니다. 이 회사는 항저우에 5,400㎡ 규모의 공장을 건설했으며, 2026년 말까지 연간 정교한 손 10,000개 및 마이크로 선형 액추에이터(micro linear actuators) 200,000개의 생산 능력을 확보할 계획입니다. "손 하나를 만드는 것"에서 "만 개의 손을 안정적으로 복제하는 것"으로의 전환은 바로 Tier 1 공급업체가 되기 위한 경쟁의 임계점입니다. CATL, Xiaomi, JD, Li Auto, Meituan, NIO를 포함한 산업 자본이 이 "마지막 1센티미터"에 집중적인 베팅을 하고 있습니다. 출처: NE时代智能体 출처 (WeChat, CN)
MoSense (중국 촉각 센싱(tactile-sensing) 스타트업) | 엔젤 라운드 | 수천만 위안(RMB) · 체화된 (embodied)
Sequoia China, Hillhouse Ventures, 그리고 AgiBot이 공동 투자했습니다. MoSense는 로봇을 위한 전신 멀티모달 융합 촉각 (whole-body multimodal fusion tactile) 시스템을 구축합니다. 2026년 5월에 설립되었으며, 상하이에 본사를 두고 선전의 첸하이(Qianhai)에 R&D 센터를 두고 있습니다. 촉각 센싱 (tactile sensing)은 지능적 의사결정을 물리적 세계와 연결하는 "피부" 역할을 합니다. 일류 벤처 캐피털(VC)들이 업계 플레이어들과 힘을 합치면서, 이번 주에도 촉각/정교한 손 (tactile/dexterous-hand) 분야의 자본 열기가 지속되고 있습니다. 출처: 机器人前瞻 source (WeChat, CN)
Kunlunxing Robot | 등록 후 90일 만에 3차례 라운드 진행 | 누적 수백억 위안(RMB) · 체화된 (embodied) ⚠️ 단일 출처 주장
등록된 지 90일이 채 되지 않은 이 회사는 이미 세 차례의 연속적인 펀딩 라운드를 성사시켰으며, Hillhouse Capital, HighLight Capital, 그리고 Chinaco Ventures가 각각 참여했습니다. 회사는 현재 기업 가치가 10억 달러를 초과하여 유니콘(unicorn)이 되었다고 밝혔으며, 이는 체화된 지능 (embodied-intelligence) 산업에서 가장 빠른 행보입니다 (속도 및 누적 금액은 회사 공개 수치임). 출처: 有材 source (WeChat, CN)
Humanoid (영국) | 신규 라운드 | 1억 5,000만 달러 | 유니콘 · 휴머노이드 (humanoid)
영국의 휴머노이드 로보틱스 기업인 Humanoid가 1억 5,000만 달러 규모의 라운드를 마감하고 유니콘 지위에 도달하며, 유럽의 휴머노이드 경쟁에 또 다른 고가치 플레이어를 추가했습니다. 출처: 智东西 source
X Square Robot (自变量机器人, 중국 체화된 AI 스타트업) | 4차례 라운드 투자 유치 | 기업 가치 28억 달러 초과 · 체화된 (embodied)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기