FutureX · Physical AI Daily — Issue 64 (07/21)
요약
로보틱스 및 체화된 AI(Embodied AI) 분야의 최신 연구와 투자 동향을 다룹니다. Xiaomi의 VLA 모델 스케일링 성과와 칭화대학교의 Harness VLA 제안, 그리고 글로벌 로보틱스 시장의 투자 및 생산 현황을 요약합니다.
핵심 포인트
- Xiaomi-Robotics-1: 10만 시간의 실제 데이터를 통해 RoboCasa365 SOTA 달성
- Harness VLA: 동결된 VLA와 결정론적 컨트롤러를 결합한 효율적 제어 방식 제안
- Blackstone: 한국 Futronic에 6억 7,600만 달러 투자하며 로보틱스 부품 시장 공략
- 중국 로보틱스 강세: 전 세계 휴머노이드 모델의 약 절반 보유 및 높은 판매량 기록
오늘의 하이라이트
· Blackstone이 한국의 액추에이터(actuator) 제조사 Futronic에 약 6억 7,600만 달러를 투자하며 로보틱스 "컴포넌트 레이어 (components layer)"에 베팅함
· 중국 공업정보화부: 중국은 전 세계 총합의 약 절반에 해당하는 400개 이상의 모델을 보유한 휴머노이드 로봇을 보유하고 있음; 4족 보행 로봇(quadrupeds)이 전 세계 판매량의 거의 70%를 차지함
· Xiaomi가 Xiaomi-Robotics-1을 출시: 100,000시간의 실제 로봇 데이터를 통해 학습된 VLA 모델로, RoboCasa365의 SOTA(State-of-the-Art)를 57.6%로 끌어올림
· Yuequan Bionics (중국의 바이오닉 로보틱스 스타트업)가 수억 위안 규모의 Pre-A+ 라운드를 유치함; 바이오닉 데릭터스 핸드(bionic dexterous hands)는 주문량이 1억 위안을 초과하며 10,000대 생산 규모에 도달함
· UBTECH의 휴머노이드 로봇이 8월에 한국 자동차 부품 생산 라인에 POC(Proof of Concept) 시험을 위해 투입될 예정이며, 이는 체화된 AI (embodied AI)의 해외 진출이 공급망 통합으로 이동하고 있음을 나타냄
I. 연구 진행 상황
Xiaomi-Robotics-1: 100,000시간의 실제 로봇 데이터를 통한 VLA 스케일링 · vla
Xiaomi는 VLA "데이터 스케일링 (data scaling)"을 새로운 차원으로 끌어올렸습니다 — UMI 장치를 통해 수집된 100,000시간의 실제 로봇 조작 궤적(manipulation trajectories)을 사전 학습(pretraining)하였으며, 각 궤적에 장면 상태 변화에 대한 자연어 설명을 라벨링하는 자동화된 어노테이션 파이프라인(automated annotation pipeline)을 결합하여 동작 학습을 위한 미세한 컨디셔닝(fine-grained conditioning)을 제공합니다. 이 방법은 사전 학습(pretraining)과 사후 학습(post-training) 단계로 나뉘며, 명확한 스케일링 곡선을 보여줍니다: 더 큰 모델과 더 많은 데이터는 더 나은 즉각적인 실제 로봇 성능을 제공하며, 이 이점은 사후 학습으로 직접 전이됩니다. 이는 RoboCasa365에서 57.6%의 성공률(이전 최고치: 46.6%)로 새로운 SOTA를 기록했으며, RoboDojo에서는 평균 20.07을 기록했습니다(이전: 13.07). 코드와 가중치(weights)는 오픈 소스로 공개될 예정입니다.
Xiaomi Robotics Team · arXiv 2607.15330 source · Signal HF↑45
**Harness VLA: VLA를 재학습시키는 대신
칭화대학교(Tsinghua University)의 Yu Chao가 이끄는 팀은 다음과 같은 방안을 제안합니다: 모델의 규모를 계속 키우거나 더 많은 로봇 궤적(robot trajectories)을 쌓는 대신, 코딩 에이전트(coding-agent) 설계를 차용하여 VLA에 자체적인 하네스(harness)를 제공하는 것입니다. 동결된(frozen) VLA는 움켜쥐기(grasping)나 제약된 배치(constrained placement)와 같이 풍부한 접촉(rich-contact)이 필요한 동작만을 처리하는 원시 기능(primitive)으로 래핑(wrapped)되며, 접촉이 없는 이동(contact-free movement), 내비게이션(navigation), 그리고 놓기(release)는 결정론적 컨트롤러(deterministic controllers)가 처리합니다. 그런 다음 플래너(planner)가 언제 VLA를 호출할지, 호출하기 전에 어떻게 사전 위치를 잡을지(pre-position), 그리고 실패 후 어떻게 재시도할지를 결정합니다. 동일한 동결된 VLA와 변경되지 않은 파라미터(parameters)를 사용했음에도 불구하고, 단순히 조직화 및 호출 방식을 변경하는 것만으로 LIBERO-Pro 일반화 벤치마크에서의 성공률을 50.0%에서 82.4%로 끌어올렸습니다 (동일 기간 Nvidia의 Cap-X가 18.2%에 불과했던 것과 비교됨).
Yu Chao의 팀 (칭화대학교) · arXiv 2607.08448 source · 분석: Embodied AI Insider source (WeChat, CN)
Orbis 2: 주행 월드 모델을 "거친 구조 + 세밀한 프레임"으로 분리 · world-model
현재의 월드 모델(world models)은 대부분 단일 추상화 수준에서 프레임 수준의 충실도(fidelity)만을 추구하며, 공간적 및 의미론적 추론(spatial and semantic reasoning)이 부족합니다. Orbis 2는 미래 예측을 두 가지 수준으로 분리합니다: 상위 수준의 예측기(high-level predictor)는 긴 시간 지평(long horizons)에 걸쳐 거친 입도의 장면 구조(coarse-grained scene structure)를 예측하고, 하위 수준의 생성기(low-level generator)는 해당 구조를 기반으로 상세한 프레임을 생성하여 충실도와 추론 사이의 균형을 맞춥니다. 또한
Mittal et al. (University of Freiburg) · arXiv 2607.15898 source
EmArm: 로봇 팔에 "전신 인간 유사 촉각" 부여, Nature Sensors 게재 · 인지 (perception)
연구진은 단단한 골격과 유연한 촉각 피부를 결합하여, 실시간 물리적 적응을 가능하게 하는 전신 인간 유사 촉각 인지 기능을 갖춘 로봇 팔인 EmArm을 구축했습니다. 이를 통해 역동적이고 비정형적인 환경에서 궤적을 안전하게 재계획하는 동시에, 풍부한 접촉 조작 (rich-contact manipulation)을 안정적으로 수행할 수 있습니다. 손가락 끝에 국한된 촉각 감지 (tactile sensing)와 비교하여, 이 기술은 "감지 영역 (sensing zone)"을 손에서 팔 전체로 확장하며, 인간의 촉각에 더 가까운 접촉-상호작용 (contact-interaction) 접근 방식을 제시합니다.
Tang et al. · Nature Sensors source
5 Hz에서 생각하고, 20 Hz에서 행동하기: LLM 기반 주행을 제어 주기에 맞추기 · 자율성 (autonomy)
대형 모델 (large models)이 엔드 투 엔드 (end-to-end) 주행에 도입될 때, 추론 지연 시간 (inference latency)은 차량에 필요한 제어 주기에 항상 뒤처져 왔습니다. 이로 인해 기존 방식들은 모델을 매 두 번째 사이클마다 호출하고 그 사이에는 이전 명령을 재사용해야 했으며, 결과적으로 시간의 절반 동안은 최신 관측값을 효과적으로 무시하게 되었습니다. 본 논문은 비동기식 Fast-Slow 아키텍처 (asynchronous fast-slow architecture)를 제안합니다. 즉, 느린 채널 (slow channel)은 5 Hz로 "생각"하고 빠른 채널 (fast channel)은 20 Hz로 "행동"하여, 모든 제어 단계에서 최신 프레임을 사용할 수 있도록 합니다. 오픈 루프 (open-loop) 웨이포인트 오차 (waypoint error)는 백본 (backbone)의 내장된 액션 헤드 (action head) 대비 거의 4분의 1 수준으로 감소했으며, 히스토리 길이에 관계없이 스텝당 모델 오버헤드는 32 ms로 단일 소비자급 GPU에서 실행 가능합니다.
Li et al. · arXiv 2607.15621 source
Handroid: "민첩한 손"과 "휴머노이드"를 하나의 데스크톱 로봇으로 결합 · 조작 (manipulation)
민첩한 손 (dexterous hands)과 휴머노이드 (humanoids)는 일반적으로 별도로 개발되어 왔습니다. 전자는 물체 규모의 풍부한 접촉 조작 (rich-contact manipulation)을 위해, 후자는 이동 (locomotion) 및 전신 상호작용 (whole-body interaction)을 위해 개발되었습니다. Handroid는 이 두 가지를 하나의 재구성 가능한 데스크톱 규모의 이중 형태 (dual-morphology) 로봇으로 결합하여, 손 원격 조작 (hand teleoperation), 민첩한 파지 (dexterous grasping), 인핸드 조작 (in-hand manipulation), 그리고 휴머노이드 보행 생성 (humanoid gait generation)을 균일하게 지원합니다. 이를 통해 하나의 플랫폼에서 "손 × 전신" 협응 (hand × whole-body coordination)을 연구할 수 있는 저비용 테스트베드를 제공합니다.
Li et al. · arXiv 2607.16187 source
오늘의 다른 논문들: AC-VLA는 구성적 학습 (compositional learning)을 사용하여 분포 외 (out-of-distribution) 동작 실행을 강화하며, 구성적 일반화 (compositional generalization) 작업에서 약 28%의 절대적 향상을 달성했습니다 (arXiv 2607.15714 source); IMBench는 인지(perception)—물리적 추론(physical reasoning)—동작(action)—반복적 실행(iterative execution)을 아우르는 "직관적 조작 (intuitive manipulation)" 벤치마크를 제안합니다 (arXiv 2607.15641 source); VTAP Gripper는 시각-촉각 능동 손바닥 (visuo-tactile active palm)과 재구성 가능한 손가락을 사용하여 인핸드 조작 (in-hand manipulation)을 수행합니다 (arXiv 2607.15448 source); MotionForesight는 비디오 모델을 적응시켜 단안 비디오 (monocular video)로부터 미래의 3D 장면 흐름 (3D scene flow)을 예측합니다 (arXiv 2607.16192 source); VTLoc은 촉각 접촉점 위치 추정 (tactile contact-point localization)을 위해 3D 포인트 클라우드 (3D point clouds)를 사용합니다 (arXiv 2607.16146 source); OptiTac은 생체 모방 촉각 피부 (bionic tactile skin)를 위해 광섬유를 사용하여 "인공 신경 (artificial nerves)"를 모방합니다 (arXiv 2607.15746 source).
오픈 소스 · 도구 · 벤치마크
· Kuavo (X Humanoid): 실제 산업 시나리오에서 로봇의 안정적인 배포를 목표로 하는, 이른바 "세계 최초"의 대규모 교차 체형 (cross-embodiment) 데이터셋 및 시뮬레이션 엔진을 출시했습니다 source
· DexForce: 정교한 조작 데이터(dexterous manipulation data)를 통합하여 Aligned DexWorld 데이터셋을 오픈소스로 공개했습니다 source
· Kunlun Wanwei (중국 AI 기업) Matrix Game-3.5: 게임 월드 모델을 오픈소스로 공개했으며, '비디오 생성'에서 '상호작용하는 세계(interactive world)'로 이동하며 실시간 응답성에 초점을 맞췄습니다 source (WeChat, CN)
II. 투자 및 계약 (Funding & Deals)
Futronic (한국) | 지배 지분 인수 | 약 6억 7,600만 달러 | 기업 가치 약 1조 원 · 하드웨어
Blackstone의 사모펀드가 고정밀 액추에이터 및 모션 제어 시스템을 제조하는 한국 기업 Futronic에 투자하기 위한 최종 계약을 체결했습니다. 창업자 고진호가 회장 겸 CEO로 남게 되며, 이는 분사(spin-off)가 아닌 확장된 역량에 대한 베팅입니다. 1993년 부산에서 설립된 Futronic은 자동차 및 산업용 로봇에 액추에이터와 모터를 공급하며, 약 225명의 직원을 고용하고 있으며, 모션 하드웨어 분야에서 30년간의 경험을 가진 기업입니다. Blackstone은 전면적인 휴머노이드 브랜드에 투자하기보다는, 로봇의
Changfa, Huakong, Huaxia, Guoli Minsheng, Xingke Venture Capital을 포함한 투자자들이 공동 투자하였으며, 기존 주주인 Zhongguancun Qihang이 후속 투자를 진행하여 회사의 네 번째 펀딩 라운드를 기록했습니다. Yuequan은 중국과학원(Chinese Academy of Sciences)의 원사(Academician)인 Ren Lüquan과 맨체스터 대학교(University of Manchester)의 교수인 Ren Lei가 설립하였으며, "생체 모방 인장-압축 구조 (bionic tension-compression structure)" 접근 방식을 추구합니다. 자체 개발한 자기 수집 구동 인공 근육 (magnetic-collector-drive artificial muscles)은 구동 (actuation), 속도 변화 (speed variation), 전달 (transmission)을 하나의 단위로 통합하여, 기존의 "모터 (motor) + 감속기 (reducer) + 강성 관절 (rigid joint)" 방식을 넘어 인간의 골-근-건 (bone-muscle-tendon) 구조를 모방하고자 합니다. 이 회사의 주력 제품인 Y-Hand M1 데릭터스 핸드 (dexterous hand)는 38자유도 (38 degrees of freedom), 전손 촉각 감지 (full-hand tactile sensing), 28.7kg의 악력, 그리고 단일 손가락 반복 위치 정밀도 0.04mm를 갖추고 있습니다. 회사 측은 자사의 데릭터스 핸드가 10,000대 규모의 생산 단계에 도달했으며, 누적 주문액은 1억 위안(RMB)을 초과했다고 밝혔습니다. 출처: 36Kr source (WeChat, CN) | Jingguan Ganzhi source (WeChat, CN)
Dobot (중국 협동 로봇 제조사) | ChiNext IPO 심의를 앞두고 공동 창업자가 주장하는 지분 분쟁 · 산업 ⚠️ 고발하는 공동 창업자의 설명에 따른 분쟁
협동 로봇 (Collaborative robot) 제조사 Dobot은 ChiNext IPO 상장 심의를 앞두고 공동 창업자가 주장하는 지분 분쟁에 직면해 있으며, 최근 회사가 진행한 급격한 펀딩 라운드 또한 정밀 조사를 받고 있습니다. 반면, 회사는 상반기 매출과 매출 총이익이 거의 두 배로 증가했으며, 협동 로봇 사업이 Embodied AI (체화된 인공지능) 상용화 추진을 뒷받침하는 "캐시카우 (cash cow)"가 되었다고 밝혔습니다. 출처: Huxiu source
TÜV (Tuosida, 중국 산업용 로봇 제조사) 통합 산업용 로봇에 집중하며 홍콩 IPO 재신청 · 산업
통합 산업용 로봇 및 자체 R&D를 핵심 사업으로 하는 Tuosida는 홍콩 상장을 위해 두 번째 신청을 완료했으며, 이는 현재의 상장 윈도우 기간 동안 홍콩 상장을 서두르는 중국 산업용 로봇 기업들의 최근 흐름을 이어가는 것입니다. 출처: 10jqka source
III. 상용화 및 배포 (Commercialization & Deployment)
UBTECH의 Cruzr Y1 및 Walker S2, 한국 자동차 부품 생산 라인 투입 예정 · 휴머노이드 (humanoid) ⚠️ 아직 POC (개념 증명) 검증 단계
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기