FutureX · Physical AI Daily — Issue 81 (08/07)
요약
Unitree Robotics의 IPO 소식과 DeepSeek의 전략적 투자, Hadrian의 대규모 투자 유치 등 로봇 및 AI 산업의 주요 비즈니스 동향을 다룹니다. 또한 중국의 휴머노이드 특허 점유율과 한국의 로봇 배치 계획 등 글로벌 시장의 흐름을 요약합니다.
핵심 포인트
- Unitree Robotics IPO 및 DeepSeek의 전략적 투자 규모 공개
- Hadrian의 14억 달러 조달로 기업 가치 4배 급증
- 중국이 글로벌 휴머노이드 신체 구조 특허의 73% 점유
- 한국의 주요 산업용 AI 로봇 연간 1,000대 배치 계획
오늘의 하이라이트
· Unitree Robotics는 IPO 가격을 주당 RMB 150.80으로 책정했으며, 이는 발행일 기준 시가총액이 RMB 609.93억 위안임을 의미합니다.
· DeepSeek는 Unitree의 IPO에서 36개월 보호예수(lock-up) 조건으로 RMB 1억 4,000만 위안 이상의 전략적 배정(strategic placement allocation)을 받았습니다.
· Hadrian은 약 14억 달러를 조달했으며, 기업 가치는 7개월 만에 79억 달러로 4배 급증했습니다.
· LexisNexis의 첫 휴머노이드 특허 보고서: 중국이 신체 구조(body-structure) 특허의 **73%**를 보유하고 있습니다.
· 한국은 10대 주요 산업을 위한 전용 휴머노이드를 구축하며, 연간 1,000대의 AI 로봇을 배치할 계획입니다.
· GigaDevice(중국 칩 제조사)는 두 종류의 로봇용 MCU를 연달아 출시했으며, 상반기에 로봇 애플리케이션용으로 약 300만 개를 출하했습니다.
· Nucleus가 스텔스 모드에서 벗어났습니다: 독일 공장에 90일 이내에 휴머노이드 로봇을 배치했습니다.
· DreamWAM은 실제 로봇의 미학습 시나리오(unseen-scenario) 성공률을 55.6%에서 **74.4%**로 끌어올렸습니다.
I. 연구 진행 상황
DreamWAM: 월드 액션 모델(World Action Models)은 단순히 RGB만을 예측해서는 안 된다 · world-model
월드 액션 모델(World Action Models, 환경이 어떻게 진화할지 예측함으로써 액션 표현(action representations)을 학습하는 모델)은 일반적으로 RGB 픽셀 공간에서 미래를 예측합니다. 이 과정에서 작업 관련 상태 변화가 질감, 조명, 배경 및 시점 노이즈와 얽히게 됩니다. 반면 DreamWAM은 외형(appearance), 움직임(motion), 기하학(geometry), 의미론(semantics)이라는 네 가지 상호 보완적인 미래 표현을 공동 학습합니다. 이 보조 분기(auxiliary branches)들은 추론(inference) 시에는 모두 꺼지므로, 배포는 순수하게 RGB 기반으로 유지됩니다. 이러한 이점은 주로 분포 외(out-of-distribution) 상황에서 나타납니다. LIBERO-Plus 섭동(perturbations) 하에서 성공률이 51.36%에서 63.44%로 상승했으며, 미학습 조명, 배경 및 물체 배치를 마주한 실제 로봇에서는 평균 성공률이 **74.4%**에 달했습니다. 이는 동일 그룹의 Fast-WAM-Joint 베이스라인의 55.6%와 대조적입니다. 코드와 모델은 오픈 소스로 공개되었습니다.
Shanglin Yuan 외 (Huazhong University of Science and Technology, hustvl) · arXiv 2608.04996 source
MobileWAM: Moving World Action Models from Tabletops to Mobile Manipulation · world-model
기존의 WAM(World Action Models)은 거의 전적으로 테이블탑(tabletop) 환경의 pick-and-place 작업에 국한되어 있었습니다. 반면, 모바일 조작(mobile manipulation)은 장면 규모의 역동적인 변화 속에서 이동(locomotion)과 전신 조작(whole-body manipulation)을 동시에 수행할 것을 요구하며, 이는 여전히 역학 정보가 없는(dynamics-free) 비전 인코더와 수동으로 작성된 조정 로직(hand-written coordination logic)을 통해 처리되는 경우가 많습니다. MobileWAM은 Mixture-of-Transformers를 사용하여 사전 학습된 비디오 확산 트랜스포머(video diffusion transformer)와 경량 액션 전문가(action expert) 레이어를 레이어별로 공동 주의(jointly attend)하는 동시에, 피드포워드(feed-forward) 레이어를 공유, 이동, 조작 전문가로 분할하고 이를 액션 의도(action intent)에 따라 소프트 라우팅(softly routed)합니다. 학습 단계의 Chain-of-Foresight 메커니즘은 중간 표현(intermediate representations)이 미래의 잠재 청크(latent chunks)를 점진적으로 예측하도록 합니다. 배포 시에는 전체 예측 체인(foresight chain)과 비디오 생성을 폐기하여 정책 수준의 오버헤드(policy-level overhead)만 남깁니다. 이 모델은 ManiSkill-HAB에서 기존의 모바일 조작 정책보다 뛰어난 성능을 보였으며, 실제 ARX Lift2 로봇에서 미세 조정(fine-tuning) 및 검증되었습니다.
Zehua Fan et al. · arXiv 2608.04657 source
BridgeVLA++: Giving 3D VLA a Spatiotemporal Memory · vla
기존의 3D VLA 모델은 데이터 집약적이며, 분포 변화(distribution shift) 상황에서 일반화 능력이 떨어지고, 과거 관측에 대한 명시적인 메모리가 부족합니다. 이로 인해 메모리에 의존하는 작업(예: 물체가 가려진 후 어디에 놓였는지 회상하는 작업)은 수행하기가 매우 어렵습니다. BridgeVLA의 기존 다중 뷰 투영(multi-view projection) 및 히트맵 중간 표현(heatmap intermediate representation)을 기반으로 구축된 BridgeVLA++는 통합된 시공간 메모리(spatiotemporal memory) 모듈을 추가하여, 기존 버전의 데이터 효율성과 일반화 능력을 희생하지 않으면서도 두 가지 메모리 의존적 조작 벤치마크에서 SOTA(State-of-the-Art)를 달성했습니다. 또한 양손(bimanual) 설정 및 추가적인 실제 로봇 플랫폼에서 검증되었습니다. 당일 HF trending score 7↑.
Peiyan Li et al. · arXiv 2608.05042 source
SiMDex: 더 많은 인간 1인칭 시점(Egocentric) 비디오가 항상 더 나은 것은 아니다 — 선택이 중요하다 · manipulation
로봇 학습을 위해 인간의 1인칭 시점(Egocentric) 비디오를 확장하는 것은 이제 상식처럼 여겨지지만, 그 데이터 중 어떤 부분이 실제로 정교한 조작(Dexterous manipulation)에 도움이 되는지는 여전히 불분명합니다. SiMDex는 VLA 사후 학습(Post-training)을 위한 인간 데이터 선택을 추천 문제로 취급하며, retrieve-rank-rerank 파이프라인을 사용하여 약 3,200만 개의 1인칭 시점 샘플 풀에서 각 로봇 시연(Demonstration)과 유사한 클립을 선택합니다. 이 과정은 VLA 아키텍처를 수정하지 않고 완전히 형태 불가지론적(Embodiment-agnostic) 액션 공간에서 작동합니다. 무작위로 샘플링된 동일한 양의 데이터를 사용하는 강력한 베이스라인과 비교했을 때, SiMDex는 샘플 풀의 5% 미만인 약 149만 개의 클립만을 사용하면서도 전체 성공률을 47.7%에서 **61.1%**로 높였습니다.
Nie Lin et al. · arXiv 2608.04196 source
Mind-VLA: 공간 정렬(Spatial Alignment)은 지시어가 명시하는 객체를 대상으로 해야 한다 · vla
표현(Representations)을 3D 장면 기하학(Geometry)과 정렬하는 것은 VLA 일반화(Generalization)를 개선하는 일반적인 방법이지만, 이러한 방식은 전체 장면을 균일하게 정렬하여 언어 지시어(Language instruction)가 명시하는 대상 객체의 정확한 기하학적 구조를 간과합니다. 이는 미세 조작(Fine manipulation)이나 대상이 가려졌을 때 실패를 초래합니다. Mind-VLA는 먼저 지시어에 명시된 대상을 국소화(Localize)한 다음, 해당 대상의 세 가지 뷰(View)에서 얻은 VAE 및 VGGT 특징(Features)과 VLA의 잠재 표현(Latent representation)을 정렬합니다. 3억 4,500만(345M) 개의 파라미터를 가진 컴팩트한 백본(Backbone)을 사용하여 LIBERO에서 93.9%, CALVIN에서 4.47을 달성했습니다. 실제 로봇의 폐쇄(Occlusion) 작업에서는 평균 성공률이 54%에 달하며, 이는 가장 우수한 지시어 불가지론적(Instruction-agnostic) 비교 방법보다 32퍼센트 포인트 높은 수치입니다.
Xingyu Ding et al. · arXiv 2608.04633 source
Tactus: 가장 저렴한 압력 어레이(Pressure Arrays)로부터의 오픈 보캐블러리(Open-Vocabulary) 인식 · perception
촉각 표현 학습 (Tactile representation learning)은 수년간 젤 변형을 촬영하는 광학 센서에 집중되어 왔으나, 가장 저렴하고 대량 생산되는 센서 유형인 저항성 압력 어레이 (Resistive pressure arrays)는 상대적으로 소외되어 왔습니다. Tactus는 오직 압력 데이터만을 사용하여 텍스트 질의에 답하며, STAG 벤치마크 (27개 객체 카테고리)에서 0.771±0.062 (4회 실행)의 Top-1 정확도를 달성했습니다. 이는 분류 헤드 (Classification head)를 학습시키지 않고도 동일한 데이터셋에서 지도 학습 기반의 폐쇄 집합 CNN (Supervised closed-set CNN)이 달성한 0.76과 대등하거나 최선의 경우 이를 능가하는 수치입니다. 이 방식은 철저히 소규모 데이터 (Small-data) 기반입니다. 마스크드 오토인코더 (Masked-autoencoder) 사전 학습을 위해 187개의 학습 기록과 144,000개의 라벨이 없는 동일 센서 프레임을 사용했으며, 센서에 내장된 보정 아핀 변환 (Calibration affine transform)이 모든 아키텍처 변경 사항을 합친 것보다 더 큰 이득을 제공했습니다. 또한 논문은 실패 사례도 보고합니다. 센서 간 사전 학습 풀링 (Cross-sensor pretraining pooling)은 이득이 없었으며, 시각 (Vision)과의 공동 학습은 실제로 촉각 성능을 저하시켰습니다. 가중치와 코드는 오픈 소스로 공개되었습니다.
Abdul Basit Tonmoy 외 · arXiv 2608.04043 source
Deltoris: 알고리즘-하드웨어 공동 설계(Algorithm-Hardware Co-Design)를 통한 확산 기반 VLA의 실시간 추론 · vla
확산 기반 VLA (Diffusion-based VLAs)는 최고의 행동 품질과 일반화 성능을 제공하지만, 50~200 Hz의 제어 주파수를 요구하기 때문에 엣지 디바이스 (Edge devices)에 엄격한 지연 시간 및 에너지 제약을 부과합니다. Deltoris는 인접한 입력 간의 시간적 유사성을 활용하여, 연속된 프레임 간의 차이만을 계산함으로써 중복되는 비트 수준 연산을 제거합니다. 그 후 추측 추론 (Speculative inference)을 통해 여러 제어 단계에 걸쳐 데이터 로딩을 분할 amortize하며, 1D 시스톨릭 비트 직렬 PE 어레이 (1D systolic bit-serial PE array)를 사용하는 전용 가속기와 결합됩니다. 이를 통해 정확도는 실질적으로 유지하면서 모바일 GPU 대비 최대 34.2배의 속도 향상을 제공합니다.
Zheng Liu 외 · arXiv 2608.04428 source
PRIMAL3: 다중 에이전트 경로 탐색(Multi-Agent Pathfinding)을 도시 규모인 100,000명의 에이전트로 확장 · autonomy
다중 에이전트 경로 탐색(Multi-Agent Pathfinding) 실패는 병목 지점(bottlenecks), 막다른 길(dead ends), 반복적인 충돌이 발생하는 위치와 같이 결정적인 조정(coordination)이 필수적인 위상학적 병목 지점(topological choke points)에 집중됩니다. PRIMAL3는 단절점(cut vertices), 막다른 지역(dead-end regions), 최단 경로 거리(shortest-path distances), 차단 추정치(blockage estimates)로부터 특징을 구축하며, 별도의 그래프를 통해 동일 방향 추종(same-direction following)과 반대 방향 충돌(opposite-direction conflict)을 모델링합니다. 학습 과정에서 정책 엔트로피(policy entropy)가 불확실한 에이전트를 식별하면, LaCAM3가 트리거에 따라 개입하여 라벨 평활화된 모방 대상(label-smoothed imitation targets)을 제공하며, 추론(inference) 시에는 더 이상 LaCAM3가 필요하지 않습니다. 이 접근 방식은 100,000명의 에이전트 규모의 도시 수준 배포로 확장 가능하며, 실제 로봇 시스템에서 타당성 테스트를 완료했습니다.
Chengyang He et al. · arXiv 2608.04905 source
Talk2Sensors: 4D mmWave 레이더를 포함한 최초의 3D 시각적 접지(Visual Grounding) 데이터셋 · 인지 (perception)
3D 시각적 접지(3D visual grounding, 언어 설명을 기반으로 3D 공간 내의 대상을 식별하는 것)는 주로 실내 환경에 국한되어 왔습니다. 실외 인지(outdoor perception)에서는 카메라, LiDAR, 4D 레이더가 각각 상호 보완적인 질감(texture), 기하학적 구조(geometry), 운동 특성(motion properties)을 포착함에도 불구하고, 실외 확장 연구는 대부분 단안 이미지(monocular images)에만 의존해 왔습니다. Talk2Sensors는 카메라 + LiDAR + 4D 레이더를 기반으로 구축된 최초의 멀티 센서 3DVG 데이터셋으로, 8,682개의 언어 지시문과 20,558개의 참조 대상을 포함하며, 프롬프트는 각 센서에 특화된 물리적 단서(physical cues)에 의도적으로 정렬되어 있습니다. 함께 제공되는 TSFormer는 쿼리 의미론(query semantics)에 따라 외형(appearance), 기하학(geometry), 운동(motion) 단서를 동적으로 라우팅하며, 이 데이터셋에서 가장 강력한 베이스라인(baseline)보다 8.05 mAP 높은 성능을 기록했습니다.
Runwei Guan et al. · arXiv 2608.04568 source
오늘의 다른 논문들: Faster-WAM, 미래 표현(future representations)을 한 번만 계산하고 액션 디노이징(action denoising) 과정 전반에 걸쳐 희소하게 재사용하는 방법 (arXiv 2608.04404 source); SAFECAST, 대조 세트 섭동(contrastive-set perturbations)을 통해 VLA 잠재 상태 리스크 프로브(latent-state risk probes)의 학습 및 보정(calibration)을 개선하는 방법 (arXiv 2608.04246 source); GUARD, 사전 학습된 정책(pretrained policy)을 수정하지 않고, 어블레이션(ablation)을 통해 확산 VLA(diffusion VLAs)의 시각-언어 접지(visual-language grounding) 정도를 측정하여 실패를 감지하는 방법 (arXiv 2608.04510 source); CofactVLA, 반사실적 개입(counterfactual intervention)을 사용하여 VLA의 "시각이 언어를 압도하는(vision overriding language)" 혼란 변수(confound)를 해결하는 방법 (arXiv 2608.04396 source); Retrieve in Time, Correct in Frequency, 매개변수 업데이트나 반복적인 추론이 필요 없는 학습이 필요 없는 테스트 시간 보정(test-time correction) 프레임워크 (arXiv 2608.04527 source); RORA, 단일 정적 객체 비디오로부터 관절형 시뮬레이션 자산(articulated simulation assets)을 엔드투엔드(end-to-end)로 재구성하는 방법 (arXiv 2608.04842 source); SpikingNav, 더 적은 매개변수 수와 단계별 연산량을 가지며 시각적 손상(visual corruption) 상황에서 더 견고한 임바디드 내비게이션(embodied navigation)을 위한 스파이킹 신경망 정책 (arXiv 2608.05078 source); EventKitchen, 주방 내 인간 활동에 대한 대규모 스테레오 이벤트 카메라(stereo event-camera) 벤치마크 (arXiv 2608.04865 source); SSC, 장기 조작 시연(long-horizon manipulation demonstration)의 하위 작업 주석을 자동으로 검증 가능한 상태 전이 체인(state-transition chains)으로 변환하는 방법 (arXiv 2608.04425 source).
오픈 소스 · 도구 · 벤치마크
· MAGI-2 Preview: Sand.ai가 총 파라미터 수는 약 114B에 달하지만 순전파(forward pass) 시에는 약 6B만 활성화되는 MoE (Mixture-of-Experts) 통합 오디오-비디오 생성 모델을 오픈 소스로 공개했습니다. 가중치(weights), 코드, 학습 시스템을 함께 배포하며, Artificial Analysis의 text-to-video 리더보드에서 세계 6위를 기록했습니다. 비디오 생성 백본(backbone)은 오늘날 세계 행동 모델(world action models)을 뒷받침하는 핵심 기반입니다 source
· Orbbec (중국 3D 비전 기업) 로봇 프리(Robot-Free) 데이터 수집 플랫폼: 일본에서 열린 ROSCon JP 2026에서 데뷔하였으며, EGO, UMI, WristCam 라인업을 통해 자기중심적 캡처(egocentric capture), 손-물체 상호작용(hand-object interaction), 근접 손목 캡처(near-field wrist capture)를 지원합니다. 시연된 Dual-Ego 프로토타입은 듀얼 2-메가픽셀 어안 카메라(fisheye cameras), 1ms 미만의 동기화 정밀도, 최대 1000Hz의 6축 IMU를 사용하며 총 무게는 200g입니다 source
II. Funding and Deals
Unitree Robotics (중국 휴머노이드 제조사) | STAR Market IPO 가격 결정 | 주당 RMB 150.80 | 발행일 기준 시가총액 RMB 609.93억 · humanoid
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기