FutureX · Physical AI Daily — Issue 75 (08/01)
요약
Google의 Gemini Robotics 2와 Dexmal의 ACE-Data-0 데이터셋 공개 등 로보틱스 AI 분야의 최신 연구를 다룹니다. 특히 멀티모달 데이터를 통합한 대규모 데이터셋과 VLM 및 월드 모델을 결합한 새로운 계획 방식이 핵심입니다.
핵심 포인트
- Google Gemini Robotics 2: 단일 모델로 이족 보행 및 손 제어 통합
- ACE-Data-0: 6가지 모달리티를 동기화한 1,700만 프레임 규모의 오픈소스 데이터셋
- World Action Planner: VLM의 계획과 월드 모델의 검증을 결합한 새로운 접근법
- 로봇 산업 동향: 중국산 휴머노이드 점유율 확대 및 주요 기업의 투자/IPO 현황
오늘의 주요 뉴스
· Google의 Gemini Robotics 2가 단일 모델로 이족 보행 (bipedal locomotion)부터 22-DOF 오손가락 손 제어까지 모든 것을 최초로 제어합니다.
· 중국 국가발전개혁위원회: 전 세계적으로 판매되는 휴머노이드 및 4족 보행 로봇 10대 중 8대는 중국산입니다.
· LimX Dynamics가 기업 공개 전 (Pre-IPO) 투자 라운드를 약 2억 달러 규모로 마감하며, 기업 가치 (post-money valuation) 150억 위안을 기록했습니다.
· Unitree의 IPO 투자 설명서가 FCC에 대한 답변을 내놓았습니다: 현재 판매 중인 모델은 이미 인증을 받았으나, 신규 모델은 미국 내 판매가 불가능할 수 있습니다.
· Dexmal (중국 Embodied-data 스타트업)이 실제 가정 환경의 멀티모달 (multimodal) 데이터인 1,700만 프레임 규모의 ACE-Data-0를 오픈 소스로 공개했습니다.
I. 연구 진행 상황
ACE-Data-0: 두 채의 실제 주택을 동기화된 녹화 스튜디오로 변모시켜, 한 번의 과정으로 6가지 모달리티 (modalities)를 모두 캡처함 · 벤치마크 (benchmark)
Embodied data 분야의 고질적인 문제는 파편화입니다. 1인칭 시점 (first-person view), 전신 움직임 (full-body motion), 손 조작 (hand manipulation), 객체 상태 (object state), 소리 (sound), 그리고 촉각 (touch)이 서로 다른 데이터셋에 흩어져 있어, 인지-행동 루프 (perception-action loop)가 전체 그림의 절반도 보지 못하는 경우가 많습니다. ACE 캡처 엔진은 실제 주택을 공간적으로 보정되고 시간적으로 동기화된 녹화 장소로 변모시켜, 테이블탑 규모의 손-객체 상호작용 (hand-object interaction)과 실내 규모의 전신 움직임을 해결하며, 6가지 모달리티를 하나의 단일 다감각 스트림 (multisensory stream)으로 함께 기록합니다. 결과물인 데이터셋은 200개의 작업 카테고리, 150시간, 1,700만 프레임에 달하며, 50명의 참가자가 생성한 75,000개의 상호작용 에피소드를 포함합니다. 단계별 지침이 아닌 목표 수준 (goal-level)의 지침을 사용하여 자연스러운 행동 변화를 보존했습니다. 함께 제공된 계층적 벤치마크 (tiered benchmark)에 따르면, 기존의 SOTA (State-of-the-art) 방식들은 접촉 (contact), 폐쇄 (occlusion), 자기 움직임 (self-motion), 그리고 장기 추론 (long-horizon reasoning) 측면에서 여전히 명확한 격차를 보입니다. 이 논문은 오늘 발표된 논문 중 커뮤니티 신호 (community signal)에서 가장 높은 순위를 기록했으며, HF 트렌딩 점수는 **33↑**를 기록했습니다.
Yukang Cao 외 · arXiv 2607.28625 source · 오픈 소스 제공: Dexmal (중국 Embodied-data 스타트업)
World Action Planner: VLM이 계획을 제안하고 월드 모델(World Model)이 이를 심판하게 하여 VLA를 능가하다 · world-model
지난 1년 동안 지배적이었던 해답은 계획(Planning)과 제어(Control)를 VLA 또는 WAM에 엔드투엔드(End-to-end)로 함께 밀어 넣는 것이었습니다. 이 논문은 그 반대의 길을 택합니다. VLM의 추론 능력을 사용하여 먼저 초기 행동 계획을 제안한 다음, 멀티태스크(Multi-task), 포즈 및 이미지 조건부(Pose-and-image-conditioned) 월드 모델 내부에서 이를 앞으로
대규모 모방 학습 (Large-scale imitation learning)은 여러 로봇 구현체 (embodiments)에 걸쳐 데이터를 통합하는 것에 의존하지만, 진정한 교차 구현체 전이 (cross-embodiment transfer)는 여전히 어려운 과제로 남아 있습니다. 본 연구는 VLA (Vision-Language-Action models)에서 객체 박스 (object boxes), 언어화된 행동 (verbalized actions), 말단 장치 궤적 (end-effector trajectories)과 같은 "행동 정렬 표현 (behavior-aligned representations)"을 체계적으로 비교하였으며, **말단 장치 궤적 (end-effector trajectories)**이 전이에 특히 효과적이라는 점을 발견했습니다. 이러한 이점은 사전 데이터셋의 규모가 커질수록 증가하며, 행동 정보가 없는 데이터 (action-free data)도 흡수할 수 있습니다. 시뮬레이션-실제 (sim-to-real) 교차 구현체 전이에서, 시뮬레이션 데이터로 사전 학습된 실제 로봇 정책 (real-robot policies)은 작업 완료율에서 **28%**의 향상을 보여주었습니다.
Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale · arXiv 2607.27549 source
FasTac: 곡선형 손가락 끝을 제작하기 위해 다중 스펙트럼 광학 스테레오 및 힘 추정을 FPGA에 통합하기 · 인지 (perception)
숙련된 조작 (dexterous manipulation)을 위해 필요한 곡선형 촉각 손가락 끝은 미세한 접촉 기하학을 분해하고, 법선 하중 (normal loads)과 전단 하중 (shear loads)을 구분하며, 과도 신호 (transient signals)를 동시에 포착해야 합니다. 기존의 곡선형 비전 기반 촉각 센서들은 이 세 가지를 소형 폼 팩터 (form factor)로 제공하는 데 어려움을 겪고 있습니다. FasTac은 다중 스펙트럼 광학 스테레오 (multispectral photometric stereo), 동적 합성곱 힘 추정 (dynamic convolutional force estimation), 그리고 FPGA 하드웨어 가속을 통합하여, 고속 3D 형상 재구성 및 3축 힘 추정을 동시에 제공합니다. 이는 숙련된 손 (dexterous hands)의 상위 단계에서 그동안 부족했던 "제조 가능한 폼 팩터" 장치 연구의 핵심입니다.
Xiaofan Lu et al. · arXiv 2607.28416 source
UniCross: 파지, 전이, 인핸드 회전 및 인핸드 이동은 사실 동일한 문제이다 · 조작 (manipulation)
손-물체 상대 운동 (hand-object relative motion) 관점에서 볼 때, 안정적인 파지 (grip)를 요구하는 숙련된 조작 (dexterous manipulation)은 인간의 손이 자유롭게 조합하는 네 가지 기본 기술인 파지 (grasping), 재배치 (relocation), 인핸드 회전 (in-hand rotation), 인핸드 이동 (in-hand translation)으로 분해될 수 있습니다. 본 연구는 이 네 가지 기술 모두를 동일한 상태 공간 (state space), 행동 공간 (action space), 그리고 목적 함수 (objective function) 아래 통합하며, 서로 다른 숙련된 기술들이 단순히 동일한 작업 공식화 (task formulation)의 서로 다른 사례일 뿐임을 시사합니다. 이는 각 기술을 개별적으로 학습시키는 오늘날의 관행과 비교했을 때 구조적 단순화 방향을 제시합니다.
Hui Zhang, Julian Ferchow, Jie Song, Mirko Meboldt · arXiv 2607.28198 source
ODEWorld: 물리 세계는 연속적이지만, 월드 모델은 프레임 단위로 작동한다 · 월드 모델 (world-model)
기존의 월드 모델링 (world-modeling) 패러다임은 주로 이산 시간 (discrete-time) 예측에 국한되어 있어, 물리적 역학 (physical dynamics)을 얼마나 효율적으로 포착하는지에 한계가 있습니다. 본 논문은 물리적 시간 (physical time) 내에서 작동하는 연속적인 잠재 속도장 (continuous latent velocity field)을 학습하는 **물리적 시간 흐름 (Physical-Time Flow)**을 제안합니다. 저자들은 이 방식이 잠재 공간 (latent-space) 월드 모델에서 오랫동안 지속된 표현 붕괴 (representation collapse) 문제를 동시에 완화한다고 설명합니다.
Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang · arXiv 2607.27924 source
PAC-MAN: 제어 장벽 함수 (control barrier functions)로 전신 안전을 관리하며 날아오는 공을 피하는 휴머노이드 로봇 · 보행 (locomotion)
전신 휴머노이드의 공 피하기를 위해, 제어 장벽 함수 (control barrier functions)의 안전 보장 기능과 강화학습 (reinforcement learning)을 결합하였으며, 전지적 시점 (god's-eye-view)의 상태 정보 대신 실제 배포 수준의 **온보드 인지 (onboard perception)**를 결합했습니다. 이러한
오늘의 다른 논문들: EgoGenesis는 부족한 실제 로봇 데이터를 증강하기 위해 온라인 앵커드-프로젝션 메모리 (online anchored-projection memory)를 사용하여 제어 가능한 1인칭 조작 비디오를 합성합니다 (arXiv 2607.28243 source); SIDO는 반사실적 행동 증강 (counterfactual action augmentation)을 사용하여 정적 객체 시연으로만 학습된 정책이 테스트 시점에 움직이는 객체에 적응하도록 합니다 (arXiv 2607.27890 source); RedFlow는 실패 경험을 행동 수준의 교정적 감독 (action-level corrective supervision)으로 재작성하여 flow-matching VLA 정책에 입력합니다 (arXiv 2607.27782 source); QuantWAMs는 월드 액션 모델 (world action models)의 폐루프 실행 (closed-loop execution) 특성에 맞춰 사후 학습 양자화 보정 (post-training quantization calibration)을 재설계합니다 (arXiv 2607.28405 source); Articulated Object Reconstruction은 정적인 폐쇄 상태 관측 (static closed-state observations)만으로 관절형 객체 (articulated objects)의 기하학적 구조와 운동학적 구조를 재구성합니다 (arXiv 2607.27749 source); FA-RDP는 접촉 전에는 확산 정책 (diffusion policies)을 멀티모달 (multimodal)로 유지하고, 접촉 후에는 고주파 반응형 행동 (high-frequency reactive behavior)으로 전환합니다 (arXiv 2607.28596 source); X-NavDP는 내비게이션 확산 정책 (navigation diffusion policies)의 교차 체형 (cross-embodiment) 사후 학습을 위해 그룹 Q-스코어 재가중 매칭 (group Q-score reweighted matching)을 사용합니다 (arXiv 2607.28560 source); CS-JEPA는 군집 내의 각 로봇이 지역 관측 (local observations)만을 사용하여 동일한 공유 미래를 예측하게 합니다 (arXiv 2607.28443 source); DexDirect는 직접적인 운동감각 가이드 (direct kinesthetic guidance)와 시각적 손 리타겟팅 (visual hand retargeting)을 사용하여 숙련된 시연 수집의 장벽을 낮춥니다 (arXiv 2607.27784 source); RaDiVe는 속도 불일치 지점 불확실성 모델 (velocity-discrepancy-point uncertainty model)을 통해 4D mmWave 레이더 오도메트리 (odometry)의 강건성을 향상시킵니다 (arXiv 2607.28045 source); SemAnCorr는 제로샷 (zero-shot) 조작 기술 전이를 위해 훈련이 필요 없는 밀집 의미론적 대응 (dense semantic correspondence)을 구축합니다 (arXiv
2607.28382 source); RoboBRIDGE는 기성 VLA (Vision-Language-Action) 모델 주위에 모니터-인지-계획-제어 (monitor-perceive-plan-control) 오케스트레이션 계층을 감쌉니다 (arXiv 2607.27881 source); 한 서베이 논문은 파운데이션 모델 (foundation-model)의 사전 지식 (priors)이 손-물체 상호작용 (hand-object interaction)의 재구성, 생성 및 임바디드 전이 (embodied transfer)에 어떻게 주입되는지를 체계적으로 검토합니다 (arXiv 2607.28394 source).
오픈 소스 · 도구 · 벤치마크 (Open Source · Tools · Benchmarks)
· LingBot-World 2: Ant Group의 LingBot (Ant Group의 임바디드 AI 부문)이 차세대 실시간 상호작용 월드 모델 (world model)을 오픈 소스로 공개했습니다. 이는 연속적인 무손실 생성 (lossless generation) 시간을 버전 1.0의 약 10분에서 **시간 단위 (hour scale)**로 확장했으며, 720p 해상도에서 안정적인 60fps를 유지합니다. 액션 라이브러리 (action library)는 공격, 캐스팅, 사격과 같은 복잡한 상호작용으로 확장되었으며, 세계를 재작성하는 이벤트로 주입되는 유형화된 텍스트를 지원합니다. 새로운 에이전틱 하네스 (Agentic Harness)를 통해 인간의 조작 없이도 세계가 계속 진화할 수 있습니다. 기술 보고서에 따르면 아키텍처에 인과성 (causality, 상태는 오직 이력과 현재 입력에만 의존함)을 내장하고, MoBA 하이브리드 어텐션 마스킹 (MoBA hybrid attention masking)을 사용하여 긴 시퀀스 드리프트 (long-sequence drift)를 억제하며, 이후 2단계 교사-학생 증류 (teacher-student distillation)를 적용하여
· ASIMOV-Agentic: Google DeepMind가 Gemini Robotics 2와 함께 공개한 안전 벤치마크 (safety benchmark)로, 로봇이 안전하지 않은 행동을 거부하고, 작업을 안전하게 완료할 수 없음을 판단하며, 선제적으로 인간의 개입을 요청하는 능력을 평가합니다. source
· WorldScape 2.0: Manifold AI가 풀스택 (full-stack) 기술을 출시하며, 월드 모델 (world-model) 스케일링 (scaling)은 "새로운 제어(control)마다 모델을 다시 구축하는 것"에서 "동일한 월드에 새로운 제어를 플러그인(plugging)하는 것"으로 전환되어야 한다고 주장합니다. ⚠️ 업체 주장 source (WeChat, CN)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기