FutureX · Physical AI Daily — Issue 71 (07/28)
요약
물리적 AI(Physical AI) 분야의 최신 연구와 산업 동향을 다룹니다. 월드 모델을 임베딩하여 로봇의 장기 작업 수행 능력을 높인 τ0-VLA 연구와 잠재 액션 모델의 결함을 개선하는 CD-LAM 연구를 소개합니다.
핵심 포인트
- τ0-VLA: 월드 모델을 통해 로봇이 행동 전 미래를 상상하여 복잡한 작업을 수행
- CD-LAM: 세계 모델이 액션 명령을 무시하는 문제를 해결하기 위한 잠재 액션 표현 개선
- Enigma: 7,000만 달러 규모의 시드 투자를 유치하며 원격 조종 로봇 공개
- 중국 로보틱스 수출 급증: 수술 로봇 수출이 상반기 3.3배 증가하며 주요 수출 품목 부상
오늘의 주요 뉴스
· Enigma가 7,000만 달러 규모의 시드 라운드를 통해 스텔스 모드에서 등장하며, 온라인상의 누구나 원격 조종할 수 있는 100대 이상의 자체 로봇을 공개합니다.
· Caocao Mobility가 항저우에서 운전석 안전 요원이 없는 Robotaxi 테스트를 시작했으며, 이미 수백 대의 차량 함대가 현지에 배치되어 있습니다.
· 선도적인 재봉 장비 제조업체인 Jack Technology가 Siemens와 협력하여 의류 생산 라인을 개편하기 위해 휴머노이드 로봇 2,000대를 일괄 주문했습니다.
· Jianlan Luo의 팀은 τ0-VLA를 통해 VLA(Vision-Language-Action) 모델에 월드 모델(World Model)을 임베딩하여, 단 한 번의 실행으로 25단계의 방 정리 작업을 완료했습니다.
· 상반기 수술 로봇 수출이 3.3배 급증하여 4억 8,000만 위안을 기록했으며, 로보틱스는 중국의 '신 3종(new new three)' 수출 카테고리에 포함되었습니다.
I. 연구 진척 상황
τ0-VLA: VLA의 상위 계층에 월드 모델을 임베딩하여 로봇이 "행동하기 전에 상상하게" 만들기 · vla
장기 작업(Long-horizon tasks)은 누적된 오차와 불완전한 메모리로 인해 오랫동안 어려움을 겪어왔습니다. 예를 들어, 같은 옷을 반복해서 집어 들거나, "빨래 바구니 뚜껑 열기" 단계를 건너뛰거나, 작업 도중 원래의 지침에서 벗어나는 등의 문제가 발생합니다. τ0-VLA의 접근 방식은 이중 시스템 아키텍처(dual-system architecture)의 느린 사고(slow-thinking) 계층에 월드 모델(World Model)을 임베딩하는 것입니다. 제안 모델(proposal model)이 여러 후보 하위 작업(subtasks)을 생성하면, 월드 모델은 각 하위 작업이 실행된 후의 장면이 어떻게 보일지 상상합니다. 그 후 가치 모델(value model)이 상상된 미래에 점수를 매기고 재귀적으로 역추적하며, 성찰 모델(reflection model)이 최종적으로 어떤 후보를 실행할지 결정합니다. 여기서 핵심적인 설계는 월드 모델은 예측만 할 뿐 점수를 매기지는 않는다는 점입니다. 그렇지 않으면 모델이 자신의 작업에 스스로 점수를 매기게 되기 때문입니다. 이는 대규모 언어 모델(LLM)에서 흔히 볼 수 있는 테스트 시간 연산(test-time compute) 방식을 Embodied AI(체화된 AI)로 가져온 것이며, 저수준 동작 계층(low-level action layer)이 아닌 하위 작업 결정 계층에서 수행됩니다. 이 논문은 7가지 실제 로봇 작업을 설정하였으며, Agibot G1을 통해 25단계(약 8분)의 방 정리 작업, 22단계의 토마토 달걀 볶음, 그리고 14단계의 식사 준비를 완료했습니다.
CD-LAM: 월드 모델 비디오는 부드러워 보이지만, 사용자가 주는 액션 명령을 무시하는 경우가 많다 · world-model
잠재 액션 모델(Latent Action Models, LAM)은 원래 세계 모델이 대량의 레이블링되지 않은 인간 영상을 사전 학습하도록 설계되었지만, Aether AI와 UC San Diego가 수행한 인과 분석 결과 중요한 결함이 발견되었습니다. 즉, LAM은 배경, 카메라 움직임, 장면 연속성을 모두 '잠재 액션(latent action)'에 통합하여 인코딩하기 때문에, 세계 모델은 시각적 연속성으로부터 다음 프레임을 추측하는 방식으로 우회 학습하게 됩니다. 이 경우 액션을 완전히 무시해도 생성된 로봇 팔은 계속 움직입니다. CD-LAM은 세계 모델의 본체는 건드리지 않고, 대신 상류(upstream)에서 잠재 액션 표현을 정화하여 개선합니다. 이를 위해 세 가지 목표—구현 중심 재구성(embodiment-centric reconstruction), 액션 중심 대조 학습(action-centric contrastive learning), 그리고 잠재 공간 보정(latent-space calibration)—를 사용하며, 이로써 액션 오차를 30% 이상 감소시켰습니다. 또한, 사전 학습 후에는 기준선 대비 컴퓨팅 비용의 약 10%에 불과한 3k~6k 단계의 미세 조정만 필요합니다. 연구팀은 PSNR이 액션 정확도와 거의 상관관계가 없기 때문에 FDCE라는 새로운 지표도 제안했습니다.
Yufan Wei 외 (Aether AI × UC San Diego) · arXiv 2607.09185 출처 · 분석: 기계지성 (机器之心, 중국 AI 뉴스 매체) 출처 (WeChat, CN)
LDA-1B: 저품질 데이터도 활용하는 세계 모델, 각 유형별로 역할을 수행한다 · world-model
고품질의 전문가 궤적 (expert trajectories)은 지속적으로 부족하기 때문에, LDA-1B의 접근 방식은 이질적인 데이터 간에 노동을 분담하는 것입니다. 즉, 액션 라벨이 없는 인간 비디오는 시각적 예측 (visual prediction)을 학습하고, 저품질 궤적은 역학 (dynamics)을 학습하며, 고품질 궤적은 정책 (policy)과 역학을 동시에 학습합니다. 이와 함께 EI-30k 데이터셋도 공개되었습니다. 이는 액션 정렬 (action alignment)이 포함된 약 30,000시간 분량의 실제 및 시뮬레이션된 인간-로봇 혼합 궤적 데이터입니다. 아키텍처는 멀티모달 확산 MoE 트랜스포머 (multimodal diffusion MoE Transformer)로, 액션 및 비전 전문가 (experts)가 셀프 어텐션 (self-attention)에서 융합됩니다. LeCun의 JEPA 아이디어를 빌려와 픽셀을 예측하는 대신 DINOv3 잠재 공간 (latent space)에서 감독 (supervise)합니다. 숙련된 손 조작 (dexterous-hand manipulation) 실험에서 Pi0.5와 NVIDIA의 GR00T보다 뛰어난 성능을 보였습니다.
Pigey: 재학습 불필요 — "현장 감독관(Foreman)" 레이어만 추가하면 LIBERO-PRO 점수가 4배 상승한다 · vla
오늘날의 주류 접근 방식은 대규모 사전 학습 (large-scale pretraining)을 통해 인지, 계획, 성공 감지 및 복구를 하나의 정책 (policy)에 모두 밀어 넣는 것입니다. 이 논문은 이와 반대로, 능력을 일반적인 언어 조건부 제어 정책 (language-conditioned control policy)과 상위 수준의 오케스트레이터 (high-level orchestrator)로 분리합니다. Pigey는 추가적인 데이터 수집이나 사후 학습 (post-training) 없이도 폐쇄 루프 계획 (closed-loop planning)을 수행하고, 하위 목표 (subgoals)를 분해하며, 저수준 명령을 전달하고, 관찰을 통해 결과를 검증하며, 실패로부터 복구합니다. 또한 기존의 VLA 정책을 있는 그대로 구동할 수 있습니다. LIBERO-PRO에서 이는 성능을 12.8%에서 53.3%로 끌어올렸으며, 실제 로봇 환경에서는 추론 제약이 있는 작업에서 동결된 (frozen) 정책의 성능을 0%에 가까운 수준에서 90% 이상으로 높였습니다. 저자들은 동결된 운동 기술 (motor skill)을 단독으로 실행하는 것과 에이전트 루프 (agentic loop) 내부에서 실행하는 것 사이의 격차를 "오케스트레이션 격차 (orchestration gap)"라고 명명했습니다.
Liane Galanti, Dhruv Shah, Tri Dao · arXiv 2607.21725 source
로봇 요인화 세계 모델 (Robot-Factored World Model): 세계 모델이 "지시가 어떻게 행동이 되는지"를 학습하게 하는 것을 멈춰라 · world-model
행동이 미래 비디오에 미치는 영향은 실제로 두 단계로 일어납니다. 먼저 로봇의 신체와 제어기(controller)가 이를 움직임으로 인식하고, 그다음 장면이 접촉을 통해 반응합니다. 행동 명령(action command)에 직접적으로 조건화(conditioning)하는 것은 세계 모델(world model)이 첫 번째 단계까지 학습하도록 강제합니다. 반면, 기록된 미래 상태(future state)에 조건화하는 것은 모델이 예측해야 할 상호작용 결과(interaction outcome)를 유출(leak)하게 됩니다. 이 논문은 로봇 특유의 두 가지 요소를 모델 외부로 분리합니다. 우선 지시 사항은 로봇 자체의 제어기(controller)와 운동학(kinematics)을 통과하여 명목 궤적(nominal trajectory)을 얻습니다. 그런 다음 이 궤적은 URDF를 통해 명시적인 로봇 기하 구조(robot geometry)로 렌더링되며, 이를 통해 모델은 행동을 오직 "보이는 로봇 기하 구조"의 형태로만 인지하게 됩니다. 실험 결과, 이 인터페이스는 벡터 조건화(vector-conditioning) 베이스라인보다 성능이 뛰어나며, 추론 시 보지 못한 형태(embodiments)로도 일반화가 가능하고, 심지어 인간의 손 시연을 로봇 기하 구조로 렌더링하여 조작 비디오를 생성하는 리타겟팅(retargeting)까지 가능함을 보여줍니다.
Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo · arXiv 2607.22535 source
ViTacWorld: 세계 모델을 사용하여 "시각 + 촉각" 궤적을 직접 생성하기 · world-model
접촉이 풍부한 조작(Contact-rich manipulation)은 카메라에는 보이지 않는 물리적 신호에 의존하지만, 실제 촉각 데이터를 수집하는 것은 비용이 많이 들고 하드웨어에 종속적이며 단일 시나리오로 제한됩니다. ViTacWorld의 핵심 관찰 결과는 촉각 신호는 물리적 접촉에 직접적으로 고정되어 있으므로, 시각만 사용할 때보다 sim2real gap(시뮬레이션-실제 간 격차)이 더 작다는 것입니다. 이는 공개된 실제 촉각 데이터와 자체 구축한 시뮬레이션 환경을 결합하여, 먼저 사전 학습(pretraining)을 수행한 후 실제 로봇 정책 롤아웃(policy rollouts)을 통해 미세 조정(fine-tuning)함으로써 데이터를 확장하는 것을 가능하게 합니다. 특정 행동(action)이 주어지면, 모델은 시간적으로 정렬된 시각적 관측(visual observations)과 촉각 피드백(tactile feedback)을 동시에 예측합니다. 이를 통해 한편으로는 다운스트림 촉각 정책(downstream tactile policies)을 개선하기 위한 롤아웃을 합성하고, 다른 한편으로는 제어된 행동 시퀀스 하에서 정책을 평가합니다. 저자들은 이를 시각-촉각-행동 궤적 생성 및 정책 평가를 위해 월드 모델(world model)을 사용하는 최초의 프레임워크라고 부릅니다.
Yunao Huang et al. · arXiv 2607.22530 source
Xiaomi-Robotics-U0: 월드 모델을 단순한 비디오 생성기가 아닌 학습 경험의 생산자로 만들기 · world-model
Embodied 데이터의 규모를 확장하는 데 있어 어려운 점은 비디오의 양이 아니라, 배경, 조명 또는 객체 인스턴스를 변경했을 때 작업 관계가 여전히 유지되는지 여부였습니다. 즉, 여러 카메라에 걸친 동일한 객체는 동일한 3D 장면과 일치해야 하며, 팔과 객체 사이의 상대적 위치가 프레임마다 어긋나서는 안 됩니다. U0는 멀티모달 자기회귀(multimodal autoregressive) 백본을 사용하여 일반적인 이미지 작업, embodied 장면 생성, 교차 장면 전이(cross-scene transfer), 그리고 embodied 비디오 생성을 모두 **단일 통합 모델(single unified model)**로 구축합니다. 주석(annotation) 과정에서는 먼저 작업대/객체/조명/배경과 같은 의미론적 영역(semantic fields)을 분리한 다음, 말단 장치(end-effector) 포즈와 그리퍼(gripper) 신호를 기반으로 하위 작업과 키프레임을 분할합니다. GPT-Image-2와의 비교는 단일 프레임의 시각적 품질보다는 깊이 제약(depth constraints)과 다중 뷰 대응성(multi-view correspondence)이 유지되는지에 초점을 맞춥니다.
ACE-Brain-0.5: 공간 인지, 계획, 조작 및 자기 모니터링을 하나의 뇌로 통합하는 8B 백본 (Backbone) · vla
엔드투엔드 (End-to-end) VLA는 행동을 생성하는 데는 뛰어나지만 공간 추론 (spatial reasoning)과 장기 계획 (long-horizon planning)에는 취약한 반면, LLM 기반 로봇 에이전트는 도구를 조율할 수는 있으나 통합된 로봇 표현 (unified robot representation)을 학습하는 데 실패합니다. ACE-Brain-0.5는 하이브리드 트랜스포머 (hybrid Transformer)를 사용하여 다섯 가지 인지 기능을 단일 모델로 접어 넣었으며, 백본 (backbone) 파라미터는 단 8B에 불과합니다. 또한 이중 타임스케일 (dual-timescale) 제어 인터페이스를 도입했습니다. LLM 디코더 (decoder)는 저주파수에서 의미론적 계획 (semantic planning)을 처리하고, 경량화된 고속 비전 경로 (fast-vision pathway)는 고주파수에서 실시간 특징 (real-time features)을 플로우 매칭 (flow-matching) 액션 전문가에게 주입합니다. 이질적인 멀티태스크 (multi-task) 데이터에 대한 공동 학습 (joint training)으로 인한 태스크 간 간섭을 억제하기 위해, 연구팀은 기존 SSR 전략 위에 "재활성화 (reactivation)" 단계를 추가하여 SSR+로 업그레이드했습니다. 이 모델은 LIBERO에서 평균 98.2%의 성공률을 달성했으며, SimplerEnv-Bridge에서는 82.3%를 기록했습니다.
오늘의 다른 논문들: Ordered Action Tokens는 시각 운동 정책 (visuomotor policies)을 위해 구조화되고 순서가 있는 액션 토큰 (action tokens)을 설계하여, 지나치게 긴 파싱된 이산화 (parsed discretization)와 구조화되지 않은 암시적 토크나이저 (unstructured implicit tokenizers) 사이의 딜레마를 피합니다 (arXiv 2607.21670 source); ACME는 지역적 및 상호작용 다양성의 공백을 메우는 교차 문화적, 교차 체화적 (cross-cultural, cross-embodiment) 사회적 내비게이션 데이터셋을 공개합니다 (arXiv 2607.21964 source); GRACE는 확산 정책 (diffusion policies)과 MPPI 사후 평균 추정 (posterior mean estimation)을 결합하여, 미분 가능한 가이드 비용 (differentiable guidance cost) 없이도 충돌 감지 및 관절 제한과 같은 하드 제약 조건 (hard constraints)을 충족합니다 (arXiv 2607.21661 source); Progress Reward Modeling에 관한 서베이 논문은 로봇 학습에서의 프로세스 보상 (process reward) 설계를 체계적으로 검토합니다 (arXiv 2607.21655 source); SiPhy는 단일 이미지로부터 질량, 강성(stiffness), 탄성(elasticity)과 같은 물리적 특성을 추론합니다 (arXiv 2607.22355)
source); Mag4D-SLAM은 반복 주행이 포함된 멀티모달 4D 지자기 위치 추정 및 매핑 (geomagnetic localization and mapping) 데이터셋을 공개합니다 (arXiv 2607.21986 source); 피부로 덮인 로봇 팔의 촉각 "회피 반사 (withdrawal reflex)" 파이프라인에 대한 인간 요인 평가 (human-factors evaluation)가 수행되었습니다 (arXiv 2607.22249 source).
오픈 소스 · 도구 · 벤치마크 (Open Source · Tools · Benchmarks)
· NVIDIA Cosmos-H-Dreams: 증류된(distilled) 수술용 월드 모델 (surgical world model)로, 단일 RTX PRO 6000에서 약 160 fps로 작동합니다 (교사 모델(teacher model)의 약 10 fps 대비). 가중치(weights)와 서빙 코드는 7월 23일에 공개되었습니다. 내부에는 물리 엔진(physics engine)이 없으며, 수술 비디오와 로봇 운동학(robot kinematics)으로부터 시각적 역학(visual dynamics)을 직접 학습합니다. 학습 세트에는 바늘 떨어뜨림, 봉합 실수, 느슨한 매듭과 같이 의도적으로 실패 사례 및 분포 외(out-of-distribution) 클립을 유지합니다. 정책(policies)을 평가하기 위한 시뮬레이터는 잘못된 행동의 결과를 재현할 수 있어야 하기 때문입니다. 현재 공개된 체크포인트(checkpoint)는 da Vinci Research Kit에서 288×512 해상도와 10 Hz 명령 주파수로 테이블탑 봉합(tabletop suturing)만 수행합니다 source
· 베이징 휴머노이드 오픈 데이터셋 (Beijing humanoid open dataset): 베이징 이좡(Yizhuang) 지구는 자사의 임바디드 AI (embodied AI) 오픈 소스 데이터셋이 전 세계적으로 1,000만 회 이상의 다운로드를 돌파했다고 발표했습니다 source
II. 금융 및 거래 (Financing and Deals)
Enigma (미국/이스라엘) | 시드 라운드 (Seed Round) | 7,000만 달러 · 임바디드 (embodied)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기