FutureX · Physical AI Daily — Issue 74 (07/31)
요약
물리적 AI(Physical AI) 분야의 최신 연구와 산업 동향을 다룹니다. TurboVLA의 효율적인 VLA 구조와 HumanCLAW 벤치마크를 통한 VLM의 신체 제어 능력 한계 등 로봇 공학의 주요 연구 성과를 소개합니다.
핵심 포인트
- TurboVLA: 0.2B 파라미터로 RTX 4090에서 실시간 로봇 제어 가능
- HumanCLAW: VLM의 행동 지능 평가를 위한 새로운 벤치마크 제시
- Zoox: 스티어링 휠 없는 로보택시 상업적 면제 승인 획득
- Unitree Robotics: 대규모 자금 조달 및 IPO 추진
오늘의 하이라이트
· Zoox, 스티어링 휠이 없는 로보택시(robotaxi)에 대해 미국 최초의 상업적 면제 승인을 획득, 연간 2,500대로 차량 규모 제한
· Unitree Robotics, 8월 10일로 구독 날짜 설정, 42.02억 위안의 자금 조달 및 약 420억 위안의 IPO 기업 가치 목표
· TurboVLA, 단 **0.2B 파라미터 (parameters)**로 LIBERO에서 97.7% 달성, 단일 RTX 4090에서 32Hz로 구동
· 중국의 100톤급 순수 전기 자율 주행 광산 트럭 운행 시작, 단위 생산당 에너지 비용 65% 절감
· 중국 상무부, 미국의 로봇 공학 금지 조치에 대응: 완고한 추구는 단호한 대응책에 직면할 것
I. 연구 진척 상황 (Research Progress)
TurboVLA: 단일 RTX 4090에서 32Hz로 구동되는 0.2B 파라미터의 실시간 VLA · vla
주류 VLA 모델들은 일반적으로 시각(vision) 정보를 먼저 대규모 언어 모델(large language model)에 투영한 다음, 이를 행동(actions)으로 디코딩합니다. 즉, 모든 정책(policy) 호출마다 대규모 모델에 대한 연산 비용(compute tax)이 발생합니다. 반면 TurboVLA는 V→L→A 구조를 V+L→A로 재구성합니다. 시각과 언어는 가벼운 양방향 상호작용(bidirectional interaction)만을 통해 독립적으로 인코딩되며, 컴팩트한 디코더가 연속적인 행동 청크(action chunks)를 직접 출력합니다. 그 결과, 0.2B 파라미터로 LIBERO에서 **97.7%**의 평균 성공률을 달성하였으며, 추론 지연 시간(inference latency)은 31.2ms, GPU 메모리 사용량은 0.9 GB 미만으로, 훨씬 더 큰 규모의 정책 모델들과 대등하거나 이를 능가하는 성능을 보여줍니다. 이는 고주파수(high-frequency) 실로봇 제어가 더 이상 데이터 센터급 GPU에 종속될 필요가 없음을 의미합니다. 코드는 오픈 소스로 공개되었습니다.
Hengyi Xie 외 · arXiv 2607.27205 출처 · HF↑114
HumanCLAW: 9개의 최상위 VLM에 신체를 부여했으나, 최고 모델조차 성공률은 16.8%에 불과 · benchmark
"VLM이 신체를 통해 행동할 수 있는가"를 평가하는 데에는 항상 혼란 변수(confound)가 존재해 왔습니다. 즉, 작업 실패가 모델의 잘못된 결정 때문인지, 아니면 근본적인 이동 제어기(locomotion controller)가 단순히 넘어졌기 때문인지 구분하기 어렵다는 점입니다. HumanCLAW는 이 두 가지를 분리합니다. 모델은 단계별 원자적 기술 명령(atomic skill commands)만을 내리며, 제어기는 이를 실제 중력과 충돌의 영향을 받는 1초 미만의 연속적인 전신 동작(whole-body motion)으로 변환합니다. 이를 통해 "행동 지능(action intelligence)"을 유일한 측정 가능 수치로 남깁니다. 41개의 실내 장면과 1,218개의 장기적(long-horizon) 1인칭 "찾기-걷기-상호작용" 작업 전반에 걸쳐, 9개의 최첨단(SOTA) 모델 중 어느 것도 벤치마크를 통과하지 못했습니다. 최고 점수는 단 **16.8%**에 불과했습니다. 병목 현상은 목표를 인식하는 것이 아니라, 체화된 자기 인식(embodied self-awareness)에 있습니다. 모델은 자신의 신체를 놓치게 되며, 자신이 어디에 있는지, 목적지에 도착했는지, 혹은 무언가와 충돌했는지조차 말하지 못합니다.
Siyao Li et al. · arXiv 2607.27180 source · HF↑63
범용 에이전트를 로봇 브레인으로 직접 사용하여, 제로샷(zero-shot) 내비게이션이 산업급 정책(policies)과 대등한 성능을 달성하다 · autonomy
시각-언어 내비게이션(Vision-language navigation)은 긴 의사결정 루프를 유지하기 위해 오랫동안 특화된 정책(specialized policies)이나 작업별 워크플로우에 의존해 왔습니다. 본 논문은 제3의 경로를 제시합니다. 범용 소프트웨어 엔지니어링 에이전트가 루프 자체를 보유하도록 하며, 입력은 단안 RGB와 이산적 행동(discrete actions)으로 제한합니다. 이 최소한의 인터페이스 하에서, 기본 설정의 opus-5는 **70.7%**의 성공률을 달성하고, 최대 성능을 낸 fable-5는 **78%**에 도달합니다. 선택 사항인 웨이포인트(waypoint) 도구를 추가할 경우, 하이브리드 에이전트는 환경 스텝(environment steps)을 절반만 사용하고 실제 소요 시간(wall-clock time)을 4분의 1 미만으로 줄이면서 76.7%의 성공률을 달성합니다. 저자들의 통제된 실험에 따르면, 능력은 하네스(harness)의 영향이 제한적인 상태에서 주로 모델 자체에 의해 결정되며, 웨이포인트 인터페이스를 강제하는 것이 오히려 더 강력한 모델의 성능을 저하시키는 것으로 나타났습니다. 한계점 또한 명확합니다. 작업이 길어질수록 성공률이 급격히 떨어지며, 지연 시간(latency)과 컨텍스트 팽창(context bloat)이 지속적인 운영을 제약합니다.
Jian Zhou et al. · arXiv 2607.26148 source
CheckVLA: 오픈 루프 액션 청크 (open-loop action chunks)를 위한 "실행 시간 품질 검사" · 세계 모델 (world-model)
VLA가 장기적 모바일 조작 (long-horizon mobile manipulation)을 수행할 때, 일반적으로 전체 액션 청크 (action chunk)를 한 번에 발행하므로, 중간 과정의 편차를 명령 시점의 신뢰도 (confidence)로 포착할 수 없으며 남은 액션들이 오류를 계속 증폭시킵니다. CheckVLA는 별도로 학습된, 동결된 (frozen) 액션 조건부 세계 모델 (action-conditioned world model)을 실행 시간 검증 (execution-time verification)에 사용합니다. 이때 정밀하게 보정된 (conformally-calibrated) 위험 임계값 (risk threshold)을 사용하여 개입 시점을 결정하며, 지연 시간을 고려한 하드 프리픽스 (latency-aware hard prefix)를 사용하여 시간 내에 교체 가능한 액션으로만 재작성 (rewrites)을 제한합니다. RoboCasa365에서 평균 성공률은 **36.1%**로, 주기적 재계획 (periodic replanning)의 27.6%보다 8.5포인트 높았습니다. 동일한 5%의 오탐률 (false-positive rate) 조건에서, 액션 조건부 (action-conditioned) 방식은 관측 전용 (observation-only) 베이스라인의 48.6% 대비 적시 재현율 (timely recall)을 **77.9%**까지 끌어올렸습니다. 결과는 현재 시뮬레이션 단계의 것입니다.
Yushan Liu et al. · arXiv 2607.26789 source
잠재 세계 모델 (latent world model)은 실제로 어떤 물리량을 "알고" 있는가? 그 답은 무엇을 예측하게 만드느냐에 달려 있다 · 세계 모델 (world-model)
세계 모델 (world models)의 핵심 가정은 "미래를 예측하는 과정이 표현 (representation)으로 하여금 물리학을 내재화하도록 강제한다"는 것입니다. 이 논문은 통제된 개입 (controlled interventions)을 사용하여 해당 주장을 테스트합니다. 객체들은 외관상 동일해 보이지만 각각 서로 다른 질량, 마찰력, 접촉 강성 (contact stiffness)을 숨기고 있는 POKEWORLD 환경에서, 저자들은 먼저 주어진 파라미터가 가공되지 않은 관측값 (raw observations)으로부터 복구될 수 있음을 보여준 뒤, 그것이 실제로 잠재 공간 (latent space)에 진입하는지를 테스트합니다. 결론은 다음과 같습니다: 무엇이 유지되는지는 단순히 입력에 무엇이 있느냐가 아니라, 예측 대상 (prediction target)이 무엇인지에 달려 있다 — 강성 (stiffness)은 모델이 촉각 (touch)을 예측하도록 훈련될 때만 잠재 공간에 진입합니다 (R²=0.50; 단순히 동일한 신호를 입력에 추가할 경우 -0.02를 기록함). 마찰력 (friction)은 입력으로부터 0.89의 정확도로 복구가 가능하지만, 모든 결정론적 예측 대상 (deterministic prediction targets) 하에서는 약 0.13 수준에서 정체됩니다. 동일한 패턴은 RH20T의 4,258개 실제 로봇 궤적 (trajectories)에서도 재현됩니다: 적절한 정보나 적절한 예측 압력 (predictive pressure)이 결여된 분기들은 데이터를 5배 더 많이 투입하더라도 정체된 상태를 유지합니다.
Kaizhen Tan et al. (NYU / CMU) · arXiv 2607.27017 source
HERO: 인간의 시연 (human demonstrations) 없이 제로 상태에서 시작하여, "연습"을 통해 상호작용 경험을 정책 (policy)으로 통합하기 · 조작 (manipulation)
기존 시스템들은 주로 기술을 정적으로 학습합니다. 즉, 특정 작업과 레이아웃에 대해 한 번 훈련된 후 고정되며, 물리적 상호작용을 통해 더 이상 진화하지 않습니다. HERO는 휴리스틱 추론 (heuristic reasoning), 예시 재사용 (exemplar reuse), 성찰적 실행 (reflective execution)을 조율하여 자기 개선형 계층적 체화된 에이전트 (hierarchical embodied agent)를 구축합니다. 이는 인간의 시연이 전혀 없는 상태에서 조작 경험을 부트스트랩하며, 반복되는 상호작용을 폐루프 시각-운동 정책 (closed-loop visuomotor policies)으로 점진적으로 통합하고, 축적된 경험의 단계에 따라 능력을 동적으로 스케줄링합니다. 실험 결과, HERO는 데이터 수집에 필요한 인간의 개입을 실질적으로 감소시킴을 보여줍니다.
Jialiang Li et al. · arXiv 2607.26809 source
Genie Sim PanoWorld: 단일 360° 파노라마로 자유롭게 탐색 가능한 시뮬레이션 장면 생성 · world-model
Embodied (체화된) AI 학습을 위한 실내 장면 구축은 이전에는 장면별 최적화(per-scene optimization)를 수행하거나 다중 뷰 캡처(multi-view capture)를 거쳐야 했으며, 장거리 이동 시 큰 폐쇄(occlusion) 구멍이 발생하는 경우가 많았습니다. 이 2단계 피드포워드(feed-forward) 파이프라인은 먼저 NavMesh를 통해 SE(3) 내비게이션 궤적을 계획하고 이를 잠재 공간 비디오 확산 모델(latent-space video diffusion model)에 주입하여, 단 4단계의 CFG-free 디노이징(denoising) 단계만으로 제어 가능한 파노라마 비디오를 생성합니다. 그 다음, 피드포워드 재구성기(reconstructor)를 통해 이를 3D 가우시안(3D Gaussian) 장면으로 변환하여 시뮬레이션 자산으로 즉시 사용할 수 있게 하며, 보지 못한 실내 장면에 대해서도 제로샷(zero-shot) 일반화가 가능합니다.
Yongxin Su et al. · arXiv 2607.26646 source
신뢰할 수 있는 Embodied AI: 37페이지 분량의 체계적 프레임워크 및 신뢰 수준 분류 · benchmark
Embodied 시스템이 한 번 실패하면 그 피해는 즉각적이고 물리적이기 때문에,
Xinyu Yang 외 · arXiv 2607.26121 source · 해설: 具身智能之心 (Embodied Intelligence Heart, 중국 로보틱스 커뮤니티) source (WeChat, CN)
오늘의 다른 논문들: CG-World, 명시적인 접촉 이벤트(contact events)와 반사실적 분기(counterfactual branches)를 포함하여 산업용 CG 제작 파이프라인으로부터 대략 850,000개의 시간적으로 정렬된 세계 상태 시퀀스(world-state sequences)를 도출함 (arXiv 2607.26452 source); NeoRacer, 오픈 소스 표준 1:12 자율 주행 레이싱 플랫폼으로, 유사 제품보다 3배 높은 연산 능력을 갖춘 조립 완료 제품 가격이 $2,699임 (arXiv 2607.26855 source); MoMo, "동작이 어떻게 실행되는가"를 여러 태스크에 걸쳐 재사용 가능한 연속적 동작 패턴 조건(continuous motion-pattern condition)으로 추상화함 (arXiv 2607.26315 source); ContactFlow, 월드 모델(world models)이 학습하기 어려워하는 접촉 제약 조건(contact constraints)을 대상으로 하는 교차 Embodiment 전이 가능 비디오 동작 조건(cross-embodiment transferable video action condition) (arXiv 2607.26579 source); Enfold, 월드 생성 모델의 "미래를 구축하기 위한 연산(compute for constructing the future)"을 예측 표현(predictive representations)으로 접어 넣어(folding) 비용이 많이 드는 생성 분기(generation branch)를 절약함 (arXiv 2607.26657 source); RL²-VLA, 테스트 시간 확장 가능한 적응형 잠재 공간 구성 가이드(test-time-scaled adaptive latent-space compositional guidance) (arXiv 2607.26991 source); DLAM, 실제 동작과 공동 생성을 위해 동작이 없는 비디오에서 추출된 잠재 동작(latent actions)에 시간적 제약(temporal constraints)을 추가함 (arXiv 2607.27138 source); 명시적 운동학적 가이드(explicit kinematic guidance), 분석적 개념을 통해 VLA에 3D 구조적 사전 정보(3D structural priors)를 주입함 (arXiv 2607.26513 source); SymmGrid, 병렬화된 대칭성(parallelized symmetry)을 사용하여 ~의 실제 훈련 시간(wall-clock training time)을 단축함
실제 로봇 강화학습 (real-robot reinforcement learning) (arXiv 2607.26985 source); VidMap, 미터법 포즈 (metric pose)를 복구하기 위해 SfM에 비디오 시간적 구조 (video temporal structure)를 사용하는 방법 (arXiv 2607.27194 source); StructureGS, 관절형 객체 재구성 (articulated-object reconstruction)을 위한 구조 인식 가우시안 스플래팅 (structure-aware Gaussian splatting) (arXiv 2607.26889 source); Speech2Grasp, 텍스트 조건부 파지 탐지 (text-conditioned grasp-detection) 데이터를 음성 입력으로 효율적으로 전이하는 방법 (arXiv 2607.26567 source).
오픈 소스 · 도구 · 벤치마크 (Open Source · Tools · Benchmarks)
· 실습형 임바디드 로봇 팔 배포 튜토리얼 (Hands-on embodied robotic arm deployment tutorial): VLA 및 강화학습 (reinforcement learning)과 같은 핵심 알고리즘의 전체 파이프라인을 3일 안에 다루며, 전체 코드가 포함되어 있음 source (WeChat, CN)
· RoboCasa365 벤치마크 리더보드 (RoboCasa365 benchmark leaderboard): 약 60개의 주방 활동 카테고리에 걸친 365개의 작업, 2개에서 15개 이상의 세그먼트로 구성된 하위 단계로 이루어져 있으며, 장기적 의미 판단 (long-horizon semantic judgment) 및 시간적 제약 (temporal constraints)을 테스트하기 위해 특별 제작됨 source (WeChat, CN)
II. 자금 조달 및 거래 (Funding & Deals)
Unitree Robotics | STAR Market IPO | 목표 금액 42.02억 위안 (RMB) | 예상 IPO 기업 가치 ~420억 위안 (RMB) · 휴머노이드 (humanoid)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기