FutureX · Physical AI Daily — Issue 80 (08/06)
요약
자율주행, 로보틱스, 월드 모델링 등 Physical AI 분야의 최신 연구와 산업 동향을 다룹니다. 특히 에이전트 중심의 새로운 월드 모델 정의와 휴머노이드 파쿠르 제어 정책 연구를 핵심적으로 소개합니다.
핵심 포인트
- Wayve와 Uber의 런던 로보택시 라이선스 확보
- Nvidia의 자율주행 VLA 모델 Alpamayo 2 Super 오픈 소스 공개
- 에이전트 중심 상호작용 월드 프록시 개념을 제안하는 포지션 페이퍼 발표
- 휴머노이드의 지형 인식 및 전신 제어를 위한 단일 정책 연구
오늘의 주요 뉴스
· Wayve×Uber, Waymo와 Baidu를 제치고 감독형 Robotaxi 출시를 위한 런던 승차 공유 라이선스 확보
· Nvidia, 자율주행 VLA(Vision-Language-Action) 모델인 Alpamayo 2 Super 오픈 소스 공개, 34B 가중치(weights)를 통해 즉시 상업적 이용 가능
· Xiaomi의 Embodied Foundation Model(체화된 기초 모델)인 Xiaomi-Robotics-1 공식 오픈 소스 공개, 100,000시간의 실제 로봇 데이터로 학습
· Hai Robotics의 선반 등반 로봇, 글로벌 배포 10,000대 돌파
· Amazon의 최대 규모 Kansai 허브 가동, 단일 창고에 약 3,000대의 운송 로봇 배치
· Unitree, 오늘부터 예비 가격 문의 시작, 예상 IPO 가격은 주당 약 RMB 104, 기업 가치는 400억 RMB 이상으로 추정
· 대한민국 대구, 5년간 187억 원을 투자하여 국내 최초의 휴머노이드 로봇 안전 인증 센터 완공
· Tsinghua AIR×BAIR의 연속 시간 월드 모델(continuous-time world model), **임의의 프레임 레이트(arbitrary frame rates)**로 생성 가능하며 역방향 추론(inference backward)까지 수행 가능
I. 연구 진척 상황
Quo Vadis, World Modeling? Where Should World Models Go Next (월드 모델링, 어디로 가야 하는가? 월드 모델의 다음 행보는 무엇인가?) · world-model
오늘 Hugging Face에서 27위 이상을 기록하며 트렌딩 중인 이 포지션 페이퍼(position paper)는 "월드 모델(world model)"의 정의를 완전히 재정립한다는 점에서 읽어볼 가치가 있습니다. 기존의 월드 모델은 물리적 상태 전이(physical state transitions)를 예측하지만, 지속적으로 자기 개선을 수행하는 에이전트(agent)에게 실제로 필요한 것은 실행 결과, 검색된 경험 및 기술, 검증 신호와 같은 "사용 가능한 정보(usable information)"입니다. 이를 바탕으로 저자들은 **에이전트 중심 상호작용 월드 프록시(Agent-Centric Interactive World Proxies)**를 제안합니다. 이들은 피드백 양식(modality)에 따라 역학(dynamics), 공간(space), 실행(execution), 메모리/경험(memory/experience), 기술(skills), 보상/검증(reward/verification)의 6가지 프록시 카테고리로 분류하며, 세 가지 기능 계층을 매핑합니다: 추론 시점의 인컨텍스트 가이드(in-context guidance), 학습 시점의 보상 및 합성 롤아웃(synthetic rollouts) 생성, 그리고 에이전트와 프록시 간의 공동 진화(co-evolution)입니다. 이는 월드 모델을 단순히 "비디오 예측(video prediction)"과 동일시하는 현재의 경향에 대한 명확한 방향 수정입니다.
Yu Yang et al. · arXiv 2608.02713 source
Light-Loco-Parkour: 전신 휴머노이드 파쿠르를 위한 단일 정책 (A Single Policy for Whole-Body Humanoid Parkour) · locomotion
기존의 전신 휴머노이드 제어는 표현력이 풍부한 동작을 추적하지만 지형을 인식하지 못하거나, 지형에 실시간으로 반응하면서도 팔과 몸통은 유휴 상태로 두는 방식 중 하나를 택해야 했습니다. 본 연구는 **하나의 배포 가능한 정책 (one deployable policy)**으로 이 두 가지 측면을 모두 해결합니다. 이 정책은 온보드 깊이 지도 (onboard depth maps)와 속도 명령 (velocity commands)만을 입력으로 받아, 참조 입력 (reference inputs), 기술 레이블 (skill labels), 하드코딩된 상태 머신 (hardcoded state machines) 또는 런타임 동작 생성기 (runtime motion generators) 없이도 스스로 걷기, 균형 잡기, 오르기, 계단 내려가기 또는 장애물 뛰어넘기를 결정합니다. 기술은 소수의 시드 동작 (seed motions)에서 지형에 맞춘 실행 가능한 참조 (feasible references)로 확장함으로써 학습되며, 실내외 실제 하드웨어로의 성공적인 제로샷 전이 (zero-shot transfer)를 보여줍니다.
Hongming Chen et al. · arXiv 2608.02653 source
VLA는 고유 수용성 상태 (Proprioceptive State)를 실제로 어떻게 사용해야 하는가? · vla
거의 모든 VLA (Vision-Language-Action models)는 로봇의 고유 수용성 상태 (proprioceptive state)를 소비하지만, 그 방법은 텍스트 프롬프트로 직렬화하거나, 시각-언어 접두사 (vision-language prefixes)로 투영하거나, 액션 전문가 (action expert)에 직접 입력하는 등 매우 다양하며, 대부분 현재 프레임만을 사용하고 있어 현재까지 체계적인 비교가 이루어지지 않았습니다. 본 논문은 백본 (backbone), 데이터, 액션 표현 (action representation) 및 평가 프로토콜을 고정한 상태에서 **5가지 인터페이스 변형 (interface variants)**을 구현하고, 이를 **45개의 원자적 작업 (atomic tasks) + 20개의 복합 작업 (compound tasks)**에 걸쳐 비교하며, 상태 이력 길이 (state history length)를 1프레임에서 96프레임까지 탐색하여 세 가지 미해결 질문에 답합니다: 상태가 실제로 도움이 되는지, 이력이 얼마나 도움이 되는지, 그리고 상태가 모델의 어느 부분에 입력되어야 하는지입니다. 이는 즉각적인 엔지니어링 적용이 가능한 결론들입니다.
Yiren Zhao et al. · arXiv 2608.03052 source
DRIFT: Flow-Matching VLA의 적대적 강건성 (Adversarial Robustness)은 환상이다 · vla
DRIFT: Flow-Matching VLA의 적대적 강건성 (Adversarial Robustness)은 환상이다 · vla
pi0와 같은 Flow-Matching VLA가 자기회귀(Autoregressive) VLA보다 적대적 섭동(Adversarial Perturbations)에 본질적으로 더 강건하다는 것이 이전에는 널리 믿겨 왔습니다. 하지만 이 논문은 과거의 공격들이 다단계 디노이징 ODE(Multi-step Denoising ODE)를 무시했기 때문일 뿐이라고 지적합니다. 저자들은 로봇 그리퍼에 범용 적대적 패치(Universal Adversarial Patch)를 부착하여 디노이징 속도장(Denoising Velocity Field)을 직접 공격했으며, 여기서 직관에 반하는 핵심 발견을 도출했습니다. 즉, 더 넓은 단계의 윈도우를 공격하는 것보다 첫 번째 디노이징 단계만을 공격하는 것이 더 강력하고 비용이 적게 든다는 것입니다 (이는 입력 공간 최적화(Input-space Optimization)에 특유한 그래디언트 충돌(Gradient Conflicts)에서 기인하며, 훈련 시간 백도어(Training-time Backdoors)와는 정반대의 패턴을 보입니다). pi0 및 pi0.5를 사용한 네 가지 LIBERO 스위트(LIBERO suites) 전체에서, 단 하나의 작은 패치가 이전에 해결 가능했던 거의 모든 태스크를 무력화했습니다.
Hoseong Tae, Jong-Seok Lee · arXiv 2608.03207 source
접촉을 향한 사격: 운동학적 참조를 동적으로 실행 가능한 궤적으로 전환하기 (Shooting for Contact: Turning Kinematic References into Dynamically Feasible Trajectories) · locomotion
모션 리타겟팅(Motion Retargeting)은 일반적으로 운동학적 유사성(Kinematic Similarity)에만 관심을 두며, 이로 인해 생성된 참조(References)는 특히 접촉이 빈번한 동작(Contact-rich Behaviors)의 경우 강화학습(RL) 정책이 재현하기 매우 어렵습니다. 이 논문은 비선형 계획법(Nonlinear Program)에 미분 가능한 시뮬레이터를 내장하여 **접촉 암시적 다중 사격(Contact-implicit Multiple Shooting)**을 수행하며, 접촉 타이밍을 미리 지정할 필요 없이 접촉, 마찰, 충돌, 자기 충돌(Self-collision) 및 관절 제한(Joint Limits)을 동시에 해결합니다. 그 결과 더 빠른 모방 학습(Imitation Learning) 훈련과 더 낮은 추적 오차(Tracking Error)를 달성했으며, Unitree G1에서 접촉이 빈번한 기어가는 동작과 **180도 점프 턴(180-degree jump turn)**에 대해 제로샷 심투리얼(Zero-shot Sim-to-real) 전이를 성공시켰습니다.
Sergio A. Esteban et al. · arXiv 2608.03116 source
산업용 휴머노이드를 위한 기능 안전 인증: 페일 패시브(Fail-Passive) 격차의 위치 · locomotion
산업용 휴머노이드의 발목을 잡고 있는 것은 걷거나 움켜쥐는 능력의 여부가 아니라, 다리 기반 플랫폼(legged platforms)을 위한 기능 안전 인증(functional safety certification)이 여전히 미성숙하다는 점입니다. 이 논문은 핵심 문제인 **페일 패시브 격차(fail-passive gap)**를 정확히 지목합니다. 즉, 다리가 달린 로봇의 안전 상태는 "제어에 의해 능동적으로 유지되는" 상태인 반면, ISO 13849-1 / EN 60204-1의 근본적인 가정은 전원 차단(de-energizing)이 곧 안전을 의미한다는 것입니다. 하지만 걷는 이족 보행 로봇의 전원을 차단하는 것은 오히려 넘어짐이라는 새로운 위험 요인을 생성합니다. 저자들은 외부에서 정량적으로 인증 가능한 안전 체인(라이트 커튼, 비상 정지(e-stops), 페일 세이프 PLC, 무선 PROFIsafe)을 탐침(probe)으로 사용하여, 인증 불가능한 잔여 격차를 로봇 자체의 반응 체인(reaction chain)으로 국한시키고, Unitree G1 EDU를 사용하여 반폐쇄형 픽 앤 플레이스(pick-and-place) 작업 셀에서 그 타당성을 검증했습니다. 저자들은 명시적으로 엔드 투 엔드(end-to-end) PL e / SIL 3를 주장하지 않습니다. 이러한 절제 자체가 휴머노이드가 생산 라인에 투입되는 데 있어 장벽이 여전히 표준(standards) 측면에 있음을 시사합니다.
Caiwu Ding et al. · arXiv 2608.02809 source
ODEWorld: 연속 시간 체화된 세계 모델 (A Continuous-Time Embodied World Model) · world-model
주류 비디오/잠재 공간 (latent-space) 세계 모델들은 이산 시간 (discrete time)을 기반으로 구축되어 샘플링 속도(sampling rate)가 결정되는 주기에 따라 세상을 이해하는 반면, 실제 물리 현상은 연속적으로 진화합니다. Tsinghua AIR와 UC Berkeley BAIR는 PT-Flow (Physical Time Flow)를 제안합니다. 이 모델은 "지금 세상이 어느 방향으로, 얼마나 빠르게 변하고 있는가"를 학습한 다음, ODE 솔버 (ODE solver)를 사용하여 속도장 (velocity field)을 따라 적분함으로써 임의의 시점에서의 잠재 상태 (latent state)를 얻습니다. 동반된 역학-표현 분리 (dynamics-representation decoupling) 기술은 정적인 배경을 초기 상태 메모리에 넘겨줌으로써 잠재 공간이 오직 변화만을 설명하도록 합니다. 또한, 자코비안-벡터 곱 (Jacobian-vector products)을 사용하여 실제 시각적 변화 속도를 투영함으로써 1차 감독 (first-order supervision)을 제공하며, 이는 표현 붕괴 (representation collapse)를 방지하기 위해 별도의 정규화 도구 (bolt-on regularizers)에 오랫동안 의존해 온 JEPA 방식의 한계를 우회합니다. RankMe 프로토콜 하에서, 이 모델의 768차원 역학 잠재 공간은 425.2의 유효 계수 (effective rank)를 달성하였으며, 이는 동일한 768차원인 DINOv2 CLS 특징 (376.1) 및 1024차원인 V-JEPA 2 (203.7)보다 높습니다. 실제로 동일한 모델을 재학습 없이 어떤 프레임 레이트에서도 생성할 수 있으며, 희소한 관측값으로부터 누락된 중간 프레임을 채워 넣을 수 있고, 심지어 적분 방향을 반전시켜 역방향 추론 (backward inference)을 수행할 수도 있습니다.
Tsinghua University Institute for AI Industry Research (AIR) × UC Berkeley BAIR · 분석: Tsinghua University Institute for AI Industry Research 출처
8GB 예산으로 구현하는 양손 조작: 엔트리급 Jetson에서의 실세계 배포 테스트 · manipulation
모방 학습 (Imitation learning) 정책은 거의 항상 워크스테이션 또는 데이터센터급 GPU에서 평가되며, 이를 임베디드 하드웨어에 배포할 때 발생하는 실제 비용은 거의 측정된 바 없습니다. 본 논문은 데스크톱 GPU를 오프라인 학습에만 사용하고, 전체 양손 SO-101 시스템을 **Jetson Orin Nano Super (8GB)**에 구겨 넣었습니다. 엔지니어링 측면에서 유용한 세 가지 발견 사항은 다음과 같습니다: ACT는 100,000 스텝 이내에 사용 가능한 성능으로 수렴하는 반면 (19/20회 성공), Diffusion Policy는 그 두 배의 스텝 후에도 여전히 수렴하지 않았습니다 (0/10회 성공); TensorRT로 변환 후, FP16은 추론 지연 시간 (inference latency)을 114.02ms에서 17.93ms로 단축시키며, INT8은 성공률 저하 없이 12.65ms까지 단축합니다; TensorRT의 일반적인 INT8 보정 (calibration)은 ResNet18 백본(backbone)만을 양자화하며, 145개의 트랜스포머 (transformer) 레이어 중 어느 것도 양자화되지 않았습니다 — 이는 크기가 거의 줄어들지 않았음에도 불구하고 왜 INT8이 FP16보다 여전히 28% 더 빠른지를 설명해 줍니다.
Ekansh Singh 외 · arXiv 2608.03938 source
오늘의 다른 논문들: UVT는 VLA 아키텍처를 수정하는 것이 아니라 지도 학습 목적 함수 (supervision objective)를 수정하며, 통합된 시각-운동 잠재 목표 (unified visual-motor latent goal)를 사용하여 동작과 장면 전환을 공동으로 인코딩합니다. 이는 제한된 학습 예산 하에서 가장 큰 이득을 얻었습니다 (arXiv 2608.03563 source); SARF는 비전 인코더 (vision encoder)만을 미세 조정 (fine-tuning)함으로써 물리적 적대적 패치 (physical adversarial patches)로부터 발생하는 "어텐션 하이재킹 (attention hijacking)"에 방어하며, LIBERO 환경에서 OpenVLA의 실패율을 100%에서 평균 28.6%로 낮추었습니다 (arXiv 2608.03231 source); Track4Action은 월드 프레임(world-frame) 3D 트래커를 VLA로 증류 (distill)하여, 배포 시점에 트래커가 필요하지 않도록 합니다 (arXiv 2608.03727 source); 계속할 것인가 아니면 재계획할 것인가? (Continue or Replan?)
VLA가 고정된 주기가 아닌 적응적으로 재계획(replan) 시점을 결정할 수 있도록 합니다 (arXiv 2608.03483 source); CUDA MPC는 전체 최적화 루프(optimization loop)를 GPU로 이동시켜, CPU 솔버(solver)보다 1~2 자릿수 더 긴 실시간 실행 가능한 호라이즌(horizon)을 달성합니다 (arXiv 2608.03051 source); LiLa-WAM은 월드-액션 모델(world-action model)을 단일 24GB GPU에서 엔드투엔드(end-to-end) 학습이 가능하도록 압축합니다 (arXiv 2608.03701 source); SLAMFormer-∞는 프론트엔드(front-end)나 백엔드(back-end) 모두에 명시적인 거리 상한선이 없는 최초의 기하학적 트랜스포머(geometric transformer)라고 주장합니다 (arXiv 2608.03429 source).
오픈 소스 · 도구 · 벤치마크
· Xiaomi-Robotics-1: Xiaomi의 Embodied Foundation Model이 오늘 공식적으로 오픈 소스로 공개되었습니다. 이는 실제 로봇 사후 학습(post-training)부터 배포에 이르는 전체 파이프라인과 벤치마크 재현 코드를 포함합니다. Xiaomi는 이 모델이 100,000시간 이상의 실제 로봇 조작(manipulation) 데이터와 10,000시간 이상의 교차 체형(cross-embodiment) 사후 학습을 통해 훈련되었으며, RoboCasa365에서 평균 57.4%, RoboCasa에서 74.5%의 성공률을 달성했다고 밝혔습니다. 가중치(weights)와 코드는 GitHub 및 Hugging Face에 게시되었습니다 source
· OpenETA: 디지털 에이전트(digital-agent) 패러다임을 물리적 세계로 가져오는 오픈 소스 구현체입니다. Planner가 한 번에 하나의 Tool 호출을 선택하면, Interface가 실행을 제어하고, World가 결과와 새로운 관측(observation)을 반환합니다. 이를 통해 로봇은 결과를 검증하고, 계획을 수정하며, 성공과 실패 모두를 재사용 가능한 경험으로 전환할 수 있습니다. 교체 가능한 Planner, 조합 가능한 Tools/Skills, 감사 가능한 메모리(auditable memory), 그리고 재생 가능한 궤적(replayable trajectories)을 제공합니다 (arXiv 2608.03924 source)
· Principles of Robot Autonomy: Marco Pavone 팀이 Stanford에서의 수년간의 강의 경험을 바탕으로 편찬한 로봇 자율성 (Robotic Autonomy) 교과서로, 고전 로봇 공학 (Classical Robotics)과 현대적 물리 AI (Physical AI)를 통합된 개념적 프레임워크 아래 연결하며, 각 주제에 대해 Jupyter notebook 및 구현 기반의 연습 문제를 제공합니다 (arXiv 2608.03496 source)
· HandTok: DigitCode와 함께 공개된 재현 가능한 손 동작 토크나이저 (Hand-motion Tokenizer) 테스트 베드로, 손의 해부학적 단위에 따라 기호적 표현 (Symbolic Representations)을 계층적으로 구성하여 양자화 오차 (Quantization Error)를 4분의 3 수준으로 줄였습니다 (arXiv 2608.03127 source)
II. Funding and Deals
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기