FutureX · Physical AI Daily — Issue 67 (07/24)
요약
Physical AI 및 로보틱스 분야의 대규모 투자 소식과 Tesla의 실적 악화 등 산업 동향을 다룹니다. 또한 로봇의 단일 영상 기반 기술 습득 및 휴머노이드 동작 제어에 관한 최신 연구 성과를 함께 소개합니다.
핵심 포인트
- Atoms의 17억 달러 투자 유치 및 산업용 Physical AI 시장 확대
- Tesla 2분기 영업 이익 57% 감소 및 Optimus 생산 기대치 조절
- Psibot 및 HiDream 등 Embodied-AI 및 월드 모델 스타트업의 대규모 펀딩
- HOST: 단일 영상으로 수 초 내 새로운 조작 기술을 학습하는 연구
- YAHMP: 휴머노이드 동작 모방을 위한 오픈 소스 프레임워크 공개
오늘의 하이라이트
· Atoms가 a16z의 주도로 17억 달러 규모의 투자 유치를 마감했으며, Uber의 창립자 Kalanick은 산업용 Physical AI (물리적 AI)에 베팅하고 있습니다.
· 거의 3개월간의 중단 이후, 중국이 로보택시 (robotaxi) 허가를 재개했으며, Momenta와 Baidu가 첫 승인을 받았습니다.
· Tesla의 2분기 영업 이익이 57% 감소하며 절반으로 줄어들었으며, Musk는 Optimus의 대량 생산에 대한 기대치를 조절하고 있습니다.
· Psibot (중국의 Embodied-AI (체화된 AI) 스타트업)이 14.8억 달러의 기업 가치로 약 1억 달러를 조달하며, Chery가 주도한 이번 라운드를 통해 새로운 유니콘 기업이 되었습니다.
· 월드 모델 (World models)이 계속해서 자본을 끌어모으고 있습니다: HiDream (중국의 월드 모델 스타트업)이 15억 위안 규모의 Series C 투자를 마감했으며, 3개월 동안 총 21억 위안 이상의 3차례 라운드를 진행했습니다.
1. 연구 진척 상황
HOST: 로봇이 단 하나의 인간 영상을 시청한 후 몇 초 만에 새로운 조작 기술을 학습함 · manipulation (조작)
기존의 모방 학습 (Imitation learning)은 새로운 기술마다 시간이 많이 소요되는 훈련 루프를 필요로 하며, 종종 모델이 이전에 마스터한 기술을 "망각"하는 문제를 일으킵니다. HOST (Human-to-robot One-Shot Skill AcquisiTion)는 기존 능력을 잊지 않으면서 단 하나의 인간 영상으로부터 몇 초 만에 새로운 기술을 습득합니다. 이는 "사용하면서 배우는" 과정을 훈련 시간 루프에서 거의 즉각적인 원샷 정렬 (one-shot alignment)으로 압축하며, 인간이 학습하는 방식에 더 가까운 지속 학습 (Continual-learning) 패러다임을 향한 단계입니다.
Guangyan Chen 외 · arXiv 2607.20033 source
전신 휴머노이드 동작 추적(Whole-body humanoid motion tracking)에서 실제로 중요한 것은 무엇인가? 실증적 분석 · locomotion (이동)
휴머노이드가 넘어지지 않고 다양한 전신 참조 동작을 따르게 하는 데에는 수많은 모델링 및 하이퍼파라미터 (Hyperparameter) 선택이 포함되며, 각각의 개별적인 영향력을 분리해내기는 어렵습니다. 본 논문은 최근 휴머노이드 동작 모방 파이프라인의 공통 요소들에 대해 체계적인 **소거 연구 (Ablation studies)**를 수행하며, Unitree G1에서 훈련, 평가 및 배포가 가능한 모듈형 프레임워크인 YAHMP를 오픈 소스로 공개합니다. 이는 휴머노이드 이동 제어 (Locomotion control)를 연구하는 팀들이 즉시 재사용할 수 있는 엔지니어링 레시피입니다.
Fabio Amadio, Enrico Mingo Hoffman (HUCEBOT) · arXiv 2607.19903 source
Extreme-RGMT: 일상적인 안정성을 유지하면서 휴머노이드가 극한의 동작을 학습하게 하기 · 이동 제어 (locomotion)
범용 동작 추적 정책 (General-purpose motion-tracking policies)은 드물고 매우 역동적인 기동을 안정적으로 실행하는 데 어려움을 겪는 반면, 특화된 학습은 이미 학습된 일상적인 동작을 저하시키는 경우가 많습니다. 본 논문은 **2단계 지속 학습 (two-stage continual learning)**을 사용하여 범용성 대 전문성 사이의 트레이드오프 (trade-off)를 해결하며, 극한의 동작에 대한 성공률을 크게 향상시키는 동시에 범용 전신 동작 추적 (general whole-body motion tracking)에서 SOTA (State-of-the-art)를 달성했다고 주장합니다.
Yubiao Ma et al. · arXiv 2607.20110 source
Toyota Research Institute: 빙판길에서의 능동적인 "드리프트"가 최적의 충돌 회피 전략임이 밝혀지다 · 자율 주행 (autonomy)
큰 미끄러짐을 동반하는 드리프트 (Large-slip drifting)는 주로 의도적으로 연출된 시나리오에서 검증되어 왔기에 그 실질적인 가치가 불확실했습니다. Toyota Research Institute (TRI)의 이 논문은 "실제 겨울철 운전 조건에서 드리프트가 안전을 위해 실제로 언제 최적인가"라는 질문에 직접적으로 답합니다. 마찰력이 낮은 빙판길에서 능동적으로 높은 사이드슬립 (high-sideslip) 드리프트에 진입하는 것은 특정 조건 하에서 충돌을 피하기 위한 더 나은 해결책이 될 수 있으며, 이는 겉보기에 화려해 보이는 기동을 심각한 운전 안전 문제와 다시 연결합니다.
Elliot Weiss, Thomas Lew, John Subosits et al. (Toyota Research Institute, TRI) · arXiv 2607.19484 source
Milo: 최초의 오픈 소스, 저비용 자율 안내견 로봇 · 자율 주행 (autonomy)
실제 안내견은 확보 및 유지하는 데 약 $50,000의 비용이 들고, 대기 명단이 길며, 서비스 수명이 짧습니다. Milo는 최초의 오픈 소스, 저비용 안내 로봇 플랫폼이라고 주장하며, 경로 유지, 장애물 및 사람 회피와 같은 기본적인 안내견 협력 네비게이션 작업을 사전 환경 매핑 없이 온보드에서 완전히 자율적으로 (fully autonomously onboard) 수행하여 보조 이동성을 위한 접근성을 높입니다.
Florian Golemo, Christopher Pal 외 (Mila 및 기타) · arXiv 2607.19530 source
KineBench: 역동역학 (inverse dynamics)을 우회하는 "체화된 세계 모델 (embodied world models)"을 위한 폐루프 점검 · 벤치마크 (benchmark)
세계 모델 (world models)의 물리적 일관성을 평가할 수 있는 신뢰할 만한 척도가 오랫동안 부재해 왔으며, 거의 모든 기존의 폐루프 (closed-loop) 평가는 행동 (actions)을 추출하기 위해 역동역학 모델 (IDM)에 의존하여 추가적인 오차를 유발합니다. KineBench는 **명시적 운동학적 접지 (explicit kinematic grounding)**를 사용하여 최초의 IDM-free 폐루프 벤치마크를 구축하였으며, 체화된 비디오 생성 (embodied video generation)이 "작업 복잡도에 따라 정체되는 비선형적 스케일링 (nonlinear scaling)"을 보인다는 점을 발견했습니다. 이는 향후 데이터 스케일링 (data scaling)을 위한 경험적 가이드를 제공합니다.
Zeyu Liu 외 · arXiv 2607.19876 source
LENS: 플래너 (planner)에게 넘기기 전 대규모 모델이 복잡한 장면을 "단순화"하도록 하기 · 조작 (manipulation)
밀집된 다중 객체 적재 (multi-object stacks)는 오늘날 주류 조작 (manipulation) 방법론에 있어 여전히 어려운 사례로 남아 있습니다. 즉, 많은 객체, 많은 충돌, 예측하기 어려운 접촉 물리 (contact physics)가 존재합니다. LENS는 대규모 모델을 사용하여 장면 특화적이고 작업 특화적인 (scene-specific, task-specific) 추상화 계층을 즉석에서 생성하며, 이를 기존의 계획/제어 (planning/control) 스택 상단에 연결합니다. 이는 고전적 계획 (classical planning), 모델 기반 제어 (model-based control), 그리고 VLA 모델 모두를 개선하는 것으로 나타났습니다.
Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa (UPenn, MIT) · arXiv 2607.19633 source
오늘의 다른 논문들: Koopman Dreamer, 월드 모델 (world models) 내에서 장기적 "상상 (imagination)"을 안정화하기 위해 스펙트럼 제약이 있는 결정론적 잠재 역학 (spectrally-constrained deterministic latent dynamics)을 사용함 (arXiv 2607.19719 source); Diffusion ReRoll, 로봇 시퀀스 예측 (robot sequence prediction)에 대한 분포 외 (out-of-distribution) 성능을 향상시키는 수정 가능한 디노이징 (revisable denoising) (arXiv 2607.19919 source); Defer to Plan, 엔드투엔드 (end-to-end) V2X 주행을 위한 적응형 멀티 에이전트 융합 (adaptive multi-agent fusion) (arXiv 2607.19774 source); SeededGrasp, 복잡한 멀티-엠보디먼트 (multi-embodiment) 장면에서 파지 (grasping)를 안내하는 "시드 포인트 (seed points)"를 예측하기 위해 VLM을 사용함 (arXiv 2607.20207 source); EgoRecovery, 1인칭 인간의 "실패-회복 (failure-recovery)" 영상으로부터 오류 수정 능력을 학습함 (arXiv 2607.19745 source); ReferTrack, 단안 "참조 후 추적 (refer-then-track)" 임보디드 시각 추적 (embodied visual tracking) (arXiv 2607.20061 source); 효율성과 분포 외 (out-of-distribution) 일반화 사이의 균형을 맞추기 위해 대규모 VLA 강화학습 (reinforcement learning)에 오프라인 지도 학습 (offline supervision)을 주입함 (arXiv 2607.19399 source); NavVerse, 실내에서 실외로 이어지는 연속적 내비게이션 벤치마크 (arXiv 2607.19695 source); DINS-IO, 위치 라벨 없이 수행되는 자기 지도 학습 기반 관성 오도메트리 (self-supervised inertial odometry) (arXiv 2607.20232 source).
오픈 소스 · 도구 · 벤치마크
· Unitree UnifoLM-OminiA-0.3: 대량 생산 벤치마크인 G1에 맞춰 조정된 옴니모달 (omni-modal) 실시간 상호작용 임보디드 거대 모델 (embodied large model)으로, "단일 모델, 전체 파이프라인 + 직접 음성 제어"에 초점을 맞추고 있으며, UnifoLM 제품군의 세 번째로 공개된 노드임 source (WeChat, CN)
· AIRobot (중국 산업용-VLA 스타트업): 단 0.89B개의 파라미터(parameters)만으로 산업용 Embodied-AI 리더보드에서 1위를 차지하고 "π0를 능가한다"고 주장함 ⚠️ 업체 측 주장이며, 산업 시나리오를 위한 소형 파라미터 엔드투엔드(end-to-end) 정책으로 포지셔닝됨 source
2. 투자 및 거래 (Funding and Deals)
Atoms (미국) | 신규 라운드 | 약 $1.7B · 산업용
a16z가 주도하였으며 Ben Horowitz가 이사회에 합류함; 공동 투자자로는 Bain Capital, Fifth Wall, K5 Global, SV Angel, 그리고 창업자가 퇴출당했던 회사인 Uber가 포함됨. Bank of America, Goldman Sachs, JPMorgan이 부채 파트너로 나열됨. Atoms는 Uber의 공동 창업자인 Travis Kalanick이 설립하였으며, 소프트웨어, 센싱(sensing), 로봇 자동화를 사용하여 "제조, 이동, 창고 관리"를 처리함으로써 식품, 광업, 운송과 같은 물리적 섹터를 위한 산업용 AI에 집중함. 이는 올해 물리적 AI 분야에서 가장 큰 규모의 단일 지분 조달 중 하나이며, 산업 측면의 Embodied AI에 대한 미국 최상위권 VC들의 베팅 규모를 보여줌. 출처: TechCrunch source
Psibot (중국 Embodied-AI 스타트업) | 신규 라운드 | 약 $100M | 기업 가치 $1.48B · Embodied
자동차 제조사인 Chery가 주도하였으며, Lens Technology (Apple 및 Tesla의 부품/센서 공급업체) 등이 참여함; 2024년에 설립된 이 회사는 현재까지 약 $300M를 조달했으며 이번 라운드를 통해 유니콘 기업이 됨. Psibot의 초점은 장기 과제 수행(long-horizon task execution)을 목표로 하는 엔드투엔드 강화학습 (end-to-end reinforcement learning) Embodied 모델인 Psi R0/R0.5/R1 시리즈임. 이미 물류 고객사의 창고에서 소규모 분류 검증을 수행함. 출처: Bloomberg, Tech in Asia source
HiDream (중국 월드 모델 스타트업) | 시리즈 C | RMB 1.5B (4월 이후 3개 라운드에 걸쳐 총 RMB 2.1B 이상) · 월드 모델 (world-model)
4월의 5억 위안(RMB) 이상의 라운드와 5월의 수억 위안 규모 라운드에 이어, 이 회사는 7월에 또 다른 15억 위안(RMB) 규모의 시리즈 C(Series C)를 마감했습니다. 이는 3개월 동안 3번의 라운드를 거치며 총 21억 위안(RMB) 이상을 확보한 것입니다. 이러한 자금 조달 속도 자체가 하나의 산업적 신호입니다. 자본의 관심이 언어 모델(language models)에서 '월드 모델 (world models)'로 이동하고 있으며, 현실 세계의 인지-시뮬레이션-상호작용(perception-simulation-interaction)이 가장 뜨거운 타겟이 되고 있습니다. 같은 날, 칭화대학교(Tsinghua University) 출신 팀인 PrimalVerse 또한 기초적인 4D 월드 모델에 베팅하며 수억 위안 규모의 시드(seed) 라운드를 마감했습니다. 출처: AI How source (WeChat, CN)
Ropedia (싱가포르) | Pre-A | 3,000만 달러 ($30M) · 인접 분야 (adjacent)
핵심 팀은 칭화대학교(Tsinghua University), Meta, Google, UC Berkeley 출신으로 구성되어 있으며, Google, Nvidia, Amazon의 엔젤 투자자들로부터 지원을 받고 있습니다. Ropedia는 **물리적 AI 데이터 인프라 (physical AI data infrastructure)**를 구축합니다. 이들은 현실 세계 환경에서 멀티모달(multimodal) 인간 경험을 수집, 재구성 및 인지하는 독자적인 웨어러블/모바일 캡처 장치를 통해 로봇 학습 데이터 수집 비용을 약 50배 절감할 수 있다고 주장합니다. 데이터 인프라는 체화된 AI (embodied-AI) 투자 분야의 또 다른 핫스팟이 되고 있습니다. 출처: SiliconANGLE source
LumiBot (중국 정교한 손(dexterous-hand) 스타트업) | 엔젤 라운드 (Angel round) | 수천만 위안 (RMB) · 하드웨어 (hardware)
Changyou Technology 산하 펀드가 주도하고 두 개의 국영 플랫폼 펀드가 공동 투자했습니다. 창업자는 전직 월스트리트 투자자이며, 이 회사는 정교한 손 조작(dexterous-hand manipulation) 솔루션에 집중하고 있습니다. 또한 이들은 **세계 최초의 능동 냉각 방식 정교한 손 (world's first actively-cooled dexterous hand)**인 Lumi-Dex를 홍보하며, 이미 판매를 시작했다고 밝혔습니다. 이번 라운드의 자금은 대량 생산 확대에 투입될 예정입니다. 출처: cyzone.com source
Horizon Robotics (9660.HK) | 채권 발행 계획 | 4억 5천만 달러 규모의 무이표 전환사채 (zero-coupon convertible notes) · 자율주행 (autonomy)
Goldman Sachs와 Morgan Stanley가 인수할 예정이며, 이로써 누적 자금 조달액은 200억 위안(RMB)을 넘어설 전망입니다. 자율주행 칩 및 솔루션 제조사인 Horizon Robotics는 Volkswagen과의 협력이 심화되는 시점에 이번 저금리 전환사채를 통해 자본 reserves (자본 예비금)를 확충합니다. 출처: Sina Finance source
이전에 보고된 바 있어 이번 라운드에서는 제외되었습니다: Weilai Buyuan의 약 10억 위안 규모 Pre-A, Agibot의 200억 달러 기업 가치 목표 IPO 추진, Yuequan Bionic의 Pre-A+, 그리고 Shihe Robotics의 Series C — 이번 기간 중 중요한 새로운 진전 사항은 없습니다 (이미 보고됨).
3. 상용화 및 배포 (Commercialization and Deployment)
Baidu의 Apollo Go, 27일부터 홍콩에서 완전 무인 주행 테스트 시작 · 자율주행 (autonomy)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기