FutureX · Physical AI Daily — Issue 66 (07/23)
요약
Stanford의 Fei-Fei Li 팀이 15시간의 데이터만으로 학습 가능한 통합 월드 모델 'Masked Visual Actions'를 공개했습니다. 또한 IIT 연구팀은 인간과 로봇의 역학을 결합해 인체공학적 부담을 최적화하는 휴머노이드 'ergoCub'를 발표했습니다.
핵심 포인트
- Masked Visual Actions: 행동을 비디오 내 궤적으로 표현하여 월드 모델 학습 효율 극대화
- 단 15시간의 데이터로 다양한 장면과 형태에 걸친 정책 평가 및 계획 수행 가능
- ergoCub: 인간-로봇 역학을 고려하여 작업자의 인체공학적 부담을 줄이는 로봇 설계
- 로보틱스 분야의 주요 비즈니스 동향: J&J의 수술 로봇 승인 및 Futuring Robot의 유니콘 등극
오늘의 주요 뉴스
· Johnson & Johnson의 Ottava 수술 로봇이 FDA 승인을 받으며, 의료 기기 거대 기업이 복강경 로봇 공학 분야에 공식적으로 진입했습니다.
· 홈 로보틱스 스타트업 Futuring Robot이 1년도 채 되지 않아 세 번째 펀딩 라운드를 마감하며, Pre-A 라운드에서 **약 10억 위안(RMB)**을 조달하여 해당 분야의 첫 번째 유니콘 기업이 되었습니다.
· Fei-Fei Li의 World Labs가 로보틱스 시뮬레이션 기업인 SceniX를 인수하여, 생성된 세계를 훈련장으로 전환합니다.
· 미국 상장 수술 로봇 기업 Vicarious Surgical이 누적 20억 달러 이상을 조달했음에도 불구하고 **파산 청산(bankruptcy liquidation)**에 투표했습니다.
· Fei-Fei Li의 팀이 단 15시간의 데이터로 학습된 통합 월드 모델(world model)인 "Masked Visual Actions"를 공개했습니다.
I. 연구 진척 상황
Masked Visual Actions: 픽셀에 "행동(actions)"을 그려넣어 15시간의 데이터로 통합 월드 모델(world model) 학습하기 · world-model
비디오 모델은 세상이 어떻게 움직이고, 접촉하며, 반응하는지를 자연스럽게 학습합니다. 어려운 점은 항상 로봇의 "행동(actions)"을 모델이 이해할 수 있는 형태로 입력하는 것이었습니다. Stanford의 Fei-Fei Li 팀은 Masked Visual Actions를 제안합니다. 이는 행동을 비디오 내 특정 개체의 "부분적으로 드러난 궤적(partially revealed trajectory)"으로 표현하는 방식입니다. 로봇의 움직임을 드러내면 모델은 장면의 반응에 대한 순방향 역학 예측(forward dynamics prediction)을 수행하며, 대상 물체의 원하는 움직임을 드러내면 동일한 모델이 그 결과를 만들어내는 로봇의 행동을 추론할 수 있습니다. 실제 및 시뮬레이션된 마스크 샘플 단 15시간 분량으로 미세 조정(Fine-tuned)된 단일 가중치 세트는 여러 장면과 형태(embodiments)에 걸쳐 정책 평가(policy evaluation), 모델 기반 계획(model-based planning), 역행동 합성(inverse action synthesis)을 수행합니다.
Hadi Alzayer, Wenlong Huang et al.(Stanford)· arXiv 2607.19343 source · HF↑3 · Coverage: PaperWeekly source (WeChat, CN)
ergoCub: 하드웨어 최적화에 "인간의 부담"을 통합, Nature Machine Intelligence에 발표 · 보행 (locomotion)
이탈리아 기술 연구소 (IIT)의 연구팀이 _Nature Machine Intelligence_에 휴머노이드 로봇 ergoCub를 발표했습니다. iCub3를 기반으로 하여, 하드웨어를 고정된 샤시 (chassis)로 취급하는 대신, 연구팀은 결합된 인간-로봇 역학 (coupled human-robot dynamics)을 사용하여 "짐 운반 중의 인체공학적 부담"과 "로봇 자체의 보행 (locomotion)"을 공동으로 최적화합니다. 그런 다음 최적화된 구조적 비율을 실제 완전히 조립된 로봇으로 변환합니다. 이는 협동 운반과 같은 시나리오에서 작업자의 부하를 줄이기 위해, 인간의 부담을 최적화 가능한 설계 변수로 전환하는 것입니다.
IIT (Italian Institute of Technology) · Nature Machine Intelligence · Coverage: 科研灵感站 source (WeChat, CN)
Agentic Real2Sim: VLM 에이전트가 실제 세계의 장면을 실행 가능한 시뮬레이션으로 자동 도입하게 함 · 세계 모델 (world-model)
Real-to-sim (real2sim)은 기하학적 구조를 재구성할 뿐만 아니라 객체 상태를 복구하고, 물리적 파라미터 (physical parameters)를 추론하며, 카메라, 포즈 (pose), 궤적 데이터를 실행 가능한 물리 시뮬레이션으로 조립해야 하기 때문에 오랫동안 수작업에 크게 의존해 왔습니다. 이 연구는 시각-언어 에이전트 (vision-language agents)를 사용하여 해당 파이프라인을 자동화하며, "실제 세계 상호작용의 일부로부터 학습 가능한 시뮬레이션을 생성"하는 방향으로 나아가고 체화된 데이터 (embodied data) 수집 비용을 낮추고 있습니다.
Guanxiong Chen et al. · arXiv 2607.19190 source
WorldScape Policy 2.0: 세계-행동 모델에 "추론 증강 메모리" 추가 · 세계 모델 (world-model)
세계-행동 모델 (World-action models, WAMs)은 시각적 상태 전이 (visual state transitions)와 로봇 행동을 공동으로 모델링하여 조작 (manipulation)을 수행하지만, 장기적 과업 (long-horizon tasks)에서 "망각"하는 경향이 있습니다. 버전 2.0은 추론 증강 메모리 (reasoning-augmented memory) 메커니즘을 도입하여, 긴 시간 지평 (long time horizons) 동안 세계 모델링 (world modeling)을 더욱 제어 가능하고 조종 가능하게(steerable) 만들며, 다단계 조작 (multi-step manipulation) 전반의 일관성을 향상시킵니다.
Haisheng Su 외 · arXiv 2607.18840 source
RoboInter1.5: 체화된 세계 모델링을 위한 "중간 표현 (intermediate representations)" 풀 세트 · benchmark
기존의 로보틱스 데이터셋은 비용이 많이 들고, 단일 체화 (single embodiment)에 종속되어 있으며, 일반화 가능한 추론 (generalizable reasoning)과 장기적 환경 역학 (long-horizon environment dynamics)에 필요한 세밀한 주석 (fine-grained annotations)이 부족합니다. RoboInter1.5는 체화된 세계 모델링 (embodied world modeling) 및 조작을 위한 중간 표현 (intermediate representations)의 통합된 세트를 제공하며, 세계 모델 (world models)과 정책 (policies) 사이의 범용 인터페이스로서 "재사용 가능한, 교차 체화 (cross-embodiment)" 구조화된 주석의 공백을 메우는 것을 목표로 합니다.
Ziqin Wang 외 · arXiv 2607.18709 source
Athena-Brain: 엣지 배포를 위한 효율적인 "로봇 브레인" 기술 보고서 · vla
체화된 에이전트 (embodied agents)의 능력이 향상됨에 따라, 업계에서는 대규모 모델의 일반 지식과 추론 능력을 유지하면서도 로봇 자체 하드웨어에 탑재할 수 있는 컴팩트한 "브레인 (brain)"이 필요합니다. Athena-Brain은 엣지 배포 (edge deployment)에서의 효율성을 최적화하여, 일반 지능과 온디바이스 (on-device) 환경에서의 체화된 환경과의 고수준 상호작용 사이의 균형을 맞추는 것을 목표로 합니다.
Jialian Li 외 · arXiv 2607.18985 source
오늘의 다른 논문들: STeP은 신호 시공간 논리 (Signal Temporal Logic)를 사용하여 VLA (Vision-Language-Action) 모델에 정밀한 공간적/시간적/논리적 제약 표현을 제공합니다 (arXiv 2607.18580 source); MVP-Tac, 최소 침습 수술을 위한 소형 시각-광탄성 이중 모드 촉각 센서 (arXiv 2607.18660 source); The Open Ant, Sim-to-Real (시뮬레이션에서 실세계로의 전환)을 단순화하는 오픈 소스 저비용 실로봇 강화학습 (Reinforcement Learning) 플랫폼 (arXiv 2607.18488 source); No Training, Better Flights는 훈련 없이 VLM (Vision-Language Model) 드론 내비게이션을 개선하기 위해 테스트 시간 스케일링 (Test-time Scaling)을 사용합니다 (arXiv 2607.19288 source); Recti-Q, 에지 로봇 (Edge Robots)을 위한 분포 외 (Out-of-distribution) 강건 양자화 인식 추론 (Quantization-aware Inference) (arXiv 2607.18540 source); MAGE는 칩 매크로 셀 배치를 위해 멀티모달 에이전트 (Multimodal Agents)를 사용합니다 (arXiv 2607.18536 source).
오픈 소스 · 도구 · 벤치마크
· NVIDIA, 의료 물리 시뮬레이션 프레임워크 오픈 소스 공개: Nvidia는 수술 로봇의 훈련 및 검증을 위한
이번 라운드에서는 기존 주주인 Yuanlai Capital, Linkedu Capital, Boyu Capital의 후속 투자가 이어졌으며, 중국의 선도적인 인터넷 기업인 CHJ Capital (Inovance의 투자 부문), Guofang Venture Capital, Deling Capital 등이 참여했습니다. 이는 이 회사의 올해 세 번째 펀딩 라운드로, 누적 투자액은 **약 10억 위안 (RMB 1 billion)**에 달하며, 이는 중국 범용 로봇 (general-purpose robotics) 분야에서 기록적인 수치입니다. 이 회사는 소비자 대상 범용 가정용 로봇에 집중하고 있으며, 자사 제품이 500개 이상의 가구에 보급되었다고 밝혔습니다. 정교한 손 (dexterous hands) 및 휴머노이드 플랫폼으로 자본이 집중되는 상황 속에서, 소비자 대상 가정용 로봇 기업에 대한 이러한 이례적인 베팅은 현재 로봇 공학 투자 흐름의 주석과도 같습니다. 즉, 열정은 재점화되었으나 주문과 실제 현장 배치 (real-world deployment)에 더욱 날카로운 초점을 맞추고 있다는 점입니다. 출처: 极客公园 (GeekPark) source (WeChat, CN)
Gritt (미국)|pre-seed + Series A|3,240만 달러 (≈2억 2,000만 위안) · 산업용
이 중 2,600만 달러 규모의 Series A 라운드는 Obvious Ventures가 주도하였으며, Union Square Ventures 등이 참여했습니다. 이 회사는 Carnegie Mellon의 Robotics Institute 출신인 Puneet Puri가 공동 창업하였으며, 건설 현장을 위한 "물리적 AI (physical AI)"를 구축합니다. 이는 로봇 팔과 AI를 결합하여 기존 작업 현장 장비에 부착물 형태로 장착하며, 자재 운반 및 조립과 같이 강도가 높고 반복적인 작업에서 건설 노동자들과 함께 협업합니다. 회사 측은 손상 없이 수만 개의 태양광 패널을 자율적으로 설치했으며, 미국 10대 건설 기업의 작업 현장에 진입했다고 밝혔습니다. 이들의 진입점은 2031년까지 미국 건설 인력의 41% 이상이 은퇴할 것으로 예상됨에 따라 나타날 노동력 부족 문제입니다. 출처: 智东西 (AI/robotics 미디어) source
Wenshi Robotics|Series A+|금액 미공개 · 산업용
전 시나리오 물류 로봇 솔루션 제공업체인 이 회사의 이번 라운드는 Jinfu Capital의 지원을 받았습니다. 2022년 Pre-A 라운드와 2023년 Series A에 이어, 이번 라운드는 세 차례 연속된 기관 투자 라운드로, AI 스마트 창고 부문으로의 지속적인 자본 유입을 시사합니다. 출처: 第一机器人 (robotics 미디어) source (WeChat, CN)
III. 상용화 및 배포 (Commercialization & Deployment)
Johnson & Johnson의 Ottava 수술 로봇, FDA 승인 획득 · 인접 분야
Johnson & Johnson의 Ottava 연조직 수술 로봇 시스템이 미국 FDA로부터 승인을 받았습니다. 이는 의료 기기 거대 기업이 Intuitive Surgical의 da Vinci 시스템이 오랫동안 지배해 온 복강경 수술 로봇 시장에 공식적으로 진입했음을 의미합니다. 이는 단순한 데모나 계획이 아닌 진정한 규제적 이정표(regulatory milestone)이며, 수술 로봇 분야의 경쟁 구도에 대한 실질적인 신호입니다. 출처: MassDevice source
Aurora, 미국에서 2세대 자율주행 트럭 출시 · 자율주행 (autonomy)
자율주행 화물 운송 기업인 Aurora는 고객 수요를 충족하기 위해 미국에서 2세대 자율주행 트럭의 출시를 발표했습니다. Aurora는 이미 텍사스에서 상업적 자율주행 대형 트럭 화물 운송 운영을 달성했습니다. 이번 2세대 출시는 최초의 도로 데뷔가 아니라, 기존의 실제 운영을 기반으로 한 확장입니다. 출처: Yahoo Finance source
신장(Xinjiang), 108개 암(arm)을 가진 면화 톱핑 로봇 배치 · 인접 분야 (adjacent)
신장 지역은 면화 톱핑(terminal bud를 제거하는 작업)을 위해 **108개의 암(arm)**을 가진 로봇을 배치하여, 상당한 수동 노동을 대체하고 인건비를 절감했습니다. 개방적이고 비정형적인(unstructured) 농업 환경은 오랫동안 자동화에 저항해 왔으며, 이러한 다중 암(multi-arm) 구조의 목적 특화된 폼 팩터(form factor)는 로봇 공학을 실제 현장에 도입하는 실용적인 방법입니다. 출처: Big News Network source
Wetour Robotics, 50만 달러 규모의 창고 배치 주문 수주 · 산업 (industrial)
Wetour Robotics는 약 50만 달러 규모의 창고 배치 주문을 체결했으며, 자사의 프레임워크가 미국 전역의 최대 20개 창고까지 확장될 가능성이 있다고 밝혔습니다. "20개 창고"라는 수치는 확장 목표이며, 이미 인도된 규모가 아닙니다. 현재 실제 배치는 이 단일 주문 상태입니다. 출처: Investing.com
IV. 산업 동향 (Industry Developments)
Fei-Fei Li의 World Labs, 로봇 시뮬레이션 기업 SceniX 인수 · 월드 모델 (world-model)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기