FutureX · Physical AI Daily — Issue 65 (07/22)
요약
Alibaba의 RynnBrain 1.1과 Qwen-VLA 등 로보틱스를 위한 최신 Embodied Foundation Model 연구를 소개합니다. 특히 RynnBrain 1.1은 122B 규모로 공간 추론 리더보드에서 폐쇄형 모델을 능가하는 성능을 보여주었습니다.
핵심 포인트
- Alibaba RynnBrain 1.1은 122B 규모의 오픈 웨이트 모델로 공간 추론 성능 우수
- Nvidia Cosmos 3 Edge 오픈 소스 공개로 온디바이스 월드 모델 지원
- Qwen-VLA는 조작과 내비게이션을 단일 정책으로 통합하는 접근 방식 제시
- Samsung의 로보틱스 부문 RX 설립 및 AGIBOT의 IPO 추진 등 산업 동향 포함
오늘의 하이라이트
· Samsung이 CEO 직속 로보틱스 부문인 RX를 설립하고, 전 Boston Dynamics 전략 책임자를 영입했습니다.
· AGIBOT(중국 휴머노이드 로보틱스 스타트업)이 올해 매출 40억 위안(RMB)을 예상하며, 200억 달러의 기업 가치로 IPO를 추진 중인 것으로 알려졌습니다.
· Nvidia가 Cosmos 3 Edge를 오픈 소스로 공개했습니다. 이는 로봇의 온디바이스(on-device)에서 직접 동작을 생성하는 4B 파라미터 규모의 월드 모델(world model)입니다.
· Momenta가 심천(Shenzhen)에서 Robotaxi 도로 주행 테스트 허가를 확보했으며, 주가는 하루 만에 10% 이상 상승했습니다.
· Alibaba가 122B 규모의 Embodied Foundation Model(체화된 기초 모델)인 RynnBrain 1.1을 출시하여, 3개의 공간 추론 리더보드에서 폐쇄형(closed-source) 모델들을 능가했습니다.
I. 연구 진행 상황 (Research Progress)
RynnBrain 1.1: 122B Embodied Foundation Model이 3개의 공간 추론 리더보드에서 폐쇄형 모델들을 능가하다 · vla
Alibaba DAMO Academy는 자사의 오픈 소스 Embodied Foundation Model을 122B-A10B 규모로 확장했습니다. 이는 현재 공개적으로 사용 가능한 오픈 웨이트(open-weight) 계층 중 가장 큰 규모이며, HF 트렌드는 **30↑**를 기록하고 있습니다. 버전 1.0과 비교했을 때, 전체 라인업에는 접촉점 예측(contact-point prediction) 기능이 추가되었으며, 2B/9B 변체(variants)는 네이티브 3D 그라운딩(3D grounding) 기능을 갖추어 출력이 실제 기계적 조작(mechanical manipulation)과 더욱 밀접하게 정렬되도록 했습니다. 함께 제공되는 RynnBrain-VLA는 통합된 교차 체화 동작 공간(unified cross-embodiment action space)과 체화별 마스크(embodiment-specific masks)를 사용하며, 이미 Unitree G1, Astribot-S1, Tianji Wuji 등 세 가지 로봇 플랫폼에 배포되었습니다. 122B-A10B 모델은 논문에서 평가된 VSI-Bench, MMSI, RefSpatial-Bench의 모든 폐쇄형 및 오픈 소스 모델을 능가합니다. 실제 로봇 실험에서 이 모델로 초기화된 정책(policies) 또한 Qwen 시리즈 및 주요 범용 VLA(Vision-Language-Action) 모델보다 뛰어난 성능을 보였습니다.
Kehan Li 외 (Alibaba DAMO Academy) · arXiv 2607.17977 source
Qwen-VLA: 조작(Manipulation), 내비게이션(navigation), 그리고 인간의 1인칭 데이터를 단일 정책으로 통합하다 · vla
Qwen 팀은 파편화(fragmentation) 문제를 해결하고자 합니다. 요리를 할 수 있는 양팔 로봇은 걷지 못하고, 그 반대도 마찬가지라는 점입니다. 즉, 조작(manipulation) 암은 관절 포즈(joint poses)를 예측하는 반면 내비게이션(navigation) 로봇은 웨이포인트(waypoints)를 예측하며, 역사적으로 이 두 가지를 하나의 모델로 공유하는 것은 어려웠습니다. 이들의 접근 방식은 Qwen3.5-4B를 인지적 백본(cognitive backbone)으로 사용하고 이를 DiT 플로우 매칭(flow-matching) 액션 디코더(action decoder)에 연결한 뒤, "체화 인지 프롬프트(embodiment-aware prompts)"를 통해 로봇의 형태(morphology)와 제어 모드를 입력 텍스트에 작성함으로써 아키텍처를 변경하지 않고도 동일한 잠재 공간(latent space)을 공유합니다. 단일 범용 모델(single generalist)로서, 이 모델은 LIBERO에서 97.9%, 실제 양팔 ALOHA 플랫폼의 분포 외(out-of-distribution) 일반화 성공률에서 76.9%, 그리고 RoboCasa-GR1에서 56.7%를 달성하며 해당 플랫폼에 특화되어 미세 조정(fine-tuned)된 모델들을 능가했습니다.
Qwen Team · arXiv 2605.30280 source · 분석: 체화된 지능(Embodied Intelligence)과 공간 인지(Spatial Perception) source (WeChat, CN)
Patch Policy: VLM의 부담 없는 조밀한 시각적 특징 · manipulation
Yann LeCun이 기여자로 참여한 이 연구는 까다로운 트레이드오프(tradeoff)를 지적합니다. 로봇 정책은 각 프레임을 단일 글로벌 토큰(global token)으로 압축하여 공간적 세부 정보를 잃거나, 아니면 수십억 개의 파라미터를 가진 VLM의 전체 추론 비용을 감당해야 합니다. 저자들은 단순히 블록 인과적 어텐션 마스크(block-causal attention mask)를 추가하여, 일반적인 트랜스포머(transformer) 정책이 시간적 인과성(temporal causality)을 유지하면서 사전 학습된 ViT로부터 조밀한 패치 토큰(dense patch tokens)을 직접 소비할 수 있도록 했습니다. 4개의 시뮬레이션 스위트와 3개의 실제 로봇 환경에 걸쳐, 이 방식은 글로벌 풀링된 표현(global pooled representations)보다 40% 향상된 성능을 보였습니다. 또한, 미세 조정된 OpenVLA-OFT보다 18% 뛰어난 성능을 보이면서도 파라미터는 약 **0.7%**만을 사용합니다.
Gaoyue Zhou et al. (NYU) · arXiv 2607.18236 source
POT-VLA: 휴머노이드에게 "물체가 여전히 그곳에 있다"는 기억을 부여하여 성공률을 39/80에서 71/80으로 향상 · locomotion
장기적(long-horizon) 휴머노이드 loco-manipulation(이동-조작)의 숨겨진 실패 모드는 "물체 상태의 발산(object state divergence)"입니다. 즉, 전신 동작(whole-body actions)을 구동하는 데 사용되는 물체 상태와 동작이 목표를 달성했는지 판단하는 데 사용되는 상태가 실제로는 서로 다른 두 개의 표현(representation)이라는 점입니다. 저자들은 RGB-D 입력으로부터 역할 인덱스가 지정된 3D 물체 기록을 유지하기 위해 지속적인 물체 토큰(persistent object tokens)을 사용하며, 동일한 기록이 동작 생성의 조건(conditioning)이 되는 동시에 기하학적 술어 검증(geometric predicate verification)을 지원함으로써 실행 루프를 완성합니다. Unitree G1을 이용한 8가지 실제 작업 범주 전반에서, 정렬된 GR00T-N1.7 베이스라인은 39/80에서 71/80으로 개선되었습니다.
Peng Ren et al. · arXiv 2607.18016 source
PolicyTrim: 재학습 없이 VLA가 우회하는 것을 방지하도록 교육 — 엔드투엔드(end-to-end) 속도 최대 5.83배 향상 · vla
VLA 배포를 실제로 늦추는 것은 종종 단일 추론 지연 시간(single-inference latency)이 아니라, 정책(policy)이 얼마나 많은 재계획(replanning) 사이클과 실제 물리적 단계를 필요로 하는가입니다. Sichuan University 팀은 2단계 강화학습 (Reinforcement Learning) 사후 학습을 사용합니다. 먼저 모델이 신뢰할 수 있는 액션 청크(action-chunk) 실행 경계를 발견하도록 하고, 그다음 단계로 스텝 절약 보상(step-saving reward)을 사용하여 수정 및 후퇴 동작을 억제합니다. LIBERO에서 π0.5는 98% 이상의 성공률을 유지하면서 5.83배의 엔드투엔드 속도 향상을 달성했으며, 물리적 단계 수는 최대 51.4% 감소했습니다. 실제 Agilex Piper 로봇에서는 평균 1.86배의 속도 향상을 보였습니다.
Sichuan University, Lei Yinjie's team · arXiv 2606.22540 source · Analysis: AI Era (중국 AI 미디어 매체) source (WeChat, CN)
세계-행동 모델을 위한 테스트 시간 스케일링: 기하학적 일관성을 통한 제로샷 궤적 선택 · world-model
로봇은 언어 모델처럼 먼저 답변을 계산하고 나중에 선택할 수 없습니다. 행동은 즉시 실행되어야 하므로, 모델은 추가적인 컴퓨팅 자원을 사용하는 것이 가치가 있는지 실시간으로 판단해야 합니다. 저자들은 세계-행동 모델이 각 롤아웃(rollout)에서 행동 청크와 예측된 미래 관측치를 모두 방출한다는 사실을 활용하여, 고정된 기하학적 파운데이션 모델(geometric foundation model)을 사용하여 크로스뷰 깊이 리프로젝션 일관성(cross-view depth reprojection consistency)을 계산하고 후보를 순위 매기며, 이를 위해 훈련이나 태스크 레이블이 필요하지 않습니다. RoboCasa의 그룹 평균 점수는 66.3%에서 **68.4%**로 상승했으며, 일관성 게이팅(consistency gating) 추가 시 결정 지점의 단지 **26.2%**에서만 추가 샘플링이 트리거되어 항상 활성화된 모드(always-on mode)가 달성한 이득의 74.8%를 회복했습니다.
Zesen Zhao 외 · arXiv 2607.17454 source
JEPA 세계 모델에 깊이 사전 지식(depth prior)을 추가하면 18M 파라미터 모델이 야외 데이터 처리 가능 · world-model
복잡하고 예측 불가능한 실세계의 로봇 비디오는 오랫동안 JEPA 스타일의 세계 모델에게 어려움이었습니다. 저자들은 훈련 중에 깊이 감독(depth supervision)과 등방성 잠재 공간 정규화(isotropic latent-space regularization)를 도입하여, 추가적인 추론 비용 없이 훈련 시에만 과매개변수화(over-parameterizing)합니다. 농업 로봇 비디오로 18M 파라미터 모델을 훈련했을 때, 고정된 표현의 시각 오도메트리 프로브(visual odometry probe)에서의 오류는 LeWM 기준선보다 33% 낮았으며, 도메인 외부의 TartanGround에서도
직관적으로, 추론 단계 (reasoning steps)를 갖춘 정책 (policies)은 교란 (disturbances)을 더 잘 흡수해야 합니다. 저자들은 LIBERO와 SimplerEnv 환경에서 추론이 없는 (reasoning-free) 모델, 텍스트 사고의 연쇄 (text chain-of-thought) 모델, 그리고 잠재적 반복 루프 (latent iterative loop) 모델을 직접 비교하였으며, 그 반대의 결과를 발견했습니다. 즉, 잠재적 반복 (latent iterative) 클래스는 무작위 노이즈 (random noise)와 화이트박스 공격 (white-box attacks) 하에서 완전히 붕괴되는 반면, 나머지 두 모델은 버텨냈으며, 추론 깊이 (reasoning depth)를 조정하는 것은 이를 회복하는 데 거의 도움이 되지 않았습니다. 실무자들에게 더욱 유의미한 점은, 겉보기에 거의 완벽해 보이는 "계획-행동 일관성 (plan-action consistency)" 프로브 (probe)가 적응형 공격 (adaptive attacks) 하에서 무작위 확률 (random-chance) 수준으로 떨어진다는 것입니다.
Tuan Duong Trinh 외 · arXiv 2607.17786 source
MEVION: 무거운 하중 처리에 있어 ALOHA의 공백을 메우는 14,000달러 규모의 오픈 소스 양팔 데이터 수집 장치 · 벤치마크 (benchmark)
ALOHA는 이미 양팔 데이터 수집의 사실상 표준 (de facto standard)이지만, 힘과 속도의 한계가 낮아 무거운 물체나 빠른 움직임을 다루는 것은 불가능합니다. 저자들은 소수의 부품을 사용하여 대형 프레임 본체를 제작하기 위해 판금 용접 (sheet-metal welding) 방식을 사용했으며, 모든 부품은 기성품 (off-the-shelf)으로 조달 가능합니다. 4개의 6-DOF 암 (arms)은 각각 7.0kg의 무게와 60 N·m의 피크 토크 (peak torque)를 가지며, 전체 설정 비용은 약 14,000달러입니다. 팔꿈치 관절 (elbow joint)은 말단 질량 (distal mass)을 줄이기 위해 사족 보행 로봇 (quadruped robots)의 폐쇄형 체인 메커니즘 (closed-chain mechanism)을 차용했습니다. 하드웨어와 소프트웨어 모두 완전히 오픈 소스로 공개되었습니다.
Kento Kawaharazuka 외 · arXiv 2607.17970 source
오늘의 다른 논문들: BoxTwin은 비디오로부터 탄소성 관절 객체 (elasto-plastic articulated objects)의 전체 역학 (dynamics)을 학습하여, 디지털 트윈 (digital twins)을 변형 가능한 객체 (deformable objects)로 확장합니다 (arXiv 2607.17132 source); PhyAgentOS는 이기종 임바디드 에이전트 (heterogeneous embodied agents)를 위한 통합 런타임 (unified runtime)을 제공하며, "실행 종료 (execution termination)"와 "의미적 완료 (semantic completion)"를 분리합니다 (arXiv 2607.16636 source); World Translation은 역역학 추출 (inverse dynamics extraction)과 비쌍 데이터 도메인 변환 (unpaired domain translation)을 사용하여 sim2real 격차를 압축합니다 (arXiv 2607.18154 source); FM-VLA는 접촉이 빈번한 조작 (contact-rich manipulation)을 위해 VLA에 힘 감지 메모리 (force-sense memory)를 추가합니다 (arXiv 2607.18231 source); Foresight Residual RL은 오프라인으로 추정된 예견 가치 (foresight value)를 사용하여 장기 조립 (long-horizon assembly) 과정에서의 서브태스크 인계 (subtask handoff) 품질을 최적화합니다 (arXiv 2607.16506 source); 비동기 멀티모달 확산 정책 (asynchronous multimodal diffusion policy)은 각 모달리티 (modality)의 인지 속도와 추론 지연 시간 (inference latency) 사이의 불일치를 처리합니다 (arXiv 2607.17257 source); SinD 2.0은 주석이 달린 의미적 위험 (semantic risk)을 포함한 다중 도시 신호 교차로 드론 데이터셋을 공개합니다 (arXiv 2607.16943 source); A2RL Vmax는 자율 레이싱을 위한 장거리, 고속 인지 및 다중 차량 상호작용 데이터셋을 제공합니다 (arXiv 2607.17813 source); GeoWorldAD는 자율 주행 계획 (autonomous driving planning)에 기하학적 세계-행동 모델 (geometric world-action model)을 적용합니다 (arXiv 2607.17521 source); UniETP는 범용 임바디드 태스크 계획 (general-purpose embodied task planning)을 위해 서로 다른 시뮬레이터 간의 관측 형식 (observation formats)과 행동 유형 (action types)을 통합합니다 (arXiv 2607.18062 source); Token-Wise Latent Streaming은 느린 추론기 (slow reasoner)가 숨겨진 상태 (hidden states)를 토큰 단위로 빠른 플래너 (fast planner)에게 스트리밍하게 하여 관측 데이터의 노후화 (observation staleness)를 압축합니다 (arXiv 2607.16806 source); 중요도 샘플링 (importance sampling) 및 PCA
상용 자율 트럭킹 스택에서 희귀한 실패 사례를 발견함 (arXiv 2607.18106 source).
오픈 소스 · 도구 · 벤치마크
· NVIDIA Agent Toolkit × Omniverse 라이브러리: SIGGRAPH에서 Nvidia는 Omniverse 라이브러리를 Agent Toolkit에 통합하여, AI 에이전트가 21개의 새로 발표된 그래픽 및 시뮬레이션 연구 결과와 함께 '시뮬레이션 준비 완료(simulation-ready)' 월드를 직접 구축할 수 있게 했습니다 source
· lingbot-world-2: 세계 최초의 시간 규모 실시간 월드 모델이라고 주장되며, 현재 오픈 소스로 공개되었습니다. 카메라를 움직이면 실시간으로 반응하는 장면을 생성합니다 source (WeChat, CN)
II. 투자 및 거래(Funding and Deals)
AGIBOT | 계획된 IPO | 목표 가치 200억 달러 (약 1,500억 위안) · 휴머노이드 ⚠️ 미확인 보고
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기