FutureX · Physical AI Daily — Issue 60 (07/17)
요약
RSS 2026에서 발표된 로보틱스 연구 성과를 다룹니다. 휴머노이드 보행 학습 시간을 단축하는 FlashSAC, 센서 없이 힘을 감지하는 NeuralActuator, 그리고 환경을 활용해 물체를 추출하는 DAPL 기술을 소개합니다.
핵심 포인트
- FlashSAC: 휴머노이드 보행 sim2real 학습 시간을 수 분 내로 단축
- NeuralActuator: 트랜스포머를 활용해 저가형 로봇 팔의 힘 감지 구현
- DAPL: 월드 모델과 강화학습을 이용한 환경 활용 파지 기술
- 현대자동차의 Boston Dynamics 잔여 지분 인수 및 Nvidia의 일본 AI 인프라 구축 소식
오늘의 주요 뉴스
· SoftBank가 풋옵션 (put option)을 행사함에 따라, 현대자동차가 Boston Dynamics의 나머지 지분 9.65%를 3억 2,500만 달러에 인수합니다.
· Nvidia가 일본 정부와 협력하여 27,500개의 Rubin GPU를 갖춘 세계 최초의 국가 수준 Physical AI 컴퓨팅 기반을 구축합니다.
· RSS 2026 최우수 논문 FlashSAC: 휴머노이드 보행 (humanoid locomotion) sim2real 학습 시간을 수 시간에서 수 분으로 단축
· 하모닉 감속기 (Harmonic reducer) 가격이 3년 만에 절반으로 하락하며, 대량 견적가가 단 2,000위안을 약간 상회하는 수준으로 떨어졌습니다.
· NHTSA는 하드웨어 설계 조항을
Donghu Kim, Youngdo Lee et al. (Holiday Robotics × KAIST × KRAFTON) · RSS 2026 Best Paper · 분석: QbitAI 출처 (WeChat, CN)
NeuralActuator: 토크 센서 없이 저가 로봇 팔에 힘을 감지하는 방법 (giving low-cost robot arms a sense of how much force they're feeling, without torque sensors) · 지각 (perception)
RSS 2026 Best Systems Paper. 마찰(Friction), 백래시(backlash), 온도 드리프트(temperature drift)는 전통적인 전류-토크 관계를 흐트러뜨리며, 이는 저가 로봇 팔의 sim2real 격차(gap)의 주요 원인이 됩니다. 이 연구는 트랜스포머(transformer)와 미분 가능 시뮬레이션(differentiable simulation)을 결합하여 액추에이터 토크(actuator torque), 외부 접촉력(external contact force), 접촉 확률(contact probability), 모터 상태(motor state)를 공동으로 예측함으로써, 로봇이 전용 힘/토크 센서 없이도 배치 시 가해지는 힘을 감지할 수 있게 합니다. 이 기술은 약 500달러에서 30,000달러가 넘는 세 가지 종류의 로봇 팔에서 검증되었으며, 팀은 또한 양손 원격 조작(bimanual teleoperation)을 통해 수집된 NAD 데이터셋도 공개했습니다.
Zhiyang Dou et al. (MIT CSAIL) · RSS 2026 Best Systems Paper · 분석: QbitAI 출처 (WeChat, CN)
**DAPL: 로봇이 파지(grasping) 없이 환경을 '지렛대처럼 활용'하여 물체를 추출하는 방법 (robots learn to
RSS 2026 파이널리스트 목록에 선정되었습니다. 이 프레임워크는 먼저 월드 모델 (world model)을 사용하여 복잡한 장면 내 물체들 사이의 충돌 (collision), 미끄러짐 (sliding), 기울어짐 (tipping) 역학을 학습한 다음, 이러한 역학 표현 (dynamics representations)을 강화학습 (reinforcement learning)의 가이드로 사용합니다. 이를 통해 로봇은 더 이상 직접적인 파지 (grasping)에만 의존하지 않고, 주변 물체 및 환경과의 접촉을 통해 밀기 (pushing), 넛징 (nudging), 뒤집기 (flipping)와 같은 "외적 숙련 조작 (extrinsic dexterous manipulation)"을 수행할 수 있습니다. 학습되지 않은 시뮬레이션된 복잡한 장면에서 성공률은 파지 (grasping) 및 원격 조작 (teleoperation)과 같은 베이스라인 대비 25퍼센트 포인트 이상 향상되었으며, 10가지 카테고리의 실제 환경 장면에서 약 **50%**의 성공률에 도달했습니다. 이 기술은 이미 선반 물체 집기 (shelf-picking) 작업에 사용되었습니다. 저자들은 이러한 행동들이 보상 해킹 (reward hacking)을 통해 조정된 것이 아니라 모델로부터 자율적으로 나타났음을 강조합니다.
Yixin Zheng, Jiangran Lyu 외 (CASIA × BAAI × Galbot × Peking University × SJTU) · RSS 2026 파이널 리스트 · 분석: QbitAI 출처 (WeChat, CN)
UniTac: 접촉 전 VLA가 촉감을 "상상"하게 하기 · 조작 (manipulation)
VLA에 촉각을 도입하는 데 있어 어려움은 데이터의 부족이 아니라, 데이터가 이질적인 센서(heterogeneous sensors) 내부에 갇혀 있다는 점입니다. 즉, 동일한 물체라도 서로 다른 촉각 센서에 따라 완전히 다른 신호를 생성할 수 있습니다. UniTac은 촉각을 별도로 모델링된 두 부분인 "물체의 물리적 특성 (object physical properties)"과 "센서 구성 (sensor configuration)"으로 분리합니다. 그런 다음 400,000개 이상의 공개된 촉각 비디오로부터 통합된 표현(unified representation)을 학습하며, 시각으로부터 잠재적 촉각 상태(latent tactile states)를 예측하여 VLA에 입력합니다. 이를 통해 촉각을 접촉 후의 피드백(post-contact feedback)에서 접촉 전의 사전 정보(pre-contact prior)로 전환합니다. 이해(understanding) 측면에서는 PHYSICLEAR-Test에서 66.51점을 기록하며 Octopi와 같은 모델들을 앞섰고, 생성(generation) 측면에서는 4가지 센서 유형에 대해 평균 0.836의 SSIM을 달성했습니다. 이 기술의 가치는 종이컵이나 수건처럼 "잘못 쥐면 망가지는" 물체를 다루는 시나리오에서 빛을 발하며, 이러한 경우 접촉 후에 수정하는 것은 이미 너무 늦기 때문입니다.
UniX AI × Zhejiang University × MIT × Oxford × Yale × SJTU · ECCV 2026 채택 · 분석: QbitAI 출처 (WeChat, CN)
GigaWorld-Policy-0.5: 추론 시 더 이상 비디오를 생성하지 않는 세계-행동 모델 (world-action model) · 세계 모델 (world-model)
Hugging Face 트렌딩 21위 상승. 기존의 세계-행동 모델 (world-action models, WAMs)은 일반적으로 추론 시 명시적인 미래 비디오를 생성하며, 이로 인한 연산 오버헤드 (compute overhead)가 실시간 폐루프 제어 (closed-loop control)를 방해할 정도로 무겁습니다. 이 버전은 "행동 중심 (action-centric)" 접근 방식을 취합니다. 즉, 훈련 중에는 미래의 시각적 역학 (visual dynamics)으로부터 밀집된 감독 (dense supervision)을 사용하고, 추론 시에는 행동만을 디코딩하며, 시각적 역학 모델링과 행동 생성을 서로 다른 전문가 (experts)로 분리하는 Mixture-of-Transformers를 도입하여, 단일 RTX 4090에서 85ms의 추론 지연 시간 (inference latency)을 달성했습니다. 또한 팀은 에이전트 기반의 AutoResearch 파이프라인을 사용하여 훈련 구성을 자동으로 탐색함으로써 수동 튜닝의 상당 부분을 줄였습니다.
GigaWorld 팀, Angen Ye 외 · arXiv 2607.13960 source
WANDA: 단일 실제 로봇 시연으로부터 학습 가능한 세계를 합성하기 · 벤치마크 (benchmark)
원격 조작 (teleoperation) 및 UMI 기반 데이터 수집의 노동 비용은 오픈 월드 모바일 조작 (open-world mobile manipulation)을 위해 확장(scale)하기가 매우 어렵습니다. WANDA의 접근 방식은 **단일 시연 (single demonstration)**에서 최대의 가치를 짜내는 것입니다. 먼저 RGBD 관측으로부터 배경 Gaussian splat과 로봇-객체 상호작용 궤적을 "세계 기질 (world substrate)"로 재구성한 다음, 접촉이 풍부한 상호작용 세그먼트들을 다양한 공간 구성으로 재배치하고 전신 동작 계획 (whole-body motion planning)을 통해 새로운 궤적으로 연결하여, 일상 사진으로부터 생성된 다양한 3D 세계 전반에 걸쳐 현실적인 관측치를 합성합니다. 실험 결과, 이러한 방식으로 훈련된 정책 (policies)은 장기적 강건성 (long-horizon robustness), 공간 일반화 (spatial generalization), 환경 간 일반화 (cross-environment generalization)를 동시에 확보하며, 자연스럽게 교차 체형 (cross-embodiment) 데이터 생성을 지원함을 보여주었습니다. 이는 이미 다른 폼 팩터(form factor)를 가진 또 다른 모바일 조작 로봇에 제로샷 (zero-shot)으로 배포되었습니다.
Lingxiao Guo, Huanyu Li, Guanya Shi · arXiv 2607.13154 source
APT-RL: 온보드 센서만 사용하여 야생 환경에서 고속 이동을 위해 사족 보행 동물이 자율적으로 보행 방식을 전환 · locomotion
다중 기술(multi-skill) 이동의 어려움은 기술 간의 핸드오프(handoff)에 있습니다. 즉, 언제 어떤 보행 방식으로 전환할지를 결정하는 것은 보통 수작업으로 설계된 상태 기계(hand-crafted state machine)에 의존합니다. 이 프레임워크는 액션 사전 학습 트랜스포머(action-pretrained transformer)를 사용하여 다중 기술 이동을 통합하고, 오직 온보드 인식 및 컴퓨팅만을 사용하여 견고한 야생 환경부터 도시 환경까지 복잡한 지형에서 자율적인 기술 전환과 고속 이동을 가능하게 했습니다. validated from rugged wilderness to urban environments.
Jun-Gill Kang, Jaehyun Park et al. · arXiv 2607.13579 source
오늘의 다른 논문들: M4World는 객체 수준 상호작용 및 미세 규모 스트리밍 생성을 지원하는 다중 뷰 멀티모달 주행 세계 모델(arXiv 2607.14005 source); Kepler-Encoder-v0.1은 고유수용 감각 상태를 비전 및 힘/토크와 융합하여 공유 잠재 공간으로 처리하며, 비전 전용 특징이 힘을 읽을 때의 R² 값은 0.10까지 낮습니다(arXiv 2607.13522 source); Anchor-Align은 계층별 증류를 위해 고정된 VLM 복사본을 사용하여 행동 클로닝 미세 조정이 사전 학습된 표현을 덮어쓰는 것을 방지합니다(arXiv 2607.13429 source); Semantic Anchoring은 액션 표현을 의미론적 매니폴드(semantic manifold)에 고정하고 이를 공유-의미론적 채널과 사적 채널로 분할합니다(arXiv 2607.13597 source); Reverse to Advance는 작업의 방향성 비대칭성을 활용하여,
UniPhysGen, 가공되지 않은 3D 에셋을 관절 의미론 (articulation semantics) 및 물리적 속성 (physical properties)을 갖춘 시뮬레이션 준비 완료 에셋으로 자동 변환합니다 (arXiv 2607.13586 source); From Pixels to States, 네 가지 게임 엔진 차원을 통해 상호작용 가능한 월드 모델 (interactive world models)을 조사하며, 90시간 이상의 "Black Myth: Wukong" 데이터를 포함하는 데이터 엔진을 특징으로 합니다 (arXiv 2607.14076 source); Grounded world models, 생물학적 신경 회로에서 도출된 체화된 월드 모델 (embodied world models)을 위한 다섯 가지 참조 지점을 제안합니다 (arXiv 2607.13560 source); SIGReg 목적 함수가 변분 자유 에너지 (variational free energy)와 동일함을 보여줌으로써, JEPA 월드 모델에 규범적 능동 추론 (normative active-inference) 해석을 제공합니다 (arXiv 2607.13612 source).
오픈 소스 · 도구 · 벤치마크
· X-TouchMind V1 및 TacVerse 1k: Qianjue Robotics는 업계 최초의 촉각 중심 VTLA 체화된 파운데이션 모델 (embodied foundation model)이라고 주장하는 모델을 출시했으며, 1,000시간 분량의 네이티브 시각-촉각 데이터셋과 함께 제공합니다. 이는 100% 촉각 데이터 커버리지를 자랑하며, 시각 전용 데이터에 촉각 데이터를 사후에 추가하는 방식이 아니라 시각, 촉각, 힘, 포즈 및 고주파 역학 (high-frequency dynamics)을 함께 캡처했습니다. 이 모델은 System 0-2 계층 구조를 사용하며, System 0은 고주파 촉각 교정 (high-frequency tactile correction)에 특화되어 있습니다 source (WeChat, CN)
· RLinf v0.3: Infinigence AI와 칭화대학교 (Tsinghua University)가 공동 구축한 체화된 강화학습 (embodied reinforcement learning) 프레임워크의 업데이트 버전으로, 모델 생태계부터 실제 로봇 배포에 이르기까지 다섯 가지 기능 업그레이드를 포함합니다 source
· GPUSimBench: 확장성 (Scalability), 물리적 일관성 (Physical consistency), 그리고 계산적 결정론 (Computational determinism)에 대한 표준을 수립하는 GPU 가속 시뮬레이터용 벤치마크입니다. 무분별한 스케일링 (Scaling)이 재현성 (Reproducibility)을 희생시킨다는 점을 지적합니다 (arXiv 2607.13059 source)
· Industrial Dexterity Benchmark: 케이블 라우팅 (Cable routing), 커넥터 삽입 (Connector insertion), 정밀 조립 (Precision assembly) 등 오늘날까지도 여전히 수작업으로 이루어지는 작업들을 다루는 산업용 숙련 조작 (Industrial dexterous manipulation)을 위한 통합 하드웨어-소프트웨어 벤치마크 플랫폼입니다 (arXiv 2607.14021 source)
· HRIBench: 협업 작업을 명시적으로 모델링된 역할 (Roles), 시간적 의존성 (Temporal dependencies), 그리고 조정 제약 조건 (Coordination constraints)을 포함하는 실행 가능한 스크립트로 작성합니다. 이는 인간-로봇 상호작용 (Human-robot interaction) 구조에 대한 VLA (Vision-Language-Action) 평가에서 거의 비어 있던 영역을 채워줍니다 (arXiv 2607.13056 source)
II. 투자 및 거래
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기