FutureX · Physical AI Daily — Issue 79 (08/05)
요약
휴머노이드 로봇의 외발 서기 능력을 향상시키는 새로운 동적 질량 중심 관측법과 액션 청킹(action chunking)의 작동 원리에 대한 연구를 소개합니다. 기존 SOTA 정책들의 한계를 분석하고, 로봇 정책의 성능을 높이는 핵심 요인을 규명합니다.
핵심 포인트
- SOTA 휴머노이드 정책들이 외발 서기 벤치마크에서 모두 실패함을 확인
- 엔코더와 IMU만으로 재구성 가능한 동적 질량 중심 관측법 제안
- FDDC 정책을 통해 Unitree G1 하드웨어에서 성공적인 전이 달성
- 액션 청킹의 성공 요인으로 비마르코프적 표현력과 암시적 앙상블 식별
오늘의 주요 뉴스
· 중국의 자율주행 국가 표준 의무화 — L3 시스템은 운전자 제어권 전환(takeover-capability) 모니터링을 반드시 포함해야 함, 2027년 7월 발효
· RoboArena 점수 조작 폭로: 단일 계정이 Spirit v1.6 평가의 58%를 처리함
· 외발 서기 테스트, 90회 동작 — 8개의 최상위 범용 휴머노이드 정책(policies) 모두 통과 실패
1. 연구 진행 상황
8개의 최상위 범용 휴머노이드 정책, 90회의 외발 서기 동작 중 0회 성공 · 이동 (locomotion)
휴머노이드 정책(Humanoid policies)은 지난 2년 동안 춤추기, 구르기, 전신 추적(whole-body tracking) 분야에서 빠른 발전을 이루었으나, 가장 기본적인 요구 사항 중 하나인 '한 발로 가만히 서 있기'에는 집단적으로 실패했습니다. 저자들의 외발 균형 벤치마크에서, 발표된 8개의 SOTA(State-of-the-Art) 범용 정책은 90개의 테스트 동작 중 0개를 완벽하게 수행했습니다. 이들은 불균형을 사전에 방지하기보다는 발을 내딛거나 작은 점프를 통해 불균형으로부터 회복하는 방식을 취했습니다. '예방'을 달성하려면 캡처 포인트(capture point, 속도를 사용하여 추정된 질량 중심 위치)가 필요한데, 이는 온보드 센서가 제공할 수 없는 베이스 선속도(base linear velocity)에 의존하기 때문에 이전에는 실제 로봇 정책을 구동하는 데 사용된 적이 없었습니다. 본 논문은 이를 지지 발(support-foot) 프레임에서 표현하면 해당 항이 상쇄되어, 엔코더(encoder)와 IMU만으로도 재구성이 가능하다는 것을 발견했습니다. 이 배포 가능한 동적 질량 중심(dynamic center-of-mass) 관측값을 하드웨어에서 실행되는 액터(actor)에 직접 입력하고, 인간의 자세 제어에서 항목별로 번역된 보상 라이브러리(reward library)와 결합하자, FDDC 정책은 90개의 홀드아웃(held-out) 동작 중 86개를 깔끔하게 완료했으며 실제 Unitree G1으로 전이(transfer)되었습니다. 절제 연구(Ablation) 결과, 이 관측값이 가장 큰 기여 요인임을 확인했습니다. 이를 제거하면 성능이 40포인트 하락합니다.
Yikai Zhou 외 · arXiv 2608.00500 출처
액션 청킹(action chunking)은 왜 작동하는가? 세 가지 대중적인 설명의 오류를 밝히다 · 조작 (manipulation)
단일 패스(single pass) 내에서 다단계 액션 청크(multi-step action chunks)를 예측하고 실행하는 것은 이제 로봇 정책(robot policies)에서 거의 표준이 되었지만, 이것이 왜 작동하는지에 대해서는 아직 결론이 나지 않았습니다. 시뮬레이션과 실제 하드웨어에서의 체계적인 테스트를 거친 후, 이 논문은 시간적 일관성(temporal consistency), 단축된 결정 지평(shortened decision horizon), 표현 학습(representation learning)이라는 세 가지 주류 가설 중 그 어느 것도 그 성공을 설명하지 못한다고 주장합니다. 실제로 중요한 것은 더 강력한 비마르코프적 표현력(non-Markovian expressiveness)과 더 낮은 누적 오차(compounding error)이며, 이 두 가지는 많은 설정에서 '지연된 정책(delayed policy)'(k단계 전의 관측치를 기반으로 각 단계에서 단일 액션을 예측하는 방식)을 통해 완전히 재현될 수 있습니다. 저자들은 더 나아가 이전에 명명되지 않았던 이점인 '암시적 앙상블(implicit ensembling)'을 식별했습니다. 액션 청크 정책은 $a_t|o_t$ 및 $a_t|o_{t-1}$과 같은 여러 시간적 관계를 동시에 학습하며, 이는 행동적으로 모델 앙상블(model ensemble)과 동일하여 강건성(robustness)과 일반화(generalization)를 향상시킵니다. 이를 바탕으로 저자들은 청킹(chunking)을 전혀 사용하지 않고도 청킹의 성능과 일치하는 '무작위 지연 정책 앙상블(randomly delayed policy ensemble)'을 사용하였으며, 앙상블을 명시적으로 구현하는 정책 클래스를 제안하여 여러 도메인에서 청킹 자체를 명확히 능가하는 성능을 보여주었습니다.
Filippo Lazzati, Kyle Stachowicz, William Chen et al. · arXiv 2608.02547 source
VLAs가 접촉이 빈번한(contact-rich) 작업에서 실패하는 이유: 두 가지 실패 모드와 두 가지 타겟 수정법 · vla
이전의 해결책들은 주로 힘 감지(force-sensing) 브랜치를 추가하거나 훈련 시 규제화(regularization)를 적용했을 뿐, 근본 원인에 대한 조사는 거의 이루어지지 않았습니다. 저자들은 실패를 두 가지 범주로 나누었습니다. 정밀도 실패(precision failures)는 플로우 매칭(flow-matching) 정책의 훈련 불일치(training misalignment)에서 기인하며, 힘 실패(force failures)는 힘 신호 자체의 구조적 특성에서 기인합니다. 각각에 대해 타겟 메커니즘을 적용하여 FACT로 결합하였으며, 이는 약 2,500회의 실제 로봇 롤아웃(rollouts)을 통해 평가되었을 때 기존 최상위 베이스라인의 41% 성공률 대비 5개의 접촉 빈번 작업에서 평균 66%의 성공률을 달성했습니다.
Carlota Parés-Morlans et al. (Stanford / KTH) · arXiv 2608.01402 source
Ego2Robot: 1인칭 인간 영상을 대규모 로봇 학습 데이터로 변환 — 18,500시간 · vla
1인칭 인간 영상을 로봇 데이터로 리타겟팅 (Retargeting) 하는 것은 이전까지 소규모의 단일 작업 정책 (single-task policies)에 대해서만 검증되었으며, 이것이 VLA (Vision-Language-Action) 모델의 사전 학습 (pretraining)에 이점을 제공할 수 있는지 여부는 미해결 과제로 남아 있었습니다. Ego2Robot은 액션 리타겟팅 (action retargeting), 로봇 팔 시각 합성 (robot-arm visual synthesis), 그리고 다단계 품질 필터링 (multi-stage quality filtering)을 하나의 확장 가능한 파이프라인으로 연결하여, 정제된 데이터셋과 야생 (in-the-wild) 영상 모두를 소비하며 15개의 로봇 형태 (embodiments)에 걸친 18,561시간의 학습 데이터를 생성합니다. 이는 현재 가장 큰 규모의 ego-to-robot 데이터셋입니다. 일반화 성능을 테스트하기 위해 저자들은 RoboTwin2.0에 시각적 외형 (visual appearance), 장면 배치 (scene layout), 형태 (embodiment), 그리고 작업 의미론 (task semantics)이라는 네 가지 분리된 섭동 축 (perturbation axes)을 추가했습니다. 그 결과, 합성 데이터와 실제 로봇 데이터를 결합하여 사전 학습하는 것이 여러 섭동 유형에 걸쳐 분포 외 (out-of-distribution) 일반화 성능을 일관되게 향상시킨다는 것을 보여주었으며, 이는 실제 로봇 배포를 통해 검증되었습니다.
Ye Wang et al. · arXiv 2608.02580 source
주행 VLM의 사고 사슬 (chain-of-thought) 라벨링 시 교사에게 정답 궤적 (ground-truth trajectories)을 보여주면 모델이 환각 (confabulate)을 일으킨다 · autonomy
오늘의 유일한 커뮤니티 버즈 신호(HF↑25)가 있는 논문입니다. 저자들은 기존의 자율주행 사고 체계 (CoT) 어노테이션 파이프라인이 일반적으로 기록된 정답 미래 궤적 (ground-truth future trajectories)을 티처 모델 (teacher model)에 입력하여 "궤적 앵커링 편향 (trajectory anchoring bias)"을 유발한다는 점을 지적합니다. 즉, 티처 모델이 장면 증거로부터 결정을 추론하는 대신 이미 알려진 결과에 대한 정당성을 꾸며내게 되어, 인과적 충실도 (causal faithfulness)를 저하시키고 특히 인과적으로 복잡한 시나리오에서 환각 (hallucination)을 현저히 악화시킨다는 것입니다. 하지만 단순히 정답 궤적을 제거하는 것은 고수준의 결정 (high-level decisions)을 기하학적 합성 (geometric synthesis) 및 저수준의 역학 (low-level dynamics)과 뒤엉키게 만듭니다. 이에 저자들은 계획 (planning)을 명시적인 후보 궤적들 사이의 선택 (AD-MCQ)으로 재정의하고, DEFT-RLVR을 제안합니다. 이는 미래 궤적을 "결정 전의 앵커 (anchor before the decision)"에서 "결정 후의 검증 대상 (verification target after the decision)"으로 전환하여, 일반적인 시각 능력 (vision capability)을 보존하거나 심지어 향상시키면서 주행 추론 (driving reasoning)을 개선합니다.
Zixuan Huang et al. · arXiv 2608.01755 source
MiniWorld: 단일 8-GPU 머신에서 며칠 만에 처음부터 학습된 스트리밍 비디오 월드 모델 (world model) · world-model
현재의 비디오 월드 모델 (video world models)은 대부분 사전 학습된 비디오 생성 모델을 재사용하므로, 파이프라인이 복잡하고 계산 비용이 많이 들며, 양방향 사전 학습 (bidirectional pretraining)과 인과적 스트리밍 추론 (causal streaming inference) 사이의 불일치가 발생합니다. 커뮤니티에는 가볍고 투명하며 처음부터 완전히 재현 가능한 베이스라인 (baseline)이 부족했습니다. MiniWorld는 사전 학습된 Video VAE의 잠재 공간 (latent space)에서 플로우 매칭 (flow matching)을 사용하는 블록 인과적 비디오 확산 트랜스포머 (block-causal Video Diffusion Transformer)를 학습시키며, 이는 Diffusion Forcing을 기반으로 하되 블록 단위의 비감소 노이즈 스케줄 (block-wise non-decreasing noise schedule)과 2단계 연속 학습 (two-stage continued training)을 적용합니다. 추론 시에는 롤링 KV 캐시 (rolling KV cache)와 파이프라인화된 비동기 디노이징 (pipelined asynchronous denoising)을 결합합니다. 전체 모델은 단일 8-GPU 서버에서 며칠 만에 학습할 수 있으며, 학습 및 추론 코드와 사전 학습된 가중치 (pretrained weights)가 함께 공개됩니다.
Yian Zhao et al. · arXiv 2608.01127 source
3D 프린팅된 전기 임피던스 단층 촬영 (EIT) e-skin, 휴머노이드 전신 촉각의 "로봇마다 재구축" 문제 해결을 목표로 함 · perception
전통적인 택셀 (taxel) 어레이는 면적 확장, 배선 복잡성, 로봇 특유의 곡률 대응 측면에서 규모를 키우기 어렵기 때문에, 휴머노이드 전신 촉각 기술의 도입이 더디게 진행되어 왔습니다. 저자들은 기하학적 적응형 적층 제조 (additive manufacturing) 공정을 사용하여 형태 적응형 전기 임피던스 단층 촬영 (EIT) 촉각 피부를 제작했습니다. 유연한 전도성 TPU 층이 연속적인 감지 필드를 형성하며, 접촉으로 유도된 변화가 전도성 패치와 결합하여 경계 전압 (boundary voltage)을 변화시키고, 이는 단일 단계 Gauss-Newton EIT 솔버를 통해 재구성됩니다. 평면, U자형 곡면, iCub 얼굴 형태의 세 가지 프로토타입에서 검증한 결과, 곡면 센서는 별도의 지도 학습 기반 후처리 없이도 18개 접촉 위치에서 평균 6mm의 위치 추정 오차를 달성했습니다.
Haofeng Chen et al. · arXiv 2608.02080 source
기계가 먼저 "내부적으로 약간의 고통을 겪게" 함으로써 낯선 환경에서 더 높은 회복 탄력성을 갖게 함 · locomotion
생물학적 유기체는 여러 규모에 걸쳐 다양한 감각-운동 부위로 구성되어 있으며 새로운 환경에 매우 빠르게 적응하는 반면, 기계는 더 작은 규모의 불활성 재료(inert materials)로 제작되어 예상치 못한 상황에 직면했을 때 고장이 납니다. 저자들은 이전에는 명확하게 설명되지 않았던 메커니즘을 제안하고 검증합니다. 즉, 형태학적으로 다양하고 원래는 독립적이었던 에이전트(agents)들을 물리적 연결체(physical connectors)로 서로 묶는 것입니다. 연결체들이 자신의 존재로 인해 방해받는 행동을 회복하는 법을 배우게 되면, 이들은 충분히 다양한 범위의 내부 섭동(internal perturbations)을 유발하고 이를 "길들이게(tame)" 됩니다. 이후 새로운 환경에서 발생하는 교란은 이미 길들여진 이 범위 내에 속하게 되므로, 집단은 추가적인 학습이나 적응 없이도 정상적인 행동을 지속할 수 있습니다. 참여하는 개체가 많을수록, 그리고 그 다양성이 클수록 새로운 환경에 대한 회복 탄력성(resilience)은 더욱 강해집니다.
Alice Hein, Josh Bongard · arXiv 2608.02395 source
오늘의 다른 논문들: Faster-WAM은 월드-액션 모델 (world-action models)이 진정으로 심층 액션 모듈 (deep action modules)을 필요로 하는지 의문을 제기합니다 (arXiv 2608.02365 source); SelfWAM은 미래 예측을 단순한 작업 프롬프트 (task prompts)가 아닌 실행된 액션 (executed actions)에 조건화합니다 (arXiv 2608.00725 source); CoWAM은 동기화 (synchronization), 역할 호환성 (role compatibility), 충돌 수렴 (collision convergence)을 "조정 계약 (coordination contracts)"으로 인코딩하며, 필요한 경우에만 양손 정책 (bimanual policies)에 개입합니다 (arXiv 2608.02578 source); DynamicWAM은 동적 객체 조작 (dynamic object manipulation)을 위해 이중 경로 모션 조건화 (dual-path motion conditioning)를 사용합니다 (arXiv 2608.00793 source); 비동기 배포 (asynchronous deployment)에 관한 실증적 연구는 모델 추론 (model inference)과 액션 실행 (action execution)을 중첩시켜 지연 (stalling)을 제거합니다 (arXiv 2608.01880 source); Open-DiffLoco는 미분 가능한 시뮬레이션 (differentiable simulation)을 통해 배포 가능한 사족 보행 로코모션 정책 (quadruped locomotion policies)을 훈련하는 최초의 오픈 소스 프레임워크로, 단일 RTX 5080에서 20~60분 만에 훈련이 가능합니다 (arXiv 2608.02069 source); 한 서베이 논문은 로봇 학습 (robot learning)을 "동결된 가중치 (frozen weights) vs. 직접 작성된 기술 코드 (self-written skill code)" 라인을 따라 정리하며 77개의 대표적인 시스템을 검토합니다 (arXiv 2608.01851 source); 멀티 에이전트 로봇 시스템 (multi-agent robot systems)에 대한 프롬프트 인젝션 공격 (prompt injection attacks)에 관한 최초의 체계적인 연구로, 공격이 공유된 프롬프트 구조를 통해 에이전트 간에 전파될 수 있음을 보여줍니다 (arXiv 2608.00747 source); Rapid Embodiment Adaptation은 하드웨어 변동 (hardware variation)을 처리하기 위해 짧은 상호작용 이력으로부터 임바디먼트 파라미터 (embodiment parameters)를 온라인으로 추론합니다 (arXiv 2608.01506 source); 언어 조건부 잠재 공간 안전 필터 (language-conditioned latent-space safety filter)는 안전 제약 조건 (safety constraints)을 자연어로 지정할 수 있게 합니다 (arXiv 2608.00315 source).
오픈 소스 · 도구 · 벤치마크
· Amap (Alibaba의 지도 유닛) ABot-World-0: Alibaba 소유의 Amap이 개발한 범용 인터랙티브 월드 모델 (interactive world model)이 업그레이드되어 오픈 소스로 공개되었습니다. 이 모델은 단일 소비자용 GPU에서 이미지 품질, 물리적 일관성(physical consistency), 또는 상호작용 반응성(interaction responsiveness)의 눈에 띄는 저하 없이 24시간 동안 안정적인 연속 추론 (continuous inference)이 가능하다고 주장합니다. 주류 월드 모델들은 일반적으로 자기회귀 생성 (autoregressive generation) 과정에서의 오차 누적 (error accumulation)이 병목 현상이 되어, 단일 패스(single-pass) 연속 생성 시간이 30초에서 1분 내외로 제한됩니다. Amap의 방식은 LongForcing이라는 장기 지평 훈련 (long-horizon training) 패러다임을 사용합니다. 이는 훈련 과정에서 모델이 생성한 출력물을 다음 입력값으로 지속적으로 다시 피드백하되, 모델이 타당한 세계 분포 (world distribution) 내에 머물도록 제약하는 방식입니다. ⚠️ 업체 주장 source
· 오픈 소스 로봇 안내견: 한 연구팀이 시각 장애인을 대상으로 하는 로봇 안내견의 오픈 소스 설계를 공개했습니다. 이는 이러한 형태의 보조 기기(assistive form factor)를 폐쇄형 제품에서 재현 가능한 설계로 전환하는 계기가 될 것입니다 source
2. 투자 및 거래 (Funding & Deals)
Kaiwang Data (KWDATA) | 신규 전략적 펀딩 라운드 | 1억 위안(RMB) 이상 · 인접 분야
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기