$π ext{R}^2$: 반응형 실시간 흐름 정책 (Reactive Real-time Flow Policies)
요약
기존 액션 청킹 흐름 정책의 지연 시간 문제를 해결하기 위해 반응형 실시간 흐름 정책인 $\pi \text{R}^2$를 제안합니다. 빠른 채널과 느린 채널의 비동기적 업데이트 및 지연 시간 적응형 스케줄링을 통해 실시간 폐루프 제어를 가능하게 합니다.
핵심 포인트
- 비동기 채널 분리를 통해 시각 정보 지연에도 고유 수용 감각에 즉각 반응 가능
- 지연 시간 적응형 흐름 스케줄로 다양한 하드웨어 환경에 유연하게 대응
- 기존 정책 대비 폐루프 재계획 속도 약 4배 향상 (25Hz)
- 실제 환경 조작 작업 성공률을 최대 30%까지 개선
범용 조작 정책 (Generalist manipulation policies)은 점점 더 대규모 사전 학습된 백본 (pretrained backbones)을 기반으로 구축된 액션 청킹 흐름 정책 (action-chunking flow policies)의 형태를 취하고 있습니다. 이러한 청크 (chunks)는 오픈 루프 (open-loop)로 실행되므로, 정책이 실행 중간에 들어오는 감각 입력에 반응할 수 없어 extit{반응성 (reactivity)}을 희생하게 됩니다. 더 자주 재계획 (Replanning)을 수행하면 이를 회복할 수 있겠지만, 인지-행동 파이프라인 (perception-to-action pipeline, 대규모 백본과 다수의 디노이징 단계 (denoising steps)의 결합)은 너무 느립니다. 이러한 extit{지연 시간 (latency)}은 빈번한 재계획을 불가능하게 만들고 이미 결정된 액션을 오래된 상태로 방치하여, 이러한 정책들이 동적인 폐루프 제어 (closed-loop control)에 부적합하게 만듭니다.
우리는 대규모 백본, 표현력이 풍부한 멀티모달 정책 (multi-modal policies), 그리고 다중 액션 예측 (multi-action prediction)을 유지하면서도 이러한 정책들을 반응형 및 실시간으로 만드는 $π ext{R}^2$를 제시합니다. 디퓨전 포싱 (diffusion forcing)의 위치별 노이즈 스케줄 (per-position noise schedule)을 기반으로 구축된 $π ext{R}^2$는 두 가지 아이디어를 기여합니다. 첫째, 컨디셔닝 (conditioning)을 빠른 채널 (고유 수용 감각 (proprioception), 매 틱마다 갱신)과 비동기적으로 업데이트되는 느린 채널 (시각-언어 특징 (vision-language features))로 분리하여, 정책이 오래된 시각 정보는 허용하면서도 청크 내에서 고유 수용 감각에 반응할 수 있도록 합니다. 둘째, 지연 시간 적응형 흐름 스케줄 (latency-adaptive flow schedule)은 진행 중인 액션 (in-flight actions)을 인페인팅 컨디셔닝 (inpainting conditioning)으로 취급하고 호출당 한 번의 디노이징 단계에서 액션을 방출하여, 하나의 학습된 모델이 다양한 하드웨어 지연 시간에 적응할 수 있게 합니다.
기존 아키텍처에 최소한의 수정만을 요구하는 $π ext{R}^2$는 사전 학습된 정책으로부터 미세 조정 (finetuned)될 수 있습니다. 실제 xArm6+XHand 플랫폼의 GR00T-N1.7에 적용했을 때, $π ext{R}^2$는 기본 정책보다 약 4배 더 빠르게 폐루프 재계획을 수행하며 (A5000 GPU에서 약 25Hz), 매 40ms마다 새로운 관측값에 따라 동작합니다. 시뮬레이션 및 실제 환경의 조작 작업 전반에 걸쳐, $π ext{R}^2$는 가장 강력한 베이스라인 대비 시뮬레이션에서 최대 23%, 실제 환경에서 최대 30%의 성공률을 향상시킵니다. 프로젝트 페이지: https://pi-r2-flow.github.io/
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기