Rolling-WAM: 순환 상상력을 갖춘 월드 액션 모델
요약
본 논문은 로봇 조작을 위한 World Action Models(WAMs)의 지연 시간 문제를 해결하기 위해 Rolling-WAM이라는 새로운 정식화를 제안합니다. 이 방법은 공동 디노이징 과정을 연속적인 재계획 주기 전반에 걸쳐 분산시켜 계산 비용을 시간에 걸쳐 분산시킵니다. 그 결과, 표준 WAM 대비 4.5배의 정상 상태 재계획 속도 향상을 달성했습니다.
핵심 포인트
- Rolling-WAM은 공동 디노이징 과정을 연속적인 주기 전반에 분산합니다.
- 슬라이딩 윈도우를 사용하여 미래 청크의 디노이징을 점진적으로 수행합니다.
- 전체 예측 지평을 처음부터 처리할 필요가 없어 속도가 크게 향상됩니다.
- LIBERO, RoboTwin 등에서 경쟁력 있는 조작 성능을 입증했습니다.
월드 액션 모델(World Action Models, WAMs)은 로봇 조작을 위해 행동 생성과 미래 시각 예측을 결합합니다. 하지만 매 재계획 주기마다 공동 비디오-행동 디노이징 과정을 완료하는 것은 상당한 지연 시간을 초래하여 행동 업데이트를 늦추고 폐쇄 루프 응답성을 제한합니다. 우리는 Rolling-WAM이라는 정식화를 제시하며, 이는 공동 디노이징을 연속적인 재계획 주기 전반에 걸쳐 분산시킵니다. 우리의 방법은 서로 다른 노이즈 수준에서 비디오-행동 청크의 슬라이딩 윈도우를 유지합니다. 각 단계에서, 순환 노이즈 스케줄(rolling noise schedule)은 임박한 행동 청크를 실행을 위해 완전히 디노이징하는 동시에, 더 먼 미래의 청크는 부분적으로 정제합니다. 창(window)이 새로운 카메라 관측치와 함께 전진함에 따라, 유지된 미래 청크들은 그들의 디노이징 과정을 계속합니다. 이는 계산 비용을 시간에 걸쳐 분산시키면서도 청크 경계를 가로질러 진화하는 시각-행동 컨텍스트를 전달합니다. LIBERO, RoboTwin 및 실제 Unitree G1 휴머노이드에서의 평가 결과, Rolling-WAM은 경쟁력 있는 조작 성능을 달성함을 보여줍니다. 전체 예측 지평(prediction horizon)을 처음부터 디노이징할 필요성을 제거함으로써, 표준 공동 WAM 대비 4.5배의 정상 상태 재계획 속도 향상을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기