Long-WAM: 월드-액션 모델의 컨텍스트 스케일링
요약
본 논문은 실시간 로봇 제어 환경에서 인과적 월드-액션 모델의 컨텍스트를 확장하는 Long-WAM 프레임워크를 제시합니다. 이 모델은 비디오 기반 자기회귀 학습을 통해 긴 이력 처리 능력을 향상시키며, RoboCasa GR-1 등 다양한 로봇 도메인에서 높은 성공률을 입증했습니다. 또한 RTX 5090 같은 하드웨어에 최적화되어 실시간 배포가 가능합니다.
핵심 포인트
- Long-WAM은 인과적 월드-액션 모델의 컨텍스트를 확장하는 프레임워크입니다.
- 이력 접근 방식보다 자기회귀 사전 학습을 통한 긴 이력이 더 큰 효과를 가져옵니다.
- RoboCasa GR-1에서 컨텍스트 증가에 따라 성공률이 63.3%에서 78.7%로 크게 향상되었습니다.
- RTX 5090 등 다양한 하드웨어에 최적화되어 실시간 배포가 가능하며, 복합 작업 계획까지 지원합니다.
실시간 로봇 제어는 움직임과 작업 진행 상황을 추론하기 위해 충분한 시각적 이력을 요구하지만, 이러한 이력을 처리하는 과정이 행동 지연을 초래할 수 있습니다. 본 논문에서는 실시간 제어 제약 조건 하에서 인과적 월드-액션 모델(causal world-action models)의 컨텍스트를 확장하기 위한 모델-시스템 프레임워크인 Long-WAM을 제시합니다. 우리의 핵심 발견은 이력에 접근하는 것과 실제로 사용하는 것은 같지 않다는 것입니다. 즉, 비디오 기반이 자기회귀적(autoregressive, AR)으로 사전 학습된 경우 더 긴 이력이 훨씬 큰 효과를 가져온다는 것입니다. 우리는 먼저 액션 레이블 없이 로봇 및 자아중심식(egocentric) 비디오에서 인과 예측을 학습한 다음, 월드-액션 적응 과정 동안 이러한 이력-미래 구조를 보존합니다. RoboCasa GR-1에서 컨텍스트를 0.0초에서 19.2초로 늘리자 성공률이 63.3%에서 78.7%로 증가했지만, 양방향으로 사전 학습된 초기화는 순증가 효과를 보이지 않았습니다. 로봇 도메인 AR 사전 학습은 GR-1과 LIBERO-Long 모두에서 최고 성공률을 더욱 높였습니다. Long-WAM은 또한 LIBERO-Long, RoboTwin 2.0, 그리고 DOMINO와 비교된 방법들 중 최고의 결과를 달성했습니다. 스트리밍 관측 인코딩, 비동기 실행, 하드웨어별 가속화를 통해 미래 예측 성능 저하 없이 RTX 5090, DGX Spark, Jetson AGX Thor에 배포할 수 있습니다. RTX 5090에서 미래 비디오 잠재 예측을 포함한 각 액션 청크는 107.4ms가 소요됩니다. Unitree G1 및 YAM에서의 실시간 배포는 동적이고 장기적인 조작(manipulation)을 지원하며, 특히 역동적인 컵 쌓기(dynamic cup stacking)에서 95%의 성공률을 보였는데, 이 경우 Pi0.5와 Fast-WAM은 20번의 시도 중 어느 것도 성공하지 못했습니다. 메모리 기반 실행기(memory-informed executor)로서 Long-WAM은 복합 작업(composite tasks)에서의 상위 레벨 계획(higher-level planning)까지 보완합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기