H-JEPA: 시각적 계획을 위한 계층적 세계 모델의 종단 간 학습
요약
본 논문은 장기적인 계획을 위해 계층적 세계 모델인 H-JEPA를 제안합니다. H-JEPA는 행동 조건부 JEPA(action-conditioned JEPAs)를 학습시키며, 각 계층이 독립된 잠재 공간에서 더 먼 미래를 예측하는 구조입니다. 이 방식은 상위 수준의 목표 최적화가 하위 플래너의 하위 목표가 되는 방식으로 작동하여 계획 성능을 크게 향상시킵니다.
핵심 포인트
- H-JEPA는 장기 계획을 위한 계층적 세계 모델이다.
- 각 계층이 독립된 잠재 공간에서 미래를 예측한다.
- 계획은 상위 수준의 최적화가 하위 목표로 전달된다.
- Visual AntMaze 등 환경에서 성공률 및 효율성 향상을 입증했다.
긴 시간 지평(Long-horizon)에서의 계획은 잠재된 세계 모델(latent world models)이 다양한 시간 척도와 추상화 수준에 걸쳐 추론하는 것을 요구합니다. 기존의 작업 비종속적 JEPA 세계 모델은 단일 시간 척도에서 예측하고 계획하거나, 하나의 공유된 잠재 공간 내에서 여러 지평을 다룹니다. 우리는 H-JEPA를 소개합니다. 이는 계층적 구조의 행동 조건부 JEPA(action-conditioned JEPAs)를 학습시키기 위한 종단 간 레시피이며, 각 수준은 자신만의 학습된 잠재 공간에서 더 먼 미래를 예측합니다. 계획은 상위에서 하위로 진행됩니다: 최상위 수준이 목표를 향한 진전을 최적화하고, 각 수준의 예측은 그 아래 플래너(planner)의 하위 목표가 됩니다. 데이터 내 요인들이 분리된 시간 척도로 진화할 때, 상위 수준은 빠르고 예측 불가능한 세부 사항을 무시하고 더 느린 작업 관련 상태를 유지합니다. 네 가지 시뮬레이션된 탐색 및 조작 환경에서, 계층적 계획은 평면적인 JEPA보다 성능이 향상되었습니다; Visual AntMaze에서는 3단계 계층 구조가 플래너 연산량을 줄이면서 성공률을 18%에서 73%로 높였습니다. 제거 실험(Ablations)에 따르면 이러한 이득은 시간적 분해와 상위 수준의 목표 표현 모두에 기인합니다. 역동학 감독(inverse-dynamics supervision)과 함께, 이 접근 방식은 DROID의 다양한 실제 로봇 비디오로 확장되어, 계층 구조가 더 낮은 플래너 연산량에서 오프라인 계획 충실도를 향상시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기