FactorJEPA: 혼잡하고 무질서한 글로벌 사우스(Global South) 도시 환경을 위한 레이아웃-에이전트-상호작용 채널 기반의 단일
요약
글로벌 사우스의 혼잡한 도시 환경을 분석하기 위한 새로운 세계 모델 아키텍처인 FactorJEPA를 제안합니다. 레이아웃, 엔티티, 상호작용을 분리된 하위 공간으로 구성하여 복잡한 환경에서의 예측 정확도와 강건성을 높였습니다.
핵심 포인트
- 혼잡한 도시 환경을 위한 DENSEWORLD 데이터셋 공개
- 레이아웃·엔티티·상호작용을 분리하여 예측 성능 개선
- 가시성 게이트를 통해 부분적 관측 가능성 문제 해결
- V-JEPA 백본 기반의 높은 재현성 및 성능 입증
세계 모델(World models)은 물리적 세계의 구조와 역동성을 포착하고 예측하는 능력으로 인해 상당한 주목을 받아왔습니다. 이러한 신흥 분야에서, 결합 임베딩 예측 아키텍처(Joint Embedding Predictive Architectures, JEPA)는 특히 매력적인 방향을 제시합니다. 우리는 아직 거의 탐구되지 않은 영역인 인구가 많고, 혼잡하며, 무질서한 글로벌 사우스(Global South)의 도시 환경을 연구하며, 이를 DENSEWORLD라고 부릅니다. 기존 평가를 지배하는 저밀도 및 차선 구조의 환경과 달리, 이러한 장면은 느슨한 공간 경계, 극단적인 에이전트 이질성(agent heterogeneity), 지속적인 폐쇄(occlusion), 그리고 혼합 교통 상황에서의 빠른 사회적 협상(social negotiation)을 특징으로 합니다. 우리는 이 영역을 위한 최초의 대규모 데이터셋을 도입합니다: 22개 도시에 걸친 1,000시간의 주행(drive-through), 보행(walk-through) 및 항공 비디오입니다. 기존의 JEPA 공식은 이질성과 부분적 관측 가능성(partial observability) 하에서 밀집된 상호작용 역동성을 보존하는 데 어려움을 겪습니다. 우리는 세계 구조를 일급 예측 프리미티브(first-class predictive primitive)로 만드는 FactorJEPA를 도입합니다. 미래를 단일한(monolithic) 잠재 공간(latent)에 인코딩하는 대신, 가시성 게이트(visibility gate)와 분리된 하위 공간(subspaces)을 사용하여 레이아웃, 엔티티(entities), 상호작용을 구성함으로써 부분적으로 관측된 에이전트를 보존하고 요인 간 지름길(cross-factor shortcuts)을 방지합니다. FactorJEPA는 (i) 미래 잠재 정확도(Future-frame L1), (ii) 개입 민감도 예측(Causal L1), (iii) 감소된 시각적 증거에 대한 강건성(Mask-ratio slope)을 개선하는 동시에, (iv) 재현 가능한 운동 정보 트레이드오프(Motion cosine)를 드러냅니다. 방법론 순위는 2B 및 1B V-JEPA 2.1 백본(backbones) 전반에 걸쳐 rho = 0.895에서 0.978로 재현됩니다. 우리는 DENSEWORLD-115k 데이터셋(https://huggingface.co/datasets/anonymousML123/denseworld-115k)과 수술식 학습(surgery-trained)된 FactorJEPA 체크포인트(https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_vitg_1B/train/m09c_surgery_3stage_DI_diheavy_encoder)를 공개적으로 출시합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기