TriWorldBench: 체화된 세계 모델을 위한 삼중 시점 일관성 관점
요약
본 논문은 로봇의 체화된 세계 모델(Embodied world models)을 평가하기 위한 새로운 벤치마크인 TriWorldBench를 소개합니다. 이 벤치마크는 헤드, 왼쪽 손목, 오른쪽 손목 등 삼중 시점의 동기화된 비디오 데이터를 사용하며, 50개의 양손 조작 작업에 걸쳐 총 500개 에피소드로 구성되어 있습니다.
핵심 포인트
- TriWorldBench는 로봇 동작 예측을 위한 새로운 평가 기준입니다.
- 헤드/손목 등 삼중 시점의 일관성을 종합적으로 검증합니다.
- 삼중 시점 일관성, 물리적/3D 일관성 등 19가지 지표를 사용합니다.
- 단순한 개별 비디오 품질을 넘어선 통합적인 세계 모델 평가가 가능합니다.
체화된 세계 모델(Embodied world models)은 학습과 계획을 지원하기 위해 로봇 동작의 결과를 예측합니다. 헤드 카메라와 손목 카메라를 장착한 로봇의 경우, 이는 상호 보완적인 뷰가 필요합니다. 헤드 뷰는 전체 작업을 포착하는 반면, 손목 뷰는 국소적인 그리퍼-객체 상호작용을 드러냅니다. 하지만 이러한 뷰들을 개별적으로 평가하는 것만으로는 이들이 동일한 동작과 객체 상태를 설명하는지 여부를 판단할 수 없습니다. 우리는 동기화된 헤드, 왼쪽 손목, 오른쪽 손목 비디오를 통해 체화된 세계 모델을 평가하기 위한 벤치마크인 TRIWORLDBENCH를 소개합니다. 이 벤치마크는 50개의 양손 조작 작업에 걸쳐 500개 에피소드로 구성되어 있으며, 삼중 시점 일관성(tri-view consistency), 작업 정렬(task alignment), 물리적 및 3D 일관성(physical and 3D coherence), 동작 품질(motion quality), 시간적 일관성(temporal consistency), 그리고 시각적 품질(visual quality)을 평가하는 19가지 지표를 사용합니다. 교차 뷰 검사(cross-view checks)와 각 카메라에 맞춘 측정치를 결합함으로써, 이 벤치마크는 그럴듯한 개별 비디오들이 의도된 작업의 일관된 예측을 형성하는지 여부를 평가합니다. 우리는 TWB-Score로 전체 성능을 요약하고, 예측이 실패하는 지점을 식별하기 위해 각 뷰별 결과를 유지합니다. 이는 세계 모델 평가를 단일 시점의 시각적 품질을 넘어 확장합니다. 코드, 데이터 및 지표 정의는 https://github.com/TriWorldBench/TriWorldBench에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기