WOVEN: 시각적 세계 모델링을 멀티모달 LLM에 직조하다
요약
본 논문은 멀티모달 LLM(MLLMs)이 공간적, 물리적 추론에 어려움을 겪는 문제를 지적하고, 이를 해결하기 위한 새로운 훈련 원시 요소이자 벤치마크인 WOVEN을 제안합니다. WOVEN은 장면, 동작, 추론 유형별로 체계적인 전환 감독을 제공하며, MLLMs를 이 데이터셋으로 훈련했을 때 광범위하게 전이되는 공유 능력을 학습함을 입증했습니다.
핵심 포인트
- WOVEN은 시각적 전환 추론을 위한 새로운 벤치마크이자 훈련 소스입니다.
- 최첨단 MLLMs도 체계적인 시각 세계 모델링에 상당한 결함을 보였습니다.
- WOVEN으로 훈련된 MLLMs는 외부 벤치마크에서 높은 전이 성능 향상을 보였습니다.
- 시각적 전환 추론은 MLLMs의 재사용 가능한 공유 능력을 확립하는 핵심 기반입니다.
멀티모달 대규모 언어 모델(MLLMs)은 공간적, 체화적, 물리적, 시간적 추론에 어려움을 겪습니다. 우리는 이러한 실패가 시각적 전환 추론(visual transition reasoning)의 공통된 결함을 반영한다고 가정하고, 이 능력이 다양한 모델이 서로 다른 감독 소스로부터 학습하고 다양한 작업에서 재사용할 수 있는 공유 훈련 원시 요소(shared training primitive) 역할을 할 수 있는지 테스트합니다. 체계적인 훈련 레시피를 통해 이를 구현하는 것입니다. 기존의 벤치마크들은 이러한 결함들을 개별적으로 문서화하지만, 장면(scene), 동작(action), 추론 연산에 걸친 통제된 비교를 지원하지 않습니다. 따라서 우리는 WOVEN을 소개합니다. 이는 시각적 전환 추론을 위한 훈련 소스이자 벤치마크로, 다양한 비디오 사전 학습 생성 모델로부터 얻은 현실적인 롤아웃(rollouts)을 사용하여 장면, 동작, 추론 유형별로 전환 감독을 구성했습니다: 총 20개 장면 유형, 5개 동작 유형, 8개 추론 유형에 걸쳐 36,076개의 예시를 포함합니다. 먼저 우리는 38개의 최첨단 MLLMs(예: GPT-5.4 및 Qwen3-VL-235B-A22B)을 평가하고 상당하고 체계적인 결함을 발견했습니다. 심지어 가장 강력한 모델들조차 인간보다 훨씬 낮으며, 실패는 모델 계열 전반에 걸쳐 반복되고 규모가 커져도 지속됩니다. 그런 다음 우리는 MLLMs를 WOVEN에서 여러 규모로 훈련시키고, 이들이 광범위하게 전이되는 공유 능력을 학습한다는 것을 발견했습니다: 각 약 2,000개 항목의 하위 집합만을 훈련시키는 것이 총 26개의 외부 벤치마크 중 22개를 최대 27.3 퍼센트 포인트까지 향상시키고, WOVEN 데이터는 특정 작업 자체의 훈련 데이터 중 30~50%를 비슷한 정확도로 대체할 수 있습니다. 통제된 비교는 또한 시각적 세계 모델링을 위한 훈련 레시피를 제공하며, 이는 보류된(held-out) 벤치마크에서 예측적으로 검증되었습니다: 장면, 동작 또는 도메인별로 보여주는 것이 아니라, 가르치는 추론 연산에 의해 감독을 선택하고, 견고성을 위해 시각 상태의 더 큰 변화를 선호해야 합니다. 우리의 연구는 시각적 전환 추론이 MLLMs에서 체계적인 시각 세계 모델 훈련을 위한 재사용 가능한 기반임을 확립합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기