AI 월드 모델 (World Models)을 위한 실용적인 분류 체계 구축
요약
AI 분야에서 혼용되는 '월드 모델(World Models)'의 개념을 명확히 정의하고, 이를 체계적으로 분류하기 위한 새로운 분류 체계와 벤치마크를 제안합니다. 단순한 비디오 생성을 넘어 물리적 일관성과 행동 예측 능력을 갖춘 모델의 중요성을 강조합니다.
핵심 포인트
- 월드 모델에 대한 광범위하고 일관된 작동 정의 제시
- 단순 생성 모델과 진정한 월드 모델의 차이점 규명
- 단일 점수 기반 리더보드의 한계와 다각적 평가 필요성 강조
- 강화학습, 로보틱스, 자율주행 등 다양한 도메인 통합
**월드 모델 (world model)**이라는 용어는 현재 AI 분야 어디에서나 거의 모든 곳에서 사용되고 있습니다.
하지만 이 용어가 더 자주 등장할수록, 때로는 의미가 더 불분명해지기도 합니다.
강화학습 (Reinforcement Learning) 연구자는 잠재 역학 모델 (latent dynamics model)을 지칭하기 위해 이 용어를 사용할 수 있습니다. 로보틱스 (robotics) 팀은 행동 조건부 시뮬레이터 (action-conditioned simulator)를 위해 사용할 수 있습니다. 비디오 생성 기업은 거대 생성 모델 (large generative model)을 월드 모델이라고 설명할 수 있습니다. 자율 주행 기업은 교통 시나리오를 생성하는 시스템에 대해 동일한 표현을 사용할 수 있습니다.
이 모든 시스템은 공통점을 가지고 있습니다.
하지만 그들이 해결하려는 문제가 정확히 같지는 않습니다.
그것이 저희 보고서의 시작점이었습니다:
State of World Models 2026: Taxonomy, Benchmarks and Open Challenges
저희는 하나의 글로벌 점수를 가진 또 다른 리더보드 (leaderboard)를 만들고 싶지 않았습니다. 그것은 이해하기는 쉽겠지만, 아마도 오해의 소지가 있을 것입니다.
대신, 저희는 더 근본적인 질문에 답하려고 노력했습니다:
비교를 시도하기 전에 어떻게 하면 월드 모델을 일관된 방식으로 설명할 수 있을까?
작동 정의 (A working definition)
보고서를 위해 저희는 다음과 같은 정의를 사용했습니다:
월드 모델이란 환경의 표현 (representation)을 학습하고, 이를 사용하여 해당 환경 내부에서의 예측, 시뮬레이션, 평가 또는 행동을 지원하는 AI 모델이다.
이 정의는 의도적으로 광범위합니다.
다음 항목들을 포함할 수 있습니다:
- 모델 기반 강화학습 (model-based reinforcement learning)
- 비디오 예측 (video prediction)
- 로보틱스 시뮬레이터 (robotics simulators)
- 체화된 AI (embodied AI)
- 자율 주행 모델 (autonomous driving models)
- 공간 및 3D 모델 (spatial and 3D models)
- 절차적 또는 에이전트 기반 환경 (procedural or agentic environments)
하지만 모든 생성 모델 (generative model)이 자동으로 월드 모델이라고 불려서는 안 됩니다.
어떤 모델은 아름다운 비디오를 생성할 수는 있지만, 객체의 정체성 (object identity), 물리적 일관성 (physical consistency), 공간 구조 (spatial structure) 또는 행동의 결과 (consequence of actions)를 유지하는 데 실패할 수 있습니다.
이것이 현재 논의에서 발생하는 주요 문제 중 하나입니다.
모델이 세상 속에서 행동하는 데 실제로 유용하지 않으면서도, 마치 세상을 이해하고 있는 것처럼 보일 수 있기 때문입니다.
보편적인 순위 매기기가 실제로 작동하지 않는 이유
세 가지 모델을 상상해 보십시오:
1 하나는 매우 사실적인 비디오를 생성합니다.
2 하나는 로봇이 움직임을 계획하는 것을 돕습니다.
3 하나는 자율 주행 (autonomous driving)을 위한 희귀한 교통 상황을 생성합니다.
어떤 것이 가장 좋은 월드 모델 (world model)일까요?
더 많은 맥락 없이는 진지한 답변을 내놓을 수 없습니다.
첫 번째는 시각적으로 더 나을 수 있습니다.
두 번째는 계획 (planning)에 더 나을 수 있습니다.
세 번째는 안전 테스트 (safety testing)에 훨씬 더 유용할 수 있습니다.
이 세 가지를 하나의 점수로 합치는 것은 모델들 사이의 중요한 차이점 대부분을 가리게 될 것입니다.
이것이 바로 우리가 전역적 순위 (global ranking) 대신 분류 체계 (taxonomy)로 이동한 이유입니다.
분류 프레임워크 (The classification framework)
이 프레임워크는 일련의 실용적인 필드 (fields)를 사용합니다.
| 필드 (Field) | 설명 (Description) |
|---|---|
| 이름 (Name) | 공개 모델 또는 벤치마크 이름 |
| ... |
이것은 완벽한 학술적 온톨로지 (ontology)를 지향하는 것이 아닙니다.
이는 매우 빠르게, 때로는 너무 빠르게 변화하는 분야를 탐색하기 위한 실용적인 도구입니다.
도메인 (Domain)은 여전히 중요합니다
가장 먼저 식별해야 할 것은 모델이 어떤 종류의 환경을 나타내도록 설계되었는가입니다.
현재 카테고리에는 다음이 포함됩니다:
- 강화학습 (reinforcement learning)
- 로보틱스 (robotics)
- 체화된 AI (embodied AI)
- 생성 비디오 (generative video)
- 자율 주행 (autonomous driving)
- 게임 (games)
- 산업 시뮬레이션 (industrial simulation)
- 공간 지능 (spatial intelligence)
- 소프트웨어 에이전트 (software agents)
이것은 당연하게 들릴 수 있지만, 거의 모든 것을 변화시킵니다.
로보틱스 모델과 비디오 모델은 모두 미래 상태 (future states)를 예측할 수 있습니다. 하지만 하나는 기계가 행동하는 것을 돕도록 기대되는 반면, 다른 하나는 주로 그럴듯한 장면을 생성하도록 기대될 수 있습니다.
평가는 이러한 차이를 반영해야 합니다.
기능 (Function) 또한 중요합니다
두 모델이 동일한 도메인에서 작동하더라도 목적은 매우 다를 수 있습니다.
월드 모델은 다음과 같은 목적으로 설계될 수 있습니다:
- 미래 상태 예측 (future-state prediction)
- 시뮬레이션 (simulation)
- 계획 (planning)
- 정책 평가 (policy evaluation)
- 합성 데이터 생성 (synthetic data generation)
- 표현 학습 (representation learning)
- 반사실적 추론 (counterfactual reasoning)
어떤 시스템은 이러한 기능 중 여러 개를 결합합니다. 다른 시스템은 매우 전문화되어 있습니다.
시각적으로 풍부한 모델은 시뮬레이션에는 탁월할 수 있지만, 명시적인 계획 (explicit planning)에 사용하기에는 어려울 수 있습니다.
작은 잠재 모델 (latent model)은 시각적으로 해석하는 것이 거의 불가능할 수 있지만, 에이전트 (agent)에게는 매우 유용할 수 있습니다.
내부 표현 (Internal representation)
월드 모델 (World models)은 환경을 매우 다양한 방식으로 표현할 수 있습니다.
어떤 연구들은 픽셀 (pixels)이나 비디오 프레임 (video frames)을 직접 다룹니다.
다른 연구들은 다음을 사용합니다:
- 잠재 벡터 (latent vectors)
- 토큰 (tokens)
- 객체 중심 상태 (object-centred states)
- 공간 그리드 (spatial grids)
- 3D 기하학 (3D geometry)
- 기호 변수 (symbolic variables)
- 하이브리드 표현 (hybrid representations)
각각의 선택에는 트레이드오프 (trade-offs)가 따릅니다.
픽셀 기반 시스템은 더 많은 시각적 세부 정보를 보존하지만, 비용이 많이 들고 추론 (reasoning)하기 어려울 수 있습니다.
잠재 시스템은 더 압축적이지만, 내부 상태를 해석하기가 대개 더 어렵습니다.
객체 기반 및 기호 시스템은 계획 (planning)을 더 자연스럽게 지원할 수 있지만, 환경에 대한 더 강력한 가정이 필요할 수 있습니다.
현재로서는 명확한 승자가 없습니다.
시간 지평 (Time horizon)은 종종 간과됩니다
다음 상태를 예측하는 모델이 반드시 유용한 미래를 시뮬레이션할 수 있는 것은 아닙니다.
따라서 우리는 다음과 같이 구분합니다:
- 다음 상태 예측 (next-state prediction)
- 단기 지속 (short-term continuation)
- 중기 롤아웃 (medium-length rollouts)
- 장기 지평 예측 (long-horizon prediction)
- 절차적 계획 (procedural planning)
이것이 중요한 이유는 많은 모델이 몇 프레임 동안은 강력해 보이지만, 더 긴 기간 동안은 불안정해지기 때문입니다.
작은 오류들이 축적됩니다.
객체들이 표류합니다. 기하학이 변합니다. 상태가 서서히 의미를 잃어갑니다.
계획 (planning)의 경우, 모든 실수가 다음의 모든 결정에 영향을 미칠 수 있기 때문에 이 문제는 훨씬 더 심각해집니다.
행동 조건화 (Action conditioning)가 핵심적인 차이일 수 있습니다
가장 중요한 질문 중 하나는 모델이 행동 (actions)을 이해하느냐 하는 것입니다.
수동적 모델 (passive model)은 다음을 추정합니다:
P(sₜ₊₁ | sₜ)
행동 조건부 모델 (action-conditioned model)은 다음을 추정합니다:
P(sₜ₊₁ | sₜ, aₜ)
여기서:
sₜ는 현재 상태 (current state)입니다.aₜ는 선택된 행동 (selected action)입니다.sₜ₊₁은 예측된 다음 상태 (predicted next state)입니다.
이 차이는 이론상으로는 작아 보입니다.
하지만 실제로는 사용 사례 (use case) 전체를 바꿉니다.
수동적 모델은 다음과 같이 답합니다:
다음에 무엇이 일어날 수 있는가?
행동 조건부 모델은 다음과 같이 답합니다:
내가 이것을 한다면 무엇이 일어날 수 있는가?
로보틱스 (Robotics), 자율 주행 (Autonomous driving), 그리고 소프트웨어 에이전트 (Software agents)의 경우, 보통 두 번째 질문이 더 유용합니다.
평가는 여전히 파편화되어 있습니다
현재의 벤치마크 (Benchmarks)들은 월드 모델링 (World modelling)의 서로 다른 부분들을 평가합니다.
어떤 것들은 시각적 품질 (Visual quality)에 집중합니다.
다른 것들은 물리적 일관성 (Physical consistency), 장기 추론 (Long-horizon reasoning), 행동 조건부 (Action conditioning) 또는 다운스트림 성능 (Downstream performances)을 살펴봅니다.
우리는 평가를 네 가지의 넓은 그룹으로 분류했습니다.
지각 평가 (Perceptual evaluation)
이는 출력이 설득력 있게 보이는지를 묻습니다.
예시로는 다음과 같은 것들이 있습니다:
- 비디오 품질 (Video quality)
- 이미지 품질 (Image quality)
- 시간적 매끄러움 (Temporal smoothness)
- 인간 선호도 (Human preference)
이러한 측정 방식들은 유용하지만 제한적입니다.
물리 평가 (Physical evaluation)
이는 환경이 그럴듯한 방식으로 작동하는지를 묻습니다.
가능한 기준으로는 다음과 같은 것들이 포함됩니다:
- 중력 (Gravity)
- 충돌 동작 (Collision behaviour)
- 운동 연속성 (Motion continuity)
- 객체 영속성 (Object permanence)
- 기하학적 보존 (Geometry preservation)
- 공간 관계 (Spatial relations)
이는 자동으로 평가하기가 훨씬 더 어려우며, 결과가 항상 비교하기 쉬운 것도 아닙니다.
기능 평가 (Functional evaluation)
이는 모델이 실제로 작업에 도움이 되는지를 묻습니다.
예를 들어:
- 로봇 계획 (Robot planning)을 개선하는가?
- 실제 세계와의 상호작용 (Real-world interactions)을 줄여주는가?
- 정책 (Policy)을 평가하는 데 도움이 되는가?
- 유용한 학습 데이터 (Training data)를 생성하는가?
- 작업 성공률 (Task success)을 향상시키는가?
이러한 종류의 평가는 시각적 품질보다 더 중요한 경우가 많지만, 수행하는 데 비용이 더 많이 듭니다.
계획 평가 (Planning evaluation)
이는 모델이 다단계 의사결정 (Multi-step decisions)을 내리는 데 도움이 되는지를 묻습니다.
모델은 가능한 궤적 (Trajectories)을 비교하고, 위험을 추정하며, 행동을 선택하거나 긴 시퀀스 동안 상태 (State)를 유지해야 할 수도 있습니다.
현재의 시스템들은 여전히 이 부분에서 많은 어려움을 겪고 있습니다.
지각-기능 간극 (The perception-functionality gap)
현재 월드 모델 연구에서 가장 유용한 아이디어 중 하나는 지각 (Perception)과 기능성 (Functionality) 사이의 간극입니다.
모델이 인간 관찰자에게는 훌륭해 보이는 시퀀스를 생성할 수 있지만, 로봇에게는 여전히 사용할 수 없는 상태일 수 있습니다.
객체 위치의 작은 오류는 비디오 상에서는 거의 보이지 않을 수도 있습니다.
해당 객체를 잡으려는 로봇에게는 동일한 오류가 전체 예측을 무용지물로 만들 수 있습니다.
이것이 바로 시각적 사실성 (visual realism)만이 유일한 목표가 될 수 없는 이유입니다.
유용한 월드 모델 (world model)은 에이전트 (agent)가 더 나은 결정을 내릴 수 있도록 도와야 합니다.
단순하게 들릴 수 있지만, 이는 모델을 평가해야 하는 방식을 변화시킵니다.
단순한 데이터 구조
월드 모델 카탈로그는 상당히 단순한 JSON 구조로 표현될 수 있습니다.
{
"name": "Example World Model",
"organization": "Example Lab",
...
이를 통해 다음과 같은 작업이 더 쉬워집니다:
- 도메인 (domain)별 필터링
- 행동 조건부 (action-conditioned) 시스템 비교
- 오픈 소스 (open-source) 프로젝트 식별
- 로보틱스 모델과 비디오 모델의 분리
- 벤치마크 (benchmarks) 추적
- 누락된 정보 탐색
또한 분류 체계 (taxonomy)가 변경될 때마다 모든 프로필을 수동으로 다시 작성하는 것을 방지할 수 있습니다.
추측하는 것보다 모르는 것이 낫다
많은 최첨단 모델 (frontier models)들이 충분히 잘 문서화되어 있지 않습니다.
이러한 경우, 올바른 값은 종종 다음과 같습니다:
unknown
다음과 같은 값이 아닙니다:
probably yes
어떤 기업은 평가 프로토콜 (evaluation protocol)을 공개하지 않은 채 모델이 물리학을 이해한다고 주장할 수 있습니다.
어떤 데모는 모델 인터페이스 (model interface)를 명확히 문서화하지 않은 채 행동 조건부 (action conditioning)를 암시할 수 있습니다.
어떤 논문은 데이터셋을 공개하지 않은 채 설명만 할 수도 있습니다.
카탈로그는 아마도 사실일 것 같은 내용이 아니라, 알려진 사실을 반영해야 합니다.
이는 공개 문서가 불완전할 수 있는 독점 시스템 (proprietary systems)의 경우 특히 중요합니다.
증거와 해석은 분리되어야 한다
좋은 모델 프로필은 다음 사항들을 명확히 구분해야 합니다:
- 문서화된 정보 (documented information)
- 외부 평가 (external evaluation)
- 편집자적 해석 (editorial interpretation)
예를 들어:
Documented:
The model accepts video and action inputs.
...
이렇게 하면 정보를 더 신뢰하기 쉬워지며, 나중에 수정하기도 쉬워집니다.
벤치마크는 자체적인 구조가 필요하다
벤치마크를 모델과 동일한 테이블에 직접 섞어서는 안 됩니다.
벤치마크에는 별도의 필드가 필요합니다.
벤치마크 레코드는 다음과 같이 보일 수 있습니다:
{
"name": "Example Benchmark",
"year": 2026,
...
모델은 이후 테스트에 사용된 벤치마크 (benchmarks)와 연결될 수 있습니다.
이는 다음 사항들을 보존하는 데 도움이 됩니다:
- 벤치마크 버전 (benchmark version);
- 결과 날짜 (result date);
- 보고된 점수 (reported score);
- 출처 참조 (source reference);
- 평가 조건 (evaluation conditions).
마지막 항목이 중요한 이유는 벤치마크 결과가 매우 빠르게 구식이 될 수 있기 때문입니다.
버전 관리 (Versioning)의 필수성
월드 모델 (world-model) 분야는 정적인 데이터베이스가 감당하기에는 너무 빠르게 변화합니다.
모델은 업데이트됩니다.
벤치마크는 진화합니다.
새로운 논문들이 이전의 주장들을 바로잡습니다.
기본적인 버전 관리 방식은 다음과 같을 수 있습니다:
v1.0.0 — 초기 공개 데이터셋
v1.1.0 — 새로운 모델 및 벤치마크
v1.1.1 — 수정 및 메타데이터 수정
...
각 릴리스에는 다음이 포함되어야 합니다:
- 발행 날짜 (publication date);
- 변경 이력 (changelog);
- 데이터셋 스냅샷 (dataset snapshot);
- 방법론 버전 (methodology version);
- 인용 정보 (citation information).
이는 보고서나 데이터셋이 발행 후에 조용히 변경되는 것을 방지합니다.
제외 대상
월드 모델 디렉토리는 쉽게 일반적인 AI 카탈로그가 될 수 있습니다.
따라서 몇 가지 제외 규칙이 필요합니다.
현재 프레임워크에서는 다음을 제외합니다:
- 시간적 역학 (temporal dynamics)이 없는 정적 이미지 생성기;
- 월드 상태 (world-state) 활용 사례가 없는 일반 언어 모델 (general language models);
- 학습된 구성 요소 (learned component)가 없는 전통적인 시뮬레이터;
- 충분한 기술적 근거가 없는 마케팅적 주장;
- 공개 정보가 너무 적은 프로젝트;
- "월드 모델"이라는 용어가 주로 브랜딩 용도로 사용되는 시스템.
이것이 해당 시스템들이 유용하지 않다는 의미는 아닙니다.
단지 범위를 이해 가능한 수준으로 유지하는 데 도움을 줄 뿐입니다.
오픈 소스 (Open source)가 재현성 (reproducible)과 동일한 것은 아니다
어떤 프로젝트는 논문만을 제공할 수도 있습니다.
어떤 프로젝트는 코드는 제공하지만 가중치 (weights)는 제공하지 않을 수 있습니다.
또 다른 프로젝트는 가중치는 제공하지만 학습 파이프라인 (training pipeline)은 제공하지 않을 수 있습니다.
따라서 가용성 (availability)은 단순히 "오픈 (open)" 또는 "클로즈드 (closed)"보다 더 상세한 정보가 필요합니다.
예를 들어:
{
"paper": true,
"code": true,
...
이는 재현성에 대해 훨씬 더 현실적인 그림을 제공합니다.
프레임워크의 한계
이 분류 체계 (taxonomy)는 아직 완성되지 않았습니다.
"월드 모델"이라는 용어는 여전히 불안정합니다.
많은 시스템이 여러 카테고리에 속합니다.
공개된 정보는 불완전합니다.
서로 다른 커뮤니티는 서로 다른 평가 표준 (evaluation standards)을 사용합니다.
그리고 어떤 구조화된 데이터셋도 논문이나 아키텍처 (architecture)의 모든 미묘한 차이를 포착할 수는 없습니다.
따라서 이 프레임워크 (framework)는 탐색 도구로서 사용되어야 합니다.
이것이 원본 연구를 읽는 것을 대체하지는 않습니다.
왜 이를 공개적으로 게시하는가
분류 체계 (taxonomy)를 공개하는 주요 이유는 간단합니다: 수정이 필요하기 때문입니다.
폐쇄적인 데이터베이스는 매우 빠르게 구식이 될 것입니다.
개방된 구조는 연구자, 엔지니어 및 독자들이 다음과 같은 작업을 할 수 있도록 합니다:
- 누락된 모델 보고
- 사실 관계 오류 수정
- 더 나은 출처 제안
- 분류에 대한 이의 제기
- 새로운 분야 제안
- 벤치마크 (benchmark)의 약점 지적
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기