세계 모델이란 무엇인가? - AI가 '머릿속'에서 미래를 시뮬레이션하며 행동하는 메커니즘
요약
본 기사는 '세계 모델(World Model)'의 개념을 소개하며, AI가 단순히 다음 토큰을 예측하는 LLM 단계를 넘어 현실 세계에서 행동하는 Physical AI로 발전하는 과정을 설명합니다. World Model은 '다음 단어' 대신 '다음 세계 상태'를 예측하여 로봇 계획 및 제어에 활용되는 것이 핵심입니다.
핵심 포인트
- World Model은 '다음 토큰'이 아닌 '다음 세계의 상태'를 예측합니다.
- Physical AI는 로봇으로서 현실에서 행동하며 세상 변화를 시뮬레이션하는 것을 목표로 합니다.
- 세계 모델은 단순히 사실적인 비디오 생성을 넘어, 물리 법칙과 일관된 이해가 중요합니다.
- 예측 오차는 단기적으로 작아도 장시간 전개 시 누적되어 계획의 어려움을 보여줍니다.
- 'Physical AI'라는 단어만 앞서 나가면서 그 내용이 모호해지고 있습니다.
- 텍스트, 이미지, 음성, 영상으로 크게 발전한 AI에 비해, '세상이 어떻게 변화할지', '내가 행동하면 무슨 일이 일어날지'를 다루는 세계 모델(World Model)에 대한 일본어 자료는 아직 많지 않습니다. 이에 IT 엔지니어를 대상으로 약 70페이지 분량으로 정리했습니다. 본 기사는 그 소개입니다.
생성 AI라고 하면, 먼저 LLM을 떠올리는 사람이 많을 것입니다.
LLM은 간단히 말해 문맥으로부터 '다음 토큰(next token)'을 예측합니다.
그렇다면, AI가 글을 쓰는 것이 아니라 로봇으로서 현실 세계에서 행동한다면 어떨까요? 즉 Physical AI입니다.
책상 위의 컵을 집는 것만으로도,
- 팔을 움직이면 손끝은 어디로 갈지
- 컵을 누르면 넘어질지
- 들어 올린 후 힘을 풀면 어떻게 될지
와 같이, **'내가 행동하면 세상이 어떻게 변할까'**를 생각해야 합니다.
여기서 초점은,
'다음 단어(next word)'에서 '다음 세계의 상태(next world state)'로 이동합니다.
Physical AI라는 용어는 빠르게 확산되고 있지만, 일반적인 소개 자료에서는
이것은 미래의 픽셀을 모두 생성하는 것이 아니라, 표현 그 자체를 예측하는 방향입니다.
'잎사귀가 몇 픽셀 오른쪽으로 움직일지'보다는, '물체가 이동했다'라는 추상적인 정보를 포착하려고 합니다.
I-JEPA는 이미지 표현 학습(Image Representation Learning), V-JEPA는 비디오(Video), V-JEPA 2에서는 로봇 계획 연결까지 나오고 있습니다.
대표적인 예시로는,
- GAIA-1
- Sora
- Genie
- Cosmos
- Marble
등이 있습니다.
비디오나 3D 세계 자체를 생성하고, 나아가 조작 가능한 세계로 발전시키려는 흐름입니다.
다만, 이 세 가지는 배타적인 분류가 아닙니다.
Dreamer는 잠재 표현(latent representation)도 강화학습(RL)도 사용하며, 생성형 모델 내부에도 latent dynamics가 존재합니다.
따라서,
'어떤 것이 진짜 세계 모델인가'가 아니라, '무엇을 표현하고, 무엇을 예측하며, 그것을 무엇에 사용하는지'로 보는 것이 더 이해하기 쉽습니다.
여기서 매우 중요합니다. '세계 모델'이 환경을 인식하고 다음 상태를 예측할 수 있다는 것이 비디오가 사실적이라면 세계를 이해했다고 말할 수 있을까요?
답은, 그렇다고는 한정되지 않습니다.
고품질의 비디오를 만들었더라도,
- 물체의 상태가 올바른지
- 물리 법칙에 모순되지 않는지
- 행동에 올바르게 반응하는지
- 장시간 전개해도 붕괴하지 않는지
- 실제 계획에 도움이 되는지
는 별개의 문제입니다.
세계 모델에서는,
Visual Fidelity $
e$ World Understanding
정도 생각하고 있는 것이 안전합니다.
이번 『세계 모델 입문』에서는 제5장에서 작은 Mini World Model도 구현했습니다. 2차원 Toy World에서, state + action → next state를 작은 신경망에 학습시킵니다. Challenge 환경에서의 한 단계 예측 오차는 평균 약 0.00438이었습니다. 상당히 작아 보입니다.
하지만 그 예측 결과를 다음 입력으로 하여 20단계 미래까지 전개하면, 오차가 쌓입니다.
저장된 실패 사례에서는,
- H1: 약 0.00371 - H20: 약 0.369
까지 커졌습니다. 이것이 세계 모델의 흥미로우면서도 어려운 점입니다.
'한 발 앞을 예측할 수 있다'는 것과 '미래를 사용하여 안전하게 계획할 수 있다'는 것은 같지 않습니다.
특히 큰 것이 Physical AI / Robotics와의 연결입니다. 실로봇에서는,
일단 움직여보며 실패하며 배우는 것이 쉽지 않습니다.
비싸고, 시간도 걸리며, 고장 날 수도 있습니다.
그렇기 때문에,
현실에서 시도하기 전에 내부 모델 안에서 시도하는 것의 가치가 커집니다. '세계 모델'은 개념적으로,
state / observation + action → future state / observation
을 중심으로 하는 예측 모델입니다.
한편, Physical AI에서 주목받는 VLA는 개념적으로
observation + language → action
을 중심으로 하는 정책(policy)입니다.
이번에 이 부분을 정리하여 **『세계 모델 입문』**으로 만들었습니다. 대상은 세계 모델을 전문적으로 연구하는 사람이라기보다,
LLM이나 생성 AI는 알지만, Dreamer, JEPA, Genie, Cosmos, Physical AI의 관계가 잘 모르는 IT 엔지니어를 상정하고 있습니다.
내용으로는,
- 세계 모델이란 무엇인가
- 세계 모델을 이해하기 위한 최소한의 AI
- 연구 전체의 지도
- World Models → PlaNet → Dreamer
- JEPA / V-JEPA
- Generative / Interactive World Models
- Mini World Model 구현
- Physical AI / Robotics
- Predictive Coding / FEP / Active Inference
- 세계 모델 평가와 미해결 문제
까지 다루고 있습니다.
전문, 도판, 제5장 구현 코드는 GitHub에 공개했습니다.
👉 GitHub: 『세계 모델 입문』
세계 모델을 한마디로 말하자면,
'세상의 변화를 내부에서 시도해 보면서 더 나은 행동을 선택하기 위한 모델'
입니다. LLM의 '다음 토큰 예측'에서 관점을 조금 넓혀서,
다음에 세상이 어떻게 될지
내가 행동하면 무엇이 일어날지
그 미래를 사용해서 무엇을 선택할지
를 생각하는 것입니다.
그렇게 Dreamer, JEPA, 생성 세계 모델(Generative World Model), Physical AI까지 하나의 지도로 보입니다.
-
세계 모델 학습을 위한 도서 소개
-
세계 모델 관련하여 생성형 AI 관련 학습을 위한 도서 소개
본 기사 작성에는 ChatGPT를 사용했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기