꿈꾸는 세상 속에서 살아가는 AI 에이전트
요약
에이전트가 영상을 관찰하고 다음 프레임을 예측하며 스스로 학습하는 '월드 모델(World Models)' 연구를 소개합니다. 특히 멀티 플레이어 환경에서 에이전트 간의 상호 반응을 함께 예측할 때 꿈(시뮬레이션)이 현실과 일치하며 유지됨을 증명합니다.
핵심 포인트
- 에이전트가 실제 환경 대신 꿈(시뮬레이션) 속에서 안전하게 학습 가능
- 싱글 플레이어 모델은 예측 오차 누적으로 인해 시뮬레이션이 빠르게 붕괴됨
- 멀티 플레이어 모델은 상호 작용을 결합 예측하여 현실적인 꿈을 유지함
- 멀티 에이전트 환경에서는 상호 반응 모델링이 핵심적인 요소임
에이전트가 게임을 관찰하고, 다음 프레임을 환각(hallucinate)하는 법을 배우며, 자신만의 꿈속에서 플레이합니다. 하지만 플레이어들이 서로에게 반응한다는 사실을 아는 모델만이 그 꿈을 진실되게 유지합니다.
요약 (TL;DR): 현재 에이전트 분야에서 가장 뜨거운 아이디어는 에이전트에게 실제 세상을 먹이는 것이 아니라, 세상을 꿈꾸게(dream) 하는 것입니다. 에이전트가 영상을 관찰하고, 다음 프레임을 환각하는 법을 배우며, 자신의 머릿속에서 연습하는 방식입니다. 저는 아주 작은 모델을 구축했고, 한 가지 허점을 발견했습니다. 꿈이 진실되게 유지되려면 플레이어들이 서로에게 반응한다는 것을 알아야 한다는 점입니다. 노트북에서도 실행 가능합니다.
세상 (The world)
11개의 셀로 이루어진 복도에 두 명의 플레이어가 있습니다: 포식자가 먹잇감을 향해 다가가면, 먹잇감은 멀어집니다. 모든 움직임은 하나의 _반응(reaction)_입니다. 에이전트는 무작위 게임을 관찰한 뒤, 눈을 감고 15프레임 앞을 꿈꾸며(dreams 15 frames ahead), 각 예측값을 다음 입력값으로 다시 피드백합니다. 저는 정확히 동일한 영상으로부터 두 가지 형태의 드림어(dreamer)를 구축했습니다:
- 싱글 플레이어 (single-player) — 각 플레이어를 자신의 위치만으로 예측함
- 멀티 플레이어 (multiplayer) — 두 위치를 함께(together) 예측함
이것이 2026년 MIRA의 도약입니다: 단순히 물리 법칙만이 아니라, 에이전트들이 서로에게 반응하는 것을 시뮬레이션하는 월드 모델(world models)입니다.
10초 요약 버전
꿈이 현실과 여전히 일치하는 비율, 예측 프레임 수:
| 예측 프레임 수 | 1 | 3 | 5 | 10 | 15 |
|---|---|---|---|---|---|
| 싱글 플레이어 꿈 | 11 | 0 | 0 | 9 | 0 |
| 멀티 플레이어 꿈 | 100 | 100 | 100 | 100 | 100 |
싱글 플레이어의 꿈은 거의 즉시 무너집니다. 반면 멀티 플레이어의 꿈은 과정 내내 현실에 고정되어 유지됩니다.
작동 원리
real = dream = start
for _ in range(15):
real = real_next(*real) # 실제로 일어나는 일
...
동일한 영상, 동일한 루프입니다. 유일한 차이점은 모델이 두 플레이어를 결합하여(jointly) 예측하는지, 아니면 독립적으로 예측하는지 여부입니다.
싱글 플레이어가 붕괴하는 이유
먹잇감은 포식자가 움직였기 때문에 움직입니다. 먹잇감만을 바라보는 모델은 이를 인지할 수 없으며, 따라서 아주 작은 오차들이 매 프레임마다 누적되어 결국 꿈은 순수한 허구가 되어버립니다. 멀티플레이어 모델은 양쪽 모두를 조건화(conditioning)하므로, 그 반응을 포착하여 실제 게임을 계속해서 재예측합니다.
당신이 행동할 수 있는 꿈은 초능력과 같습니다. 에이전트는 수천 가지의 위험한 움직임을 비용 없이 연습할 수 있습니다. 하지만 다른 모든 존재가 당신에게 반응한다는 사실을 잊어버린 꿈은 연습이 아닙니다. 그것은 망상입니다.
왜 흥미로운가
꿈꾸는 세상(Dreamed worlds)은 에이전트가 실제 세계의 비용 없이 무한히, 그리고 안전하게 리허설을 할 수 있게 해줍니다. 이 토이(toy) 모델이 주는 교훈은 다음과 같습니다. 멀티 에이전트 (multi-agent) 꿈을 위해서는 반응을 모델링해야 하며, 그렇지 않으면 전체 시스템이 표류(drift)하게 됩니다. 이를 제대로 구현하면 에이전트는 상상 속에서 완전히 서로를 상대로 계획을 세울 수 있습니다.
시도해보기
git clone https://github.com/Shridhar-2205/secret-lives-of-agents
cd secret-lives-of-agents/03-dreamed-world && python demo.py
시리즈 — The Secret Lives of AI Agents
- 에이전트들이 자신들만의 언어를 발명하다
- 에이전트들이 부식되는 메모장에 문화를 구축하다
- 꿈꾸는 세상 속에서 살아가는 에이전트 (현재 위치)
Shridhar Shah — Cisco AI 팀의 시니어 소프트웨어 엔지니어. GitHub · LinkedIn
출처: arXiv:2607.15832 (MIRA, 2026); Ha & Schmidhuber, World Models (2018).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기