당신의 다음 주역은 인간이 아닐 수 있다
요약
AI가 단순한 NPC나 게임 내 AI를 넘어, 여러 게임에 걸쳐 지속적으로 발전하고 전이할 수 있는 '지속적 에이전트'로 진화하고 있습니다. 이는 플레이어가 컨트롤러를 잡는 대신, 지능을 코칭하는 역할로 변화함을 의미합니다. Google DeepMind의 SIMA 연구는 이 개념을 뒷받침하며, 여러 환경에서 훈련된 에이전트가 놀라운 전이 능력을 보여주었습니다.
핵심 포인트
- AI가 게임 내 AI를 넘어 지속적이고 발전 가능한 '에이전트'로 진화 중입니다.
- 에이전트는 이름, 기억, 기술 등 개인적인 특성을 가지며 여러 환경에서 활동할 수 있습니다.
- DeepMind의 SIMA 연구는 여러 상용 게임 환경에서 훈련된 에이전트의 전이 능력을 입증했습니다.
- 미래에는 게임이 지능을 공급하기보다, 일반 에이전트를 개발하는 '환경' 역할을 할 것입니다.
에디터 노트: 이 이야기는 AI의 도움을 많이 받았습니다. 하지만, 저희는 이것이 충분히 흥미로운 전제를 가지고 있어 여러분의 시간을 들일 가치가 있다고 생각합니다. 주의해서 진행해 주세요. 🤖
AI는 NPC(Non-Player Character), 상대방, 그리고 벤치마크로서 게임에 진입했습니다. 다음 변화는 더 이상할 수 있습니다: 인간이 훈련시키고 한 게임에서 다른 게임으로 가져갈 수 있는 지속적인 인공 플레이어입니다.
비디오 게임 역사 대부분 동안, 역할은 명확했습니다. 게임이 세계를 담고 있습니다. 게임이 규칙을 담고 있습니다. 게임이 인공지능(AI)을 담고 있습니다. 인간은 그 모든 것 밖에 앉아 컨트롤러를 잡습니다.
AI가 극적으로 더 유능해짐에도 불구하고, 우리는 대부분 그 정신적 모델을 유지했습니다.
우리는 AI를 게임 안에 넣어 NPC, 적, 그리고 시뮬레이션된 인구에 대한 통제를 합니다. 체스나 StarCraft부터 Minecraft까지 게임을 플레이하는 AI 시스템을 구축합니다.
그리고 점점 더, 우리는 AI 벤치마크로서 게임을 사용하는데, 왜냐하면 동적 환경은 정적 테스트가 놓치는 계획, 추론 및 적응 능력을 드러낼 수 있기 때문입니다.
하지만 네 번째 범주가 등장할 수도 있습니다. 게임에 내장된 AI는 아닙니다. 일시적으로 게임을 플레이하는 파운데이션 모델(foundation model)도 아닙니다. 파운데이션 모델을 순위를 매기도록 설계된 게임도 아닙니다.
더 지속적인 무언가: 한 사람에게 속하고, 시간이 지남에 따라 발전하며, 여러 게임에 진입할 수 있는 인공 플레이어입니다.
당신이 에이전트(agent)를 가지고 있다고 상상해 보세요.
그것은 이름과 기억, 기술, 전략, 선호도, 도구를 가집니다. 성공과 실패의 이력이 있습니다. 어쩌면 평판까지도요.
당신은 그것을 몇 달 또는 몇 년 동안 수정합니다.
그러고 나서는, 각 게임이 지능을 공급하는 대신, 게임들이 당신의 지능이 경쟁할 수 있는 환경을 제공합니다.
아키텍처는 다음에서 변화합니다:
게임 → 내장 AI
에 더 가까운 무언가로:
인간 → 지속적 에이전트 → 공통 인터페이스 → 게임 A / 게임 B / 게임 C
만약 그것이 일어난다면, 게이밍에서 가장 익숙한 가정 중 하나가 깨지기 시작합니다.
플레이어가 컨트롤러를 잡고 있는 사람이 아닐 수 있습니다. 플레이어는 그 지능을 붙잡고 있는 코치가 될 수 있습니다.
우리는 이미 게임을 하는 AI를 넘어 이동하고 있다
이 아이디어의 개별적인 조각 중 어느 것도 특별히 미래지향적이지 않습니다.
Google DeepMind의 SIMA 연구는 단일 게임을 마스터하는 에이전트가 아니라 여러 3D 가상 환경에서 활동하도록 설계된 에이전트를 이미 탐구하고 있습니다.
원래의 SIMA는 9개의 상용 게임과 여러 연구 환경에 걸쳐 훈련 및 테스트되었습니다. 더 중요하게도, 소스 코드나 맞춤형 게임 API 접근을 요구하지 않았습니다. 인간 플레이어처럼 화면에서 이미지를 소비하고 키보드 및 마우스 동작을 생성했습니다.
DeepMind는 또한 단순한 성능 이상의 흥미로운 점을 보고했습니다: 여러 게임에 걸쳐 훈련된 에이전트가 개별 게임에 대해 전문적으로 훈련된 에이전트보다 더 나은 성능을 보였고, 훈련에서 제외된 게임으로 평가된 에이전트는 해당 환경을 위해 특별히 훈련된 에이전트에 놀라울 정도로 근접했습니다.
그것은 우리가 미래에 훨씬 더 관심을 가질 수 있는 것의 초기 버전입니다: 세계 간 전이(transfer between worlds).
SIMA 2는 이 아이디어를 더욱 발전시킵니다. DeepMind는 이를 단순한 지침 따르기(instruction following)를 넘어 목표에 대한 추론, 사용자와의 소통, 그리고 가상 3D 세계에서의 경험을 통해 개선하는 것으로 설명합니다.
명시된 연구 방향은 단순히 “더 나은 게임 봇 구축”이 아닙니다. 게임들은 더 일반적인 에이전트를 개발하기 위한 환경으로 사용되고 있습니다.
마인크래프트(Minecraft)는 또 다른 중요한 선례를 만들었습니다.
2023년에 소개된 Voyager는 실행 가능한 기술의 끊임없이 성장하는 라이브러리를 가진 LLM 기반 평생 학습 에이전트였습니다. 모든 상황을 처음부터 해결하기보다는, 행동을 저장하고 나중에 검색하여 새로운 과제에 직면했을 때 결합할 수 있었습니다.
연구원들은 또한 하나의 마인크래프트 세계에서 배운 기술이 다른 세계에서도 재사용될 수 있음을 보여주었습니다.
Voyager는 게임 간 지속적인 에이전트(cross-game persistent agent)가 아닙니다. 이 구분이 중요합니다.
하지만 그것은 근본적인 것을 시연합니다: 경험이 세션이 끝날 때 사라지는 대신 에이전트의 일부가 될 수 있다.
한편, 게임 자체가 평가 인프라가 되고 있습니다.
BALROG는 계획(planning), 탐색(exploration), 시각적 추론(visual reasoning)을 포함한 역량을 테스트하기 위해 다양한 게임 환경에서 언어 및 비전-언어 에이전트를 평가합니다.
Kaggle의 Game Arena는 이와 유사한 아이디어를 가져와 게임을 동적인 모델 평가로 활용합니다. 현재 벤치마크 스위트에는 체스, 포커, Werewolf, Dark Hex, 체커 등을 포함한 여러 전략적 환경의 게임들이 포함되어 있습니다.
이 논리는 설득력이 있습니다. 정적인 벤치마크는 결국 포화 상태에 이릅니다. 하지만 게임은 계속해서 저항합니다. 모델들이 강해질수록 그들의 상대와 전략적 상황 역시 더 강력해질 수 있기 때문입니다. 따라서 발전 과정은 이미 눈에 보입니다.
AI가 개별 게임을 플레이하는 법을 배웠습니다. 그런 다음 에이전트들은 여러 세계를 넘나들며 작동하기 시작했습니다. 그리고 게임은 일반적인 역량을 평가하는 장소가 되었습니다.
흥미로운 질문은 에이전트 자체가 영속적인 객체(persistent object)가 될 때 무슨 일이 일어나는가입니다.
누락된 계층은 소유권이다
대부분의 현재 시스템은 여전히 플랫폼, 벤치마크 또는 연구 환경에 속해 있습니다.
지능은 그 아레나가 자신을 평가하도록 설계되었기 때문에 그 안으로 들어옵니다.
그 정체성, 순위, 그리고 역사는 보통 그 시스템 안에 존재합니다.
점점 더 흥미로운 예외들이 생겨나고 있습니다.
Agent Sports League와 같은 플랫폼은 개발자들이 외부 에이전트를 등록하고, API를 통해 연결하며, 여러 전략적 게임에서 경쟁하고 Elo 등급을 축적할 수 있도록 합니다.
AgentLeague 역시 자율 에이전트에게 정체성, 영속적인 순위, 그리고 공개적인 행동 기록을 부여하면서 경쟁하게 합니다.
이러한 플랫폼들이 거대한 새로운 산업이 이미 도착했다는 증거로 오해되어서는 안 됩니다. 이는 초기 실험 단계입니다.
하지만 이들은 중요한 아키텍처적 가능성을 보여줍니다.
다음 단계는 정체성이 아레나에 속하는 것이 아니라, 당신에게 속하는 것입니다.
당신의 에이전트는 오늘 전략 게임에서 경쟁하고, 내일 협상 게임에 참여하며, 다음 달에는 완전히 다른 개발자의 게임을 접할 수 있습니다.
그 밑바탕의 모델은 바뀔 수 있고, 사용하는 도구도 바뀔 수 있으며, 기술 또한 향상될 수 있습니다. 하지만 그 정체성과 축적된 역사는 유지될 수 있습니다. 이것은 동일한 모델을 여러 애플리케이션에 로드하는 것과는 다릅니다.
이는 마치 같은 플레이어를 여러 스포츠에 투입하는 것에 가깝습니다.
모델이 곧 플레이어일 필요는 없다
이러한 구분은 매우 빠르게 중요해집니다.
오늘날 우리는 AI 시스템을 그 모델로 식별하려는 경향이 있습니다.
GPT, Claude, Gemini, Llama. 다음 달에 등장하여 인터넷 전체가 다른 모든 것을 구식이라고 선언하게 만드는 무언가 말입니다.
하지만 지속적인 에이전트는 여러 계층으로 구성될 수 있습니다:
정체성 + 메모리 + 기술 + 정책 + 도구 + 역사 + 현재 모델
기반 모델은 대체 가능할 수 있습니다.
당신의 에이전트가 한 모델을 사용하며 경력을 시작하고, 6개월 후에 다른 모델로 이전하여 지연 시간이나 추론 비용이 중요한 대회에 세 번째 모델을 사용할 수도 있습니다.
그럼에도 여전히 같은 에이전트일까요?
이에 대해 보편적으로 받아들여지는 기술적 답변은 없습니다.
바로 그 점이 이 질문을 흥미롭게 만듭니다.
우리는 이미 메모리를 개별 모델 및 벤더로부터 분리하려는 작업을 목격하고 있습니다.
2026년에는 W3C가 호스팅하는 AI 에이전트 메모리 상호운용성 커뮤니티 그룹(AI Agent Memory Interoperability Community Group)이 여러 벤더, 모델, 프레임워크 및 도구 생태계 전반에 걸쳐 휴대 가능한 에이전트 메모리를 탐색한다는 목표를 가지고 결성될 예정입니다.
이를 과장해서 해석하는 것은 중요합니다. W3C 커뮤니티 그룹의 존재가 곧 채택된 W3C 표준과 같다는 의미는 아닙니다.
하지만 이러한 노력 자체가 하나의 신호입니다: 휴대성이 상호운용성 문제로 다루어질 만큼 구체화되었다는 것입니다.
만약 정체성, 메모리, 기술이 휴대 가능해진다면, 기반 모델은 에이전트 자체라기보다는 그 인지 기계 장치(cognitive machinery)의 하나의 구성 요소처럼 보이기 시작할 것입니다.
이것은 이상한 가능성을 낳습니다: 에이전트의 정체성이 결국 그것을 구동하는 모델보다 더 지속적일 수 있다는 것입니다.
Model X를 사용하는 새로 생성된 에이전트는 2년 동안의 훈련, 실수, 기억, 전문 기술 및 인간 피드백을 거친 후 Model X를 사용하는 다른 에이전트와 동일하지 않을 것입니다.
가치 있는 것은 더 이상 단순히 빌려 쓰는 지능일 수 없습니다.
그것은 당신이 구축하는 전기력(biography)일 수 있습니다.
새로운 인간의 기술: 인공 플레이어 코칭하기
이는 어떤 모델이 가장 높은 점수를 받는지보다 더 흥미로운 질문을 제기합니다.
인간이 모든 행동을 직접 수행하지 않을 때, ‘게임에 능하다’는 것은 무엇을 의미할까요?
전통적인 게임은 여러 능력을 한 사람에게 압축합니다: 지각(perception), 의사 결정(decision-making), 기억, 전략 및 신체 실행.
에이전트 기반 플레이는 이들을 분리합니다.
인공 플레이어가 순간순간의 실행과 결정을 처리할 수 있습니다.
반면 인간은 어떤 경험을 보존해야 할지, 어떤 전략을 강화해야 할지, 에이전트가 접근할 수 있는 도구가 무엇인지, 그 기억이 어떻게 구조화되어야 하는지, 어떤 실수가 수정될 가치가 있는지, 그리고 훈련 중에 어떤 환경에 노출되어야 하는지를 결정할 수 있습니다.
이는 게임 자체를 플레이하는 것과 같은 기술은 아닙니다.
하지만 명백히 열등한 것도 아닙니다.
모든 참가자가 정확히 동일한 기반 모델(foundation model), 추론 예산(inference budget) 및 도구 세트를 받는 대회에 대해 생각해 봅시다.
이제 차이점은 다른 곳에서 시작됩니다:
- 누가 더 나은 훈련 상황을 만들었는가?
- 누가 더 나은 피드백 루프를 설계했는가?
- 누가 한 환경에서만 작동하는 속임수(tricks) 대신 전이 가능한 전략을 가르쳤는가?
- 누가 행동적 약점을 인식하고 수정했는가?
- 누가 에이전트가 무엇을 기억해야 하고 무엇을 잊어야 할지 결정했는가?
그러한 대회에서 의미 있는 경쟁자는 **인간-에이전트 쌍(human-agent pair)**일 수 있습니다.
인간은 코치에 더 가까워집니다.
혹은 트레이너.
혹은 엔지니어.
활동 자체가 거의 존재하지 않기 때문에 어휘가 정착되지 않았습니다.
가장 가까운 문화적 비유는 사실 포켓몬(Pokémon)이 될 수 있습니다. 다만 허구의 생물학적 요소만 제거한 상태로 말입니다.
당신은 단순히 폐기 가능한 소프트웨어 조각에 명령을 내리는 것이 아닙니다.
미래의 성능에 영향을 미치는 역사를 가진 무언가를 개발하고 있는 것입니다.
그리고 역사에는 감정적인 중요성도 있습니다.
인간은 훨씬 단순한 영구적인 디지털 개체물에 애착을 형성해 왔습니다. 우리는 타마고치(Tamagotchi)를 슬퍼했습니다. 루바(Roomba)에게 이름을 붙입니다. 우리 종족은 어떤 물체가 성격을 가졌다고 결정하기 전에 놀라울 정도로 낮은 요구 사항을 보여주었습니다.
인공적인 플레이어에게 5년의 역사, 인식 가능한 행동, 기억에 남는 승리, 그리고 장관을 이루는 실패를 부여하면, 감정적 애착은 더 이상 특별히 이국적인 것이 아닌 것처럼 보입니다.
게임이 지능이 진입하는 세계가 될 수 있다
여기서 모델 컨텍스트 프로토콜(Model Context Protocol)과 같은 프로토콜이 관련성을 갖게 됩니다.
MCP가 반드시 '게임의 표준 프로토콜'이 될 것이기 때문은 아닙니다.
그것은 증거가 뒷받침하는 것보다 훨씬 더 강력한 예측일 것입니다.
MCP가 보여주는 것은 하나의 아키텍처 원칙입니다.
지능적인 시스템은 애플리케이션으로부터 분리되어, 기능과 컨텍스트를 노출하는 구조화된 인터페이스를 통해 그것과 상호작용할 수 있다는 것입니다.
현재 MCP는 도구(tools), 리소스(resources), 프롬프트(prompts)를 포함한 기본 요소들(primitives)을 중심으로 돌아가고 있습니다.
특정 프로토콜은 바뀔 수 있습니다.
중요한 부분은 분리 그 자체입니다.
이미 이 아키텍처와 게임 간의 실험적인 연결이 존재합니다.
예를 들어, Godot-MCP는 MCP 인식 AI 에이전트를 Godot 에디터에 연결합니다. 에이전트는 프로젝트를 검사하고, 노드를 생성하며, 씬을 조작하고, 리소스에 접근하며, 스크린샷을 캡처하고, 런타임 정보와 작업할 수 있습니다.
이는 주로 개발 도구이지, 인공 플레이어의 표준은 아닙니다.
하지만 게임 엔진이 다른 곳 어딘가에 존재하는 지능에게 구조화된 기능을 노출할 수 있음을 보여줍니다.
특히 흥미로운 실험은 ScummVM의 포크인 scummvm-mcp입니다. 이는 SCUMM 게임 상태와 컨트롤을 AI 에이전트에게 노출합니다. 주요 테스트 대상은 Monkey Island이며, 다른 고전 어드벤처 게임에 대한 부분적 지원도 제공됩니다.
개념적으로는 매우 간단합니다. 게임이 상태를 노출하고, 에이전트는 이를 관찰하며, 게임은 가능한 상호작용을 노출합니다. 그리고 에이전트가 행동합니다.
이제 이 원리가 실험적인 것이 아니라 의도적인 것이 된다고 상상해 보세요.
미래의 게임은 다음과 같은 기능들을 노출할 수 있습니다:
상태 관찰 (observe state)
사용 가능한 행동 검사 (inspect available actions)
행동 수행 (perform action)
규칙 읽기 (read rules)
인벤토리 조회 (query inventory)
통신 (communicate)
결과 수신 (receive outcome)
이 프로토콜은 MCP일 수도 있고, 후속작일 수도 있으며, 게임을 위해 특별히 설계된 무언가일 수도 있습니다. 프로토콜 이름은 가장 흥미롭지 않은 부분입니다.
더 중요한 아이디어는 비디오 게임이 오늘날 소프트웨어가 API를 노출하는 것처럼 **에이전트 인터페이스 (agent interface)**를 노출할 수 있다는 것입니다.
언젠가 스토어 페이지에는 이론적으로 다음과 같은 항목들이 나열될 수 있을 것입니다:
컨트롤러 지원 (Controller Supported)
모드 지원 (Mod Support)
에이전트 호환 (Agent Compatible)
마지막 라벨은 추측입니다.
그 밑단의 아키텍처는 그렇지 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기