Atari부터 EVE Online까지: 게임 분야에서 진행된 15년간의 AI 연구를 기반으로
요약
게임은 Atari부터 StarCraft에 이르기까지 AI 연구의 핵심 동력이었습니다. DeepMind는 DQN, AlphaGo, AlphaZero 등을 통해 게임 마스터링의 이정표를 세우며 심층 강화학습 시대를 열었습니다. 이러한 성공적인 탐색 정신은 단백질 구조 예측(AlphaFold)과 같은 현실 세계 난제 해결에도 응용되었습니다.
핵심 포인트
- 게임은 AI 돌파구의 핵심 동력원입니다.
- DQN, AlphaGo 등 주요 성과는 강화학습 시대를 열었습니다.
- 성공적인 탐색 정신은 단백질 구조 예측(AlphaFold)에 적용되었습니다.
- AI는 게임 환경을 넘어 현실 세계 이해로 확장하고 있습니다.
Atari부터 Go, StarCraft에 이르기까지, 게임은 가장 큰 AI 돌파구들을 이끌어 왔습니다. 이제 저희는 게임 개발자들과 협력하여 게이밍과 AI 모두의 경계를 확장하는 새로운 게임 플레이 경험을 프로토타입화하고 있습니다.
DeepMind가 2010년에 설립된 이후, 제약적이면서도 풍부한 게임 세계들은 지능을 이해하는 데 중요한 역할을 해왔습니다. 이들(게임)은 Atari 마스터링부터 단백질 구조 예측 문제 해결에 도움을 주는 것까지 저희의 가장 큰 AI 돌파구들을 이끌었으며, 여전히 저희가 하는 일의 중심에 있습니다.
게이밍은 GDM의 DNA와 같습니다. Google DeepMind의 창립자 중 한 명인 Demis Hassabis 역시 전직 게임 개발자이며, GDM 팀의 많은 구성원들이 그러합니다. 저희는 함께 수십 년간의 게임 개발 실무 경험과 게임 제작이라는 공예에 대한 깊은 존경심을 가지고 있습니다.
저희는 항상 게임을 활용한 AI 연구에는 게임 개발자들과의 깊은 파트너십이 필요하다는 점을 분명히 해왔습니다. 이는 올해 초 공개했던 Fenris Creations 및 EVE Universe와의 주요 새로운 연구 파트너십과, Hello Games, Coffee Stain Studios, Foulball Hangover 등 명성 높은 스튜디오들과 함께 진행한 작업들에서도 볼 수 있습니다.
AI 연구의 엔진으로서의 게임
저희 여정은 작은 팀이 Atari 2600 게임들을 원시 픽셀(raw pixels)로부터 직접 플레이하도록 심층 신경망을 훈련시키면서 시작되었습니다. Deep Q-Network (DQN)는 어떤 게임 특화 엔지니어링 없이 Pong부터 Breakout, Space Invaders까지 49가지 다른 게임을 플레이하는 법을 학습했습니다. DQN에 관한 2015년 Nature 논문은 현대 심층 강화학습(deep reinforcement learning) 시대를 촉진하는 데 도움을 주었습니다.
그 이후로 우리는 더욱 복잡한 게임들을 마스터하려고 시도했고, 각 이정표는 더 유능하고 일반적인 시스템을 만들어냈습니다. AlphaGo는 2016년 세계 가오기(Go) 선수인 이세돌 9단을 물리쳤는데, 이는 많은 전문가들이 아직 10년은이나 멀었다고 생각했던 업적이었습니다. AlphaGo Zero는 인간의 데이터가 전혀 없음에도 불구하고 자가 학습(self-play)을 통해 이전 모든 버전을 능가했습니다. AlphaZero는 이 접근 방식을 일반화하여 하나의 알고리즘으로 체스, 쇼기, 가오기를 마스터했으며, MuZero는 규칙조차 알지 못한 채 플레이하는 법을 배웠습니다. 2019년에는 AlphaStar가 스타크래프트 II에서 그랜드마스터 레벨에 도달하며 실시간 복잡성과 불완전한 정보를 다루는 능력을 보여주었습니다.
각 게임마다 AI는 플레이 경험을 풍부하게 했습니다. AlphaGo의 유명한 37번째 수(Move 37)는 너무나 예상치 못한 수여서 전문 해설가들조차 처음에는 실수라고 생각할 정도였으며, 가오기에 대한 수 세기 동안 받아들여지던 지혜를 뒤엎고 전문가들이 새로운 전략을 탐구하도록 영감을 주었습니다. AlphaZero 역시 체스에서 완전히 새로운 플레이 라인을 고안해냈습니다. 결정적으로, 게임에서 성공했던 탐색(exploration)의 정신은 다른 AI 시스템에도 심오한 영향을 미쳤습니다. AlphaFold는 이러한 기초를 응용하여 단백질 구조 예측이라는 50년 된 거대한 난제를 해결하는 데 도움을 주었고, 이 성과는 2024년 노벨 화학상을 수상하는 결실로 이어졌습니다.
게임 마스터링에서 이해하기까지
우리의 초기 연구는 명확한 목표와 충분한 훈련이 주어진다면 AI가 어떤 게임이든 마스터할 수 있음을 입증했습니다. 하지만 현실 세계에는 점수나 규칙서가 주어지지 않습니다. 이것이 우리로 하여금 근본적으로 다른 질문을 던지게 했습니다. 즉, AI가 사람이 하는 방식대로 모든 게임 환경을 이해하고 상호작용할 수 있을까?
이것이 바로 우리의 확장 가능한 지시 가능 다중 세계 에이전트(Scalable Instructable Multiworld Agent)인 SIMA의 배경입니다. SIMA는 높은 점수를 최적화하는 대신, 플레이어가 화면에서 보는 것을 '보고', 자연어 지침을 이해하며, API나 소스 코드 접근 없이 일반적인 키보드 및 마우스 조작을 통해 행동합니다.
Gemini를 통해 구동되는 당사의 최첨단 AI 모델인 SIMA 2는 실시간 추론과 대화가 가능한 인터랙티브 컴패니언 역할을 합니다. 이 모델은 No Man's Sky, Valheim, Hydroneer 등 복잡한 3D 연구 환경 및 비디오 게임 전반에 걸쳐 인간과 유사한 플레이를 구현합니다.
게임 개발자들에게 진정한 범용(general) 게이밍 에이전트는 기존 게임과 연동되는 AI 기능을 열어줄 것입니다. 이 경우, 게임 코드 수정은 필요하지 않습니다. 이는 게임 세계를 진정으로 이해하는 AI 컴패니언부터 스크립트 시스템으로는 결코 할 수 없었던 방식으로 적응하고 반응하는 비플레이어 캐릭터(NPC)에 이르기까지 완전히 새로운 게임 플레이를 구현할 수 있습니다.
범용 게이밍 에이전트는 게임 제작 방식 자체도 변화시킬 수 있습니다. 개발 과정에서 게임이 커밋(commit)마다 변경될 때, 이러한 에이전트는 진정으로 견고한 품질 보증(QA) 테스트를 가능하게 할 수 있습니다. 출시 후에도 새로운 콘텐츠가 추가되거나 플레이어들이 예측 불가능하게 행동할 때, 이들은 재스크립팅(re-scripting) 없이도 실시간으로 적응하며 일반화할 수 있습니다.
SIMA 에이전트를 안전하고 책임감 있게 개발하기 위해 당사는 명성 있는 게임 스튜디오들과 파트너십을 맺고 있으며, AI 연구를 위한 게임 포트폴리오를 꾸준히 구축하고 있습니다. 이를 통해 저희는 에이전트들에게 점점 더 복잡한 과제를 부여할 수 있으며, 이는 언젠가 현실 세계의 문제를 해결하는 데 적용될 수 있도록 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기