정보가 대부분 숨겨진 게임, Stratego는 지금까지 AI를 당황하게 했다
요약
Stratego는 정보가 불완전한(imperfect-information) 고전 게임으로, 체스나 바둑과 달리 상대방의 말 종류를 알 수 없어 블러핑이 중요한 특징을 가집니다. Carnegie Mellon 등 여러 대학 연구팀은 Ataraxos라는 AI를 개발하여 최고의 인간 플레이어를 상대로 승리하는 성과를 거두었습니다.
핵심 포인트
- Stratego는 불완전 정보 게임으로, 상대방의 말 종류가 숨겨져 블러핑이 핵심입니다.
- Ataraxos AI는 여러 대학 연구팀이 개발했으며, 적은 자원으로도 높은 성능을 보였습니다.
- 게임의 복잡성 때문에 한 경기가 2,000수를 넘길 수 있으며, 예측 불가능성이 높습니다.
1997년 Deep Blue가 체스에서 Garry Kasparov를 이겼고, 2016년 AlphaGo가 바둑에서 Lee Sedol을 이겼으며, 포커 봇들은 수년 동안 전문가들을 이겨왔다. 하지만 Stratego라는 고전 게임 하나는 예외였다. 심지어 뛰어난 자본력을 가진 DeepMind조차도 최고의 인간 플레이어를 안정적으로 이길 수 있는 기계를 만들지 못했다.
하지만 이제 Carnegie Mellon, MIT, New York University, Stanford University의 연구원들로 구성된 팀이 해냈다. 그들의 AI인 Ataraxos는 역대 최고의 Stratego 플레이어 중 한 명으로 꼽히는 Pim Niemeijer를 상대로 15승 4무로 이겼다. 그리고 이를 훈련하는 데 단지 GPU 16개와 몇천 달러만 들었다.
숨겨진 군대들
Stratego에서는 각 플레이어가 원수(marshal)부터 스파이까지의 군사 계급을 나타내는 40개의 말과 폭탄, 그리고 국기를 받는다. 상대방의 국기를 점령하면 승리한다. 상대방은 당신의 말이 어디에 있는지 알지만, 그것이 무엇인지는 모른다. 신분은 오직 두 개의 말이 전투에서 충돌할 때만 밝혀지는데, 이때 약한 쪽이 제거되고 승자의 정체가 드러난다. 이 때문에 Stratego는 포커처럼 불완전 정보 게임(imperfect-information game)이다. 이는 컴퓨터가 이미 수년 전에 해결했던 장르다. NYU의 연구원이며 이번 연구의 공동 저자인 Eugene Vinitsky는
체스(chess)의 경우 보통 게임이 40수 정도 지속되지만, Stratego에서는 한 게임이 쉽게 2,000수를 넘길 수 있다”고 Farina가 말했다. 게다가 Stratego는 블러핑(bluffing)의 게임이다. 때로는 약한 말(piece)을 마치 원수(marshal)인 것처럼 움직여서 상대방을 겁주는 경우도 있다. 플레이어들이 너무 자주 블러핑하면 그들의 위협은 아무 의미가 없어지고, 전혀 블러핑하지 않으면 예측 가능해진다. 팀은 이러한 균형 잡기가 2022년에 소개된 DeepMind의 DeepNash 같은 초기 AI들을 당황하게 만든 요소라고 설명한다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기