밴딧 전략 선택을 통한 제약 명령 조건부 강화학습의 실시간 전략 게임 적용
요약
본 논문은 실시간 전략 게임에서 강화학습 에이전트가 훈련 분포를 벗어난 상대에게 취약하다는 문제를 해결하고자 합니다. '전략가(strategist)-실행기(executor)' 시스템을 도입하여, 명령 선택과 유닛 제어를 분리하고, Thompson-sampling 기반의 밴딧 전략가가 다양한 명령 조건을 선택합니다.
핵심 포인트
- 명령 조건부 강화학습으로 실시간 게임 적용 가능성을 높임.
- 전략가와 실행기 분리를 통해 정책 재사용성과 적응력을 확보함.
- Thompson-sampling 밴딧을 활용하여 상대방 전략에 기반한 최적 명령 선택.
- 강력한 비참여 상대방 상대로 높은 승률과 성능 향상을 입증함.
심층 강화학습 에이전트는 실시간 전략 게임에서 강력한 성능을 보이지만, 훈련 분포를 벗어난 상대방에게는 취약할 수 있습니다. 전략적 명령 선택을 학습된 유닛 제어와 분리하면, 동일한 실행 정책(execution policy)을 재사용하면서도 서로 다른 상대방에 대해 다양한 전략을 선택할 수 있게 합니다. 이를 위해서는 서로 다른 명령을 따를 수 있는 실행기(executor)와 이것이 제대로 수행되었는지 측정 가능한 기준이 필요합니다. 우리는 실시간 전략 환경인 MicroRTS를 위해 제약 명령 조건부 근접 정책 최적화(Proximal Policy Optimization, PPO) 정책인 실행기를 도입했습니다. 이산적인 명령들은 여러 환경 단계에 걸쳐 경제, 군대 구성, 군사 태세, 그리고 일꾼 정책에 대한 전략적 목표와 행동 요구사항을 지정하며, 실행기는 이를 충족하는 데 사용되는 유닛 수준의 행동을 결정합니다. 톰슨 샘플링(Thompson-sampling) 밴딧이 전략가 역할을 맡아 상대방의 신원보다는 게임 내 관찰을 통해 구축된 상대방 전략에 대한 추정치로부터 명령 튜플을 선택합니다. 동일한 아키텍처, 예산, 커리큘럼 및 셀프 플레이 리그로 훈련된 평평한 PPO 기준선(flat PPO baseline)과의 통제된 비교에서, 이 전략가-실행기 시스템은 두 개의 가장 강력한 비참여 상대방을 포함하여 네 명의 가장 강력한 상대 중 세 명에게서 (0.550.97 및 0.010.34) 훨씬 더 자주 승리했으며, 나머지 상대들과는 유의미한 차이가 없었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기