게임에서 상수 후회(Constant Regret)를 위한 승산적 낙관성 (Multiplicative Optimism)
요약
본 논문은 유한 일반합 게임을 위한 비결합 학습 규칙인 Multiplicatively Optimistic Regret Matching (MORM)을 제안합니다. 이 방법은 동시 완전 정보 자가 플레이 환경에서 모든 플레이어가 단일 단계 낙관성만으로 $O(\sqrt n\log d)$의 외부 후회를 달성함을 분석했습니다.
핵심 포인트
- Multiplicatively Optimistic Regret Matching (MORM)을 제안함.
- 동시 완전 정보 자가 플레이에 적용 가능.
- 외부 후회(external regret)를 $O(\sqrt n\log d)$로 달성.
- 잠재 기반 후회 매칭 및 Hellinger 제어를 결합하여 분석.
우리는 유한 일반합 게임(finite general-sum games)을 위한 비결합 학습 규칙인 Multiplicatively Optimistic Regret Matching (MORM)을 소개합니다. 동시 완전 정보 자가 플레이(simultaneous full-information self-play) 하에서, 모든 플레이어는 단일 단계 낙관성만을 사용하여 모든 지평(horizon)에 걸쳐 $O(\sqrt n\log d)$의 외부 후회(external regret)를 달성합니다. 이 분석은 잠재 기반 후회 매칭 논증(potential-based regret-matching argument)과 승산적 안정성(multiplicative stability), 그리고 전략 이동에 대한 Hellinger 제어(Hellinger control)를 결합합니다. 또한, 학습률 보호 장치(learning-rate safeguard)는 적대적 효용(adversarial utilities)에 직면했을 때 $O(\sqrt{T\log d})$의 후회를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기