확산 환경(Diffusion Environment) 내 다중 팔 밴딧(Multi-Armed Bandits) 문제에 대한 정책 경사(Policy
요약
확산 환경(Diffusion Environment) 내 다중 팔 밴딧 문제에 대한 정책 경사 업데이트를 연구합니다. 확률적 정책의 로짓 매개변수화를 통해 최적의 팔로의 수렴성을 증명하고, 비점근적 후회 상한을 도출했습니다.
핵심 포인트
- 확산 환경 내 다중 팔 밴딧의 정책 경사 수렴성 증명
- 상수 학습률 조건에서 $O(\log T)$ 차수의 후회 상한 도출
- 새로운 리아푸노프 함수 구축을 통한 기존 분석 개선
- SDE 도구를 활용한 정책 경사 분석의 투명성 입증
본 논문은 Wang et al. (2020), Jia and Zhou (2022b)의 연속 시간 강화학습 (Continuous-time Reinforcement Learning) 프레임워크 하에서 확률 미분 방정식 (SDE)으로 기술되는 확산 환경 (Diffusion Environment) 내 다중 팔 밴딧 (Multi-armed Bandit) 문제에 대한 정책 경사 (Policy Gradient) 업데이트를 연구합니다. 확률적 정책 (Stochastic Policy)을 위한 로짓 매개변수화 (Logit Parameterization)를 사용하여, 임의의 상수 학습률 (Constant Learning Rate) 하에서 최적의 팔 (Optimal Arm)로 거의 확실하게 (Almost Surely) 수렴함을 보여줍니다. 나아가, 상수 학습률이 시간 불변 임계값 (Time-invariant Threshold) 미만일 때의 비점근적 후회 상한 (Non-asymptotic Regret Upper Bound)을 도출하며, 이 후회 상한은 $O( ext{log } T)$ 차수를 가집니다. 우리는 새로운 리아푸노프 함수 (Lyapunov Function)를 구축함으로써 동일한 SDE에 대한 Lattimore (2026a)의 분석을 개선하였으며, SDE의 도구들을 사용하여 정책 경사를 분석하는 것의 투명성을 입증합니다. 또한, 동일한 리아푸노프 함수는 이산 시간 (Discrete-time) 정책 경사 알고리즘을 분석하는 데에도 유용합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기