밴딧이 닻을 떠날 수 있는 시점은 언제인가? 비정상성 환경에서의 E-Process 승인된 Thompson Sampling
요약
본 논문은 비정상성(Non-stationarity) 환경에서 베팅 문제 해결을 위한 E-process 승인된 Thompson Sampling (e-ATS) 기법을 제안합니다. e-ATS는 각 팔에 전체 이력과 할인된 Beta 상태를 제공하며, 가역적 관련성 점수를 통해 영향력을 제어합니다. 이는 기존의 낙관적 Thompson Sampling(OTS)보다 개선된 성능을 보였습니다.
핵심 포인트
- e-ATS는 비정상 환경에서 베팅 문제에 적용되는 새로운 샘플링 기법입니다.
- 가역적 관련성 점수가 정보의 영향력을 효과적으로 제어합니다.
- 기존 방식 대비 성능 개선 폭이 상황(스위트)에 따라 다르게 나타납니다.
정상성(Stationarity)은 기억에 의존하지만, 변화가 발생한 후 동일한 이력(history)은 오도할 수 있다. 우리는 언제 망각이 허용되어야 하는지 질문한다. E-process-authorized Thompson sampling (e-ATS)은 각 팔(arm)에게 전체 이력과 할인된 Beta 상태를 제공한다. 임의 시점에서도 유효한 e-process는 먼저 할인된 상태를 승인하고, 그 다음 가역적 관련성 점수(reversible relevance score)가 그 영향력을 제어한다. 승인되기 전까지, e-ATS는 낙관적 Thompson sampling (OTS)을 정확히 따른다. Beta-Bernoulli 사전 예측 정상 모델 하에서, 적합된 임계값 없이도 e-ATS가 OTS를 벗어날 확률은 선택된 $\alpha_E$보다 크지 않다. e-ATS와 비교했을 때, 승인을 제거하는 것은 등록된(registered) 스위트에서는 평균 정규화 동적 유사 후회(mean normalized dynamic pseudo-regret)를 $38.4%$ 증가시켰지만, 문헌에서 파생된(literature-derived) 리플레이 스위트에서는 $7.5%$ 감소시켰다. 따라서, 증거가 언제 적응을 시작할지 제어하며, 그것이 항상 도움이 되는지를 결정하지는 않는다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기