정규화 기반의 제약된 견고 강화 학습에 대한 통합적 관점
요약
본 논문은 정규화 기반의 견고 강화 학습(Robust Reinforcement Learning)에 대한 통합적인 관점을 제시합니다. 명목 정책과 최악 사례 정책 간 성능 격차에 대한 새로운 상한을 도출하고, 이를 제약 최적화 문제로 공식화했습니다. 특히, 기존 방법들이 고정된 라그랑주 승수를 사용한 특수한 경우임을 밝히고, 이 가중치를 자동으로 업데이트하는 방법을 제안합니다.
핵심 포인트
- 견고 강화 학습을 정규화 기반으로 접근하며 통합적 관점을 제시함.
- 명목/최악 사례 정책 성능 격차에 대한 새로운 상한을 도출함.
- 강건 훈련을 제약 최적화 문제로 공식화하고, 라그랑주 승수 자동 업데이트를 제안함.
- 여러 연속 제어 작업에서 이론적 분석의 유효성을 검증함.
정규화 기반 방법들은 적대적 입력 교란(adversarial input perturbations)에 맞서 심층 강화 학습(Deep Reinforcement Learning) 정책을 훈련하는 표준적인 접근 방식이 되었습니다. 본 논문에서는 명목 정책(nominal policy)과 최악 사례 정책(worst-case policy) 간의 성능 격차(performance gap)에 대한 새로운 상한(upper bounds)을 도출함으로써 이러한 방법들을 통합합니다. 각 상한은 기존의 정규화 목적 함수(regularization objective)와 명목 및 최악 사례 정책 간의 KL-발산(KL-divergence) 페널티로 표현되며, 이는 KL 페널티를 추가하는 것이 실제로 견고성을 향상시키는 이유를 설명해 줍니다. 이러한 상한을 기반으로, 우리는 강건 훈련(robust training)을 제약 최적화 문제(constrained optimization problem)로 공식화하고, 기존 방법들이 고정된 라그랑주 승수(Lagrange multiplier)의 특수한 경우에 해당함을 보여줍니다. 대신, 우리는 정책과 함께 이 승수를 업데이트하여 정규화 가중치(regularization weight)를 자동으로 조정합니다. 마지막으로, 여러 연속 제어 작업(continuous control tasks) 전반에 걸쳐 광범위한 적대적 평가를 수행하여 우리의 이론적 분석을 검증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기