적대적 중요 샘플링을 통한 강건 정책 최적화
요약
본 연구는 딥 강화학습(DRL) 정책의 강건성을 높이기 위해 적대적 중요 샘플링(Adversarial Importance Sampling, Advis)을 제안합니다. Advis는 추가 환경 상호작용이나 보조 네트워크 없이도 최악의 경우 리턴을 추정하고 최적화할 수 있습니다. 또한, 재현 가능한 PyTorch 라이브러리 advrl과 새로운 평가 기준을 제시하여 강건성 연구에 기여했습니다.
핵심 포인트
- Advis: 추가 환경 상호작용이나 보조 네트워크 없이 최악의 경우 리턴 추정 및 최적화 가능
- advrl: 모듈식 PyTorch 라이브러리를 제공하여 재현 가능한 강건성 평가 용이
- 강건성 과대평가 방지: 더 크고 다양한 적대자 세트로 정책을 평가하는 방법론 제시
딥 강화학습 (DRL) 정책이 입력 교란에 대비하는 데 상당한 진전이 있었습니다. 강건한 DRL을 개발하는 것은 알고리즘 설계, 구현, 평가의 세 가지 주요 단계를 포함합니다. 본 연구에서는 각 단계에서 핵심적인 한계점을 식별하고 해결합니다. 첫째, 우리는 표준 훈련으로부터의 궤적에 대한 중요 샘플링(importance sampling)을 사용하여 검증 가능한 최악의 경우 리턴을 추정하고 최적화하는 방법인 적대적 중요 샘플링 (Adversarial Importance Sampling, Advis)을 소개합니다. Advis는 기존 연구에서 공동으로 달성하지 못한 세 가지 바람직한 기준을 충족합니다: 추가적인 환경 상호작용이 필요 없고, 보조 네트워크가 필요 없으며, 장기적인 강건성을 포착합니다. 둘째, 우리는 기존의 강건성 방법과 적대적 공격에 대한 깨끗하고 단일 파일 구현을 제공하여 신속한 프로토타이핑을 용이하게 하고 재현 가능하며 추적 가능한 평가를 가능하게 하는 모듈식 PyTorch 라이브러리인 advrl을 소개합니다. 셋째, 우리는 학습된 적대자에 대한 평가를 다시 검토하고, 최적의 적대적 하이퍼파라미터가 에이전트 간에 전이되지 않아 제한된 공격자 구성을 사용할 때 강건성의 과대평가를 초래할 수 있음을 보여줍니다. 따라서, 우리는 기존 연구보다 6~14배 더 많은 구성을 사용하여 크고 다양한 적대자 세트에 대해 정책을 평가합니다. 마지막으로, 연속 제어 환경에서 우리의 접근 방식을 평가하여 기존 기준선 대비 그 효과를 입증합니다. 코드는 다음에서 이용 가능합니다: https://github.com/AmineAndam04/advrl
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기