동적 시스템의 실시간 최적 제어를 위한 물리 강화 강화학습 (Physics-enhanced reinforcement learning)
요약
동적 시스템의 제어를 위해 물리 법칙과 강화학습을 결합한 새로운 패러다임인 PEARL을 제안합니다. 자동 미분을 활용한 액터-인접 알고리즘을 통해 샘플 효율성을 높이고 고차원 시스템에서도 안정적인 제어가 가능함을 입증했습니다.
핵심 포인트
- 물리 법칙과 RL을 결합하여 샘플 효율성 문제 해결
- 자동 미분을 활용한 액터-인접 알고리즘으로 그래디언트 불안정성 완화
- 비정상 유동 환경에서 기존 RL 대비 뛰어난 성능 및 일반화 능력 증명
- 저차원 표현 없이도 고차원 상태 및 행동 공간으로 확장 가능
강화학습 (Reinforcement learning, RL)은 최근 비선형 및 복잡한 동적 시스템 (dynamical systems)을 위한 유망한 피드백 제어 전략으로 부상했습니다. 그러나 RL 알고리즘은 샘플 효율성 (sample inefficient)이 낮으며, 최적의 제어 전략을 합성하기 위해 환경과의 방대한 상호작용을 필요로 합니다. 결과적으로, RL의 응용은 고차원 공간에서의 탐험-활용 딜레마 (exploration-exploitation dilemma)에 수반되는 차원의 저주 (curse of dimensionality)로 인해 일반적으로 희소한 센서 및 액추에이터 (sparse sensors and actuators)로 제한됩니다. 본 연구에서는 동적 시스템의 미분 가능성 (differentiability)을 활용하여, 고차원 및 파라미터 동적 시스템의 제어에 맞춤화된 새로운 물리 강화 강화학습 (Physics-EnhAnced Reinforcement Learning, PEARL) 패러다임을 통해 RL과 전통적인 동적 시스템 최적 제어를 결합합니다. 구체적으로, PEARL은 자동 미분 (automatic differentiation)을 활용하여 짧은 호라이즌 (short horizons)에 대한 정책 그래디언트 (policy gradients)를 계산하고, 신경망을 통해 근사화된 미래 리턴 (future returns)의 인접 기반 민감도 (adjoint-based sensitivities)를 계산하는 액터-인접 (actor-adjoint) 알고리즘을 채택하여, 장기적인 그래디언트 불안정성 (gradient instabilities)을 완화하는 동시에 환경 상호작용 횟수를 크게 줄입니다. 비정상 유동 (unsteady flows)에서의 두 가지 도전적인 파라미터 내비게이션 문제를 통해, 우리는 PEARL이 (i) 미분 가능한 환경을 효과적으로 활용하여 최첨단 RL 알고리즘보다 뛰어난 성능을 보이며, (ii) 물리 가이드 정책 학습 (physics-guided policy learning) 덕분에 샘플 효율적이고, (iii) 파라미터 시스템을 다룰 때 매우 중요한 다중 시나리오에 대한 일반화 성능을 갖추며, (iv) 저차원 상태 표현 (low-dimensional state representations)이나 다중 에이전트 전략 (multi-agent strategies) 없이도 RL을 고차원 상태 및 행동 공간으로 확장할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기