액추에이터 역학을 고려한 쿼드콥터 제어를 위한 물리 인식 엔드-투-엔드 심층 강화학습 (Deep Reinforcement Learning)
요약
액추에이터 역학을 고려한 쿼드콥터 제어를 위한 물리 인식 엔드-투-엔드 심층 강화학습(DRL) 연구입니다. 고충실도 시뮬레이션 환경에서 DDPG, TD3, PPO, SAC 알고리즘을 비교 평가하여 안정적인 제어 성능을 분석했습니다.
핵심 포인트
- 액추에이터 지연 및 공기역학적 모멘트를 모델링에 포함
- SAC와 TD3 알고리즘이 안정성 및 탐색 효율성에서 우수함
- PPO는 상대적으로 낮은 샘플 효율성을 보임
- 쿼드콥터 DRL 연구를 위한 재현 가능한 벤치마크 제공
무인 항공기 (UAVs), 특히 쿼드콥터는 6자유도를 제어하기 위해 단 4개의 제어 입력만을 사용해야 하는 과구동되지 않은 (underactuated) 역학 특성으로 인해 자율 제어 측면에서 독특한 과제를 안겨줍니다. 본 논문은 저수준 바디 입력인 총 추력 및 바디 토크 $(T, τ_x, τ_y, τ_z)$에 직접 작용하며, 고충실도 (high-fidelity) Simulink 환경을 통해 루프를 폐쇄하는 물리 인식 (physics-aware) 엔드-투-엔드 심층 강화학습 (Deep Reinforcement Learning, DRL) 접근 방식을 조사합니다. 우리의 시뮬레이터는 12상태 강체 모델 (MATLAB Level-2 S-Function)을 다음과 같은 요소와 통합합니다: (i) 추력 및 항력 항에서 유도된 계수 행렬의 Moore-Penrose 유사 역행렬 (pseudo-inverse)에 기반한 Action2RPM 할당, 그리고 (ii) 로터 자이로스코프 결합 (rotor gyroscopic coupling)을 포함하여 각 모터에 대한 1차 액추에이터 역학 (time constant $T_m = 0.076$ s). 설계된 보상 (shaped reward)은 지수적 위치 웰 (exponential position well), 자세 페널티 (attitude penalties), 그리고 이차 속도 비용 (quadratic velocity costs)을 사용하여 목표 도달과 안정성 사이의 균형을 맞춥니다. 네 가지 DRL 알고리즘인 DDPG, TD3, PPO, 그리고 SAC를 두 단계로 평가합니다: (S1) 추력 전용 호버링 (thrust-only hover) 및 (S2) 피치 토크와 이동된 목표가 포함된 호버링. 결과에 따르면 SAC와 TD3가 우수한 안정성과 탐색 효율성을 달성하는 반면, PPO는 샘플 효율성 (sample-efficient)이 낮았습니다. 본 연구는 안정적인 저수준 제어를 위해 액추에이터 지연 (actuator lags) 및 공기역학적 모멘트 (aerodynamic moments)를 모델링하는 것의 중요성을 강조하며, 쿼드콥터 DRL을 위한 재현 가능한 벤치마크를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기