제어 부족형 이족 보행 로봇의 충돌 회피 이동을 위한 계층적 강화학습
요약
본 논문은 제어 부족형 이족 보행 로봇의 충돌 회피 이동을 위해 계층적 강화학습(HRL) 프레임워크를 제시합니다. 고수준 정책이 속도 명령을 출력하고, 저수준 정책이 이를 추적하는 구조입니다. 실험 결과, 제안된 HRL 방식은 정적 및 동적 환경에서 높은 성공률을 보이며 기존 플래너 기반 방법들보다 우수한 성능을 입증했습니다.
핵심 포인트
- 제어 부족형 로봇의 충돌 회피 이동 문제를 다룸.
- HRL 프레임워크를 사용하여 고수준/저수준 정책으로 분리 학습함.
- SAC와 공동 훈련하여 안정적이고 높은 성공률(98.0%, 88.0%)을 달성함.
- 기존 플래너 기반 방법들보다 월등히 우수한 성능을 보임.
이족 보행 로봇은 균형을 깨뜨리지 않고 경로를 벗어나 장애물을 피할 수 없으며, 이러한 결합(coupling)은 본 논문에서 다루는 이족 보행 로봇처럼 엉덩이나 발목의 회전축(roll)이 없고 각 다리당 네 개의 구동 관절만 있는 제어 부족형 플랫폼(underactuated platforms)에서 가장 심각하게 나타납니다. 본 논문은 계층적 강화학습 (HRL) 프레임워크를 제시합니다. 이 프레임워크에서 고수준 정책(HL policy)은 로봇의 자세, 36개의 레이캐스트 근접 측정값, 움직이는 장애물 상태, 그리고 후퇴하는 지평선상의 국소 목표를 관찰하고, 매 10개 제어 단계마다 본체 속도 명령 $(v_x, v_y, ext{ω}_{ ext{yaw}})$을 출력합니다. 한편, 속도 조건화된 저수준 정책(LL policy)은 PD-제어된 관절 목표를 통해 각 명령을 추적합니다. 두 정책 모두 Soft Actor-Critic (SAC)과 함께 공동으로 훈련됩니다. 수렴된 보행 패턴이 작업에 구애받지 않기 때문에, 이를 고정하고 동일한 명령 인터페이스를 통해 고전적인 플래너(classical planners)로 구동하여 세 가지 제어 기반의 기준선(baselines): SAC+A*, SAC+RRT*, 그리고 SAC+APF를 얻습니다. 무작위화된 PyBullet 환경에서 각 방법별 100개의 평가 시도를 거친 결과, 제안된 방법은 정적 및 동적 시도 모두에서 98.0%와 88.0%의 성공률을 보였으며, 플래너 하이브리드 방식들은 최대 78.0%와 68.0%에 그쳤습니다. 또한 경로 길이는 A* 기준값과 4% 이내였으며, 제거 실험(ablations)은 각 관찰 채널과 보상 항이 이러한 성능에 실질적으로 기여함을 확인시켜 주었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기