QF3: 필터링된 Q-그래디언트를 사용한 빠른 Flow RL
요약
QF3(Fast Flow RL with Filtered Q-Gradients)는 로봇 행동 학습을 위한 새로운 오프폴리시 강화학습 알고리즘입니다. 이 방법은 흐름 매칭에 비평가(critic)의 행동 그래디언트를 추가하여 flow 정책을 훈련합니다. 특히, 리플레이 행동 근처의 차원에만 그래디언트를 적용하여 안정적이고 빠른 학습이 가능하며, 휴머노이드 보행 및 조작 정책 훈련에서 높은 성능을 보여줍니다.
핵심 포인트
- QF3는 오프폴리시 flow RL 알고리즘으로 로봇 행동 학습에 사용됩니다.
- 비평가 그래디언트를 필터링하여 안정적이고 빠른 업데이트를 유지합니다.
- 휴머노이드 보행 및 모션 트래킹 정책 훈련에서 높은 성능을 입증했습니다.
- FPO++ 대비 10배 빠른 속도로 오프폴리시 훈련이 가능합니다.
Flow 정책은 시연(demonstrations)으로부터 로봇 행동을 학습하는 표준 정책 클래스가 되었지만, 강화학습(RL)은 여전히 사전 훈련된 flow 정책을 개선하거나 상호작용을 통해 처음부터 학습시키는 데 중요합니다. 우리는 QF3 (Fast Flow RL with Filtered Q-Gradients)를 소개합니다. 이는 흐름 매칭(flow matching)에 비평가(critic)의 행동 그래디언트(action gradient)를 더하여 flow 정책을 훈련하는 온라인 오프폴리시(off-policy) RL 알고리즘입니다. 이 예측과 비평가가 신뢰할 수 있는 업데이트를 유지하기 위해, QF3는 리플레이 행동 근처에 머무르는 행동 차원(action dimensions)에 대해서만 비평가 그래디언트를 적용합니다. 우리가 아는 한, QF3는 휴머노이드 보행 정책을 처음부터 훈련하고 이를 하드웨어에 제로샷(zero-shot)으로 전이하는 최초의 오프폴리시 flow RL 방법입니다. 높은 처리량의 오프폴리시 훈련 레시피와 결합하여, 이는 최근의 온폴리시 flow RL 방법인 FPO++보다 10배 빠른 벽시계 속도로 휴머노이드 보행 및 모션 트래킹 정책을 훈련합니다. 우리는 또한 QF3를 ABC-Sim과 Robomimic 작업 모두에서 사전 훈련된 flow 기반 조작 정책(manipulation policies)을 미세 조정하는 데 적용했습니다. 이러한 결과는 QF3가 로봇 정책을 처음부터 학습할 수도 있고, 시연으로부터 얻은 정책을 개선할 수도 있음을 시사합니다. 웹사이트: https://qf3-rl.github.io/
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기