시각적 내비게이션을 위한 적응형 안전 마진 학습
요약
로봇의 실내 내비게이션 시 고정된 안전 마진 문제를 해결하기 위해 적응형 여유 공간 선호도를 학습하는 안전 비평가 모델을 제안합니다. 확산 기반 플래너의 궤적 중 최적을 선택하도록 설계되었으며, 시뮬레이션 학습 후 휴머노이드 로봇에 성공적으로 전이되었습니다.
핵심 포인트
- 고정된 안전 마진 대신 상황에 맞는 적응형 여유 공간 학습
- 안전, 효율성, 거리 제약 매칭을 포함한 세 가지 항으로 구성된 비평가
- 교사-학생 증류 기법을 통해 인지 전용 선택기로 구현
- HM3D, MP3D 데이터셋 및 Unitree G1 휴머노이드에서 성능 입증
복잡한 실내 공간의 로봇들은 충돌 없는 경로를 생성하지 못해서가 아니라, 고정된 안전 마진 (safety margin)이 잘못 조정되었기 때문에 실패하는 경우가 많습니다. 보수적인 마진은 우회와 시간 초과를 유발하고, 허용적인 마진은 인지 편향 (perception bias) 하에서 경계 근처의 지름길을 택하게 만듭니다. 확산 기반 플래너 (Diffusion-based planners)는 자기중심적 RGB-D로부터 다양한 궤적 후보를 제안하지만, 신뢰할 수 있는 선택이 여전히 병목 현상으로 남아 있습니다. 우리는 확산 제안들을 순위 매기기 위해 적응형 여유 공간 선호도 (adaptive clearance preference)를 학습하는 컨텍스트 조건부 안전 비평가 (context-conditioned safety critic)를 제안합니다. 이는 세 가지 상호 보완적인 항으로 분해됩니다: (i) 웨이포인트(waypoint) 및 전환 단계의 안전을 위한 여유 공간 예산 페널티 (clearance-budget penalty)와 제어 장벽 함수 잔차 (control-barrier-function residual)를 포함하는 안전 항, (ii) 위험한 지름길을 조장하지 않으면서 우회를 피하는 부드러움 페널티 (smoothness penalty)와 안전 게이트형 우회 비율 페널티 (safety-gated detour-ratio penalty)를 결합한 효율성 항, (iii) 마진 붕괴를 방지하기 위해 학습된 예산을 실제 구현된 ESDF 여유 공간에 고정하는 거리 제약 매칭 항 (distance-constraint matching term)입니다. 우리는 시뮬레이션에서 특권적 ESDF 기하학 (privileged ESDF geometry)을 사용하여 비평가를 학습시키고, 2단계 교사-학생 (teacher-student) 절차를 통해 이를 인지 전용 선택기 (perception-only selector)로 증류 (distill)합니다. 데이터셋 간 전이를 포함하여 HM3D 및 MP3D에서의 PointGoal 내비게이션에서, 우리 방법은 강력한 확산 (diffusion), 최적화 (optimization), 그리고 강화학습 (RL) 베이스라인들 사이에서 가장 높은 성공률 (SR)과 경로 길이 대비 성공률 (SPL)을 달축합니다. 순수하게 시뮬레이션에서 학습되었음에도 불구하고, 이는 Unitree G1 휴머노이드로 전이되어 별도의 작업별 튜닝 없이도 복잡한 실내 장면을 탐색합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기