PAC-MAN: 휴머노이드 피구의 전신 안전을 위한 인지 인식형 CBF-RL
요약
휴머노이드의 전신 피구 동작을 위해 인지 인식형 CBF-RL 프레임워크인 PAC-MAN을 제안합니다. 온보드 카메라의 세그멘테이션 정보만으로 공을 인식하며, 제어 장벽 함수(CBF)와 적대적 동작 사전을 결합해 안전한 회피 반사를 구현합니다.
핵심 포인트
- 온보드 카메라의 세그멘테이션 마스크만으로 공 인식 및 회피 가능
- CBF-RL을 통해 휴머노이드의 전신 안전성과 회피 반사 정규화 구현
- Unitree G1 로봇에 제로샷 배포 시 95%의 투구 회피 성공률 달성
- 인지적 관측 가능성이 제어 장벽 구조의 성능에 미치는 영향 규명
우리는 휴머노이드의 전신 피구(whole-body humanoid dodgeball)를 위해 제어 장벽 안전성(control-barrier safety)과 실제 배포 환경의 온보드 센싱(onboard sensing)을 결합한 인지 인식형 CBF-RL 프레임워크인 PAC-MAN을 제시합니다. 배포된 정책(policy)은 머리에 장착된 카메라로부터 세그멘테이션 마스크가 적용된 깊이(segmentation-masked depth) 정보로만 공을 인식하는 반면, 훈련 시의 CBF 가이드는 모든 바디 링크(body link)에 대한 여유 공간(clearance)을 나타내며, 적대적 동작 사전(adversarial motion prior)은 결과적으로 나타나는 회피 반사(evasive reflexes)를 정규화합니다. 우리는 두 가지 체제, 즉 단일 투구와 로봇이 자신의 위치로 걸어 돌아와 투구 사이에 회복하는 배포 루프(deployment loop)에서 시드 투구가 포함된 제어된 임의 링크 접촉 벤치마크(any-link contact benchmark)를 통해 평가합니다. 이 벤치마크에서 정책은 특권 상태 오라클(privileged state oracle)과 단 몇 점 차이 내로 근접했습니다. 즉, 고정된 온보드 카메라만으로도 회피에 충분하다는 것입니다. 우리는 사용 가능한 장벽 구조(barrier structure)가 인지적 관측 가능성(perceptual observability)에 달려 있음을 발견했습니다. Joint-CBF는 정확한 공 상태에서 최고의 성능을 보이지만, 훈련 가이드로만 사용될 경우 고정 카메라 관측 하에서 성능이 저하되며, 공 추적 짐벌(ball-tracking gimbal) 또는 특권 런타임 필터(privileged runtime filter)를 통해 성능을 회복합니다. 따라서 우리는 가벼운 Link-CBF 정책을 실제 환경의 Unitree G1에 제로샷(zero-shot)으로 배포하였으며, 이 정책은 불완전한 인지를 허용하고 투구의 95%에서 성공하며, 시맨틱 세그멘테이션(semantic segmentation)을 사용하여 서로 다른 공들을 피합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기