VLAGuard: 무선 센서 네트워크 내 시각-언어-행동 (VLA) 로봇의 물리적 어텐션 하이재킹 평가 및 완화를 위한 프레임워크
요약
무선 센서 네트워크 내 VLA 로봇을 대상으로 물리적 적대적 공격을 평가하고 완화하는 프레임워크 VLAGuard를 제안합니다. 시각-언어-행동 모델의 어텐션 메커니즘을 교란하는 공격을 분석하고, 이를 방어하기 위한 미세 조정 기법을 제시합니다.
핵심 포인트
- VLA 로봇의 액션-비전 어텐션 하이재킹 취약성 규명
- 패치를 이용한 시각-운동 어텐션 교란 공격(VASA) 소개
- 추론 오버헤드 없는 방어 기법인 APFT 제안
- 실제 환경 테스트에서 공격 하 성공률을 23.0%에서 67.4%로 개선
무선 센서 네트워크 (WSN) 내의 모바일 엣지 노드 (mobile edge nodes)로서 시각-언어-행동 (Vision-Language-Action, VLA) 로봇을 배치하려면 물리적 적대적 위협 (physical adversarial threats)에 대한 강력한 보호가 필요합니다. 본 논문에서는 정책에 결정적인 '액션-투-비전 어텐션 하이재킹 (action-to-vision attention hijacking)'이라는 핵심 취약성을 평가하고 완화하기 위한 프레임워크인 VLAGuard를 제시합니다. 먼저, 인쇄 가능한 패치 (printable patches)를 사용하여 로봇의 액션 조건부 교차 어텐션 (action-conditioned cross-attention)을 심각하게 교란하는 스트레스 테스트 모듈인 Visuomotor Attention-guided Semantic Attack (VASA)를 소개합니다. 이에 대응하기 위해, 우리는 추론 오버헤드 (inference overhead) 없이 시공간적 어텐션 (spatiotemporal attention)을 안정화하고 기하학적 일관성 (geometric consistency)을 강제하는 방어 기법인 Attention-Protective Fine-Tuning (APFT)을 제안합니다. 시뮬레이션 및 물리적 WSN 지원 스마트 환경 전반에 걸친 평가 결과, 상당한 강건성 (robustness) 향상을 입증했습니다. APFT는 LIBERO 시뮬레이션에서 OpenVLA의 실패율을 100.0%에서 25.9%로 낮추었습니다. 또한, 2,000회의 실제 환경 테스트 결과, APFT는 심각한 패치 공격 하에서 평균 성공률을 23.0%에서 67.4%로 개선했습니다. 이는 어텐션 경로 (attention pathways)를 보호하는 것이 센서 네트워크 내 VLA 기반 엣지 노드의 강건성을 향상시키는 데 중요하다는 점을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기