TAPDreamer: 월드 액션 모델을 위한 전이 가능한 적대적 패치
요약
본 논문은 월드 액션 모델에 대한 새로운 적대적 공격인 TAPDreamer를 제안합니다. 기존 공격과 달리, 공개 인코더만을 사용하여 전이 가능한 고정 국소 교란(fixed local perturbation)을 구성하며 대상 정책의 출력이 필요 없습니다. 이 패치는 공유 시각 인코더 전체로 변화를 전파하여 다양한 태스크에서 모델 성능을 급격히 저하시키는 것을 입증했습니다.
핵심 포인트
- TAPDreamer는 공개 인코더만을 이용하는 전이적 적대적 공격입니다.
- 대상 정책의 출력이 필요 없어 공격 구현이 용이합니다.
- 하나의 패치로 여러 태스크에서 모델 성능을 0%까지 떨어뜨릴 수 있습니다.
- 공유 시각 인코더 방어책 마련이 중요함을 강조합니다.
월드 모델(World model)은 환경이 어떻게 진화할지 예측하는 방법을 학습하며, 이는 범용 로봇 제어의 중요한 기반이 됩니다. 하지만 월드 액션 모델(world action models)은 카메라 입력에 의존하는데, 이 입력 조작은 여러 태스크와 액션 정책 전반에 사용되는 시각적 표현을 손상시킬 수 있습니다. 기존의 이러한 모델에 대한 공격들은 피해자(victim)의 행동이나 예측된 미래를 최적화하기 때문에 대상 모델(target-model)의 출력 접근이 필요합니다. 본 논문에서는 대신 공개 인코더(public encoder)만을 사용하여 태스크와 액션 아키텍처 전반으로 전이되는 고정된 국소 교란(fixed local perturbation)을 구성하는 공격, TAPDreamer를 월드 액션 모델에 제안합니다. TAPDreamer는 대상 정책(target-policy) 질의가 필요하지 않습니다. 우리의 핵심 통찰은 패치로 유도된 어텐션 가중치(attention weights)와 값 벡터(value vectors) 간의 상호작용이 패치 영역을 훨씬 넘어 거의 동일한 표현 변화를 전파하며, 이 변화는 태스크 관측에 걸쳐 안정적으로 유지된다는 것입니다. 이 통찰에 따라 TAPDreamer는 하나의 소스 태스크에서 가져온 6개의 프레임을 사용하여 깨끗한(clean) 인코더 표현과 패치된 인코더 표현 간의 전역 L1 거리를 최대화합니다. 폐쇄 루프 평가(closed-loop evaluation) 결과, 벤치마크당 고정된 하나의 패치는 입력의 약 6.5%를 커버하며, 40개의 LIBERO 태스크에 걸쳐 FastWAM의 성공률을 97.7%에서 0.0%로, 50개의 RoboTwin 태스크에 걸쳐 90.8%에서 0.0%로 낮춥니다. 일치하는 무작위 패치(matched random patches)는 각각 81.5%와 79.2%의 성공률을 유지했습니다. 동일한 패치는 두 DreamWAM 구성에서 성공률을 2.1% 및 0.8%로, 그리고 Motus에서는 10.0%로 낮춥니다. 이러한 결과들은 다운스트림 액션 생성만 보호하는 것은 불충분하며, 월드 액션 모델에 대한 방어책은 지속적인 국소 교란으로부터 공유 시각 인코더(shared visual encoders) 또한 확보해야 함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기