AgentTracer: 세밀한 의도-실행 정렬을 통한 간접 프롬프트 주입 공격 추적
요약
본 논문은 LLM 에이전트가 간접 프롬프트 주입(IPI) 공격에 노출되는 문제를 다루며, 이를 '작업 의도 표류'로 정의합니다. 제안된 AgentTracer는 도구 호출 간의 암묵적 결정 의존성을 복구하여 '의도 기반 실행 그래프'를 구성하고, 이를 통해 공격 체인을 재구성하는 새로운 추적 프레임워크입니다.
핵심 포인트
- AgentTracer는 IPI를 작업 의도 표류로 정의합니다.
- 암묵적인 도구 호출 간의 결정 의존성을 복구하여 분석합니다.
- 의도 기반 실행 그래프(Intent-Driven Execution Graph)를 구축합니다.
- 기존 방법 대비 주입 지점 정확도를 크게 향상시켰습니다.
대규모 언어 모델(LLM) 에이전트는 복잡한 사용자 작업을 완료하기 위해 외부 리소스와 상호작용하며, 이 과정에서 악의적인 지침이 에이전트를 공격자가 의도한 작업으로 재지정하는 간접 프롬프트 주입(IPI)에 노출됩니다. IPI는 실제 환경에서 방어하기 어렵기 때문에, 침해 사고 후 추적은 주입 출처를 찾고 공격 체인을 재구성하는 데 필수적입니다. 그러나 기존의 추적 방법들은 주로 명시적인 제어 흐름 및 데이터 흐름 의존성을 포착할 뿐, 악성 지침에 의해 구동되는 도구 호출 간의 암묵적인 관계는 놓치고 있습니다. 이러한 도구 호출은 명시적인 의존성이 부족할 수 있으며 합법적인 작업과 교차되어 완전한 공격 체인 재구성을 어렵게 만듭니다. 본 논문에서는 IPI를 작업 의도 표류(task intent drift)로 간주하는, 의도 인식 추적 프레임워크인 AgentTracer를 제시합니다. AgentTracer는 도구 호출 간의 암묵적인 결정 의존성을 복구하여 작업 의도를 통해 분산된 도구 호출을 연결하는 '의도 기반 실행 그래프(Intent-Driven Execution Graph)'를 구성합니다. 이는 사용자 요청과 작업 지식 기반을 결합하여 사용자 의도 승인 공간을 구축하고, 의도 표류가 발생한 도구 호출을 식별합니다. 감사 대상이 되는 비정상적인 도구 호출에서 시작하여, AgentTracer는 목표 기반 가지치기(target-based pruning)와 역방향 추적(backward tracing)을 수행하여 공격 체인을 재구성하고 주입 출처 및 주입 지점을 찾습니다. 정상 작업의 노이즈가 존재하는 상황에서 AgentTracer를 평가하기 위해, AgentDyn과 InjecAgent에서 성공적인 IPI 공격으로 구축된 실행 로그와 1,800개의 사용자 요청 및 IPI가 없는 9,000개의 백그라운드 도구 호출을 포함하는 정상 실행 로그를 결합했습니다. 종단 간(end-to-end) 실험에서 AgentTracer는 94.17%의 주입 지점 정확도와 93.56%의 경로 정밀도를 달성했습니다. 비교 실험 결과, AgentTracer는 기존 방법 대비 주입 지점 정확도를 18%에서 54%까지 향상시키는 것으로 나타났습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기