Magnet: 능력 축적을 통한 교차 세션(Cross-Session) AI 오용 탐지
요약
에이전트 기반 AI 시스템에서 발생하는 교차 세션(Cross-session) 오용 위협을 탐지하는 Magnet 프레임워크를 제안합니다. 공격자가 해로운 목표를 여러 세션으로 분해하여 탐지를 회피하는 문제를 해결하기 위해, 사용자 단위의 상관관계 분석을 통해 흩어진 위험 증거를 수집합니다.
핵심 포인트
- 에이전트 앙상블 구조에서 발생하는 새로운 보안 위협 식별
- 단일 세션 탐지를 우회하는 교차 세션 목표 분해 공격 입증
- Magnet: 세션 간 축적된 능력을 모델링하는 새로운 탐지 방식
- 개별적으로 무해한 산출물을 결합하여 위험을 식별하는 증거 꾸러미 구성
가장 강력한 AI 배포 방식은 단일 모델이 아니라, 협력하여 위임하고 행동하는 전문화된 에이전트들의 앙상블(Ensemble)입니다. 이러한 아키텍처는 강력한 새로운 능력을 해제하지만, 기존의 모니터링, 탐지 및 완화를 위한 프레임워크가 해결하도록 설계되지 않은 위험을 초래하기도 합니다. 최첨단 AI 남용 탐지 문헌의 대부분은 단일 턴(Single-turn) 또는 멀티 턴(Multi-turn, 단일 세션) 위협 모델에 집중되어 있습니다. 이는 중요한 공백을 남깁니다. 즉, 공격자가 해로운 목표를 무해해 보이는 단위로 분해하고, 각각을 격리된 에이전트 세션에서 실행할 수 있다는 점입니다. 에이전트는 대화 사이에 상태를 유지하지 않는 스테이트리스(Stateless) 방식이지만, 공격자는 그렇지 않습니다. 이러한 비대칭성은 탐지를 회피하는 데 효과적인 교차 세션(Cross-session) 궤적을 가능하게 합니다.
우리의 기여는 두 가지입니다. 첫째, 우리는 교차 세션 목표 분해(Cross-session goal decomposition)를 회피 기술로서 입증하며, 이것이 동일한 단일 세션 또는 멀티 턴 공격보다 더 해로운 능력을 유도할 수 있음을 보여줍니다. 여기서 능력(Capability)이란 목표의 한 단계에서 생성된 산출물(Artifact)을 의미하며, 상호작용 결과(모델 응답 및 도구 호출 결과)를 통해 입증되고, 다른 곳에서 축적된 능력과 결합하여 해로운 전체를 구성할 수 있는 것을 말합니다. 둘째, 우리는 Magnet을 제안합니다. 이는 대화별 상태가 아닌, 더 높은 수준의 상관관계 분석기(이 경우 사용자 ID)에서 집계되는, 시간과 에이전트 대화에 걸쳐 축적된 관련 능력을 모델링하는 효율적이고 견고한 탐지 접근 방식입니다. 주요 과제는 Magnet이 추론할 증거 꾸러미(Evidence bundle)를 구성하는 것입니다. 유죄를 입증하는 산출물들은 개별적으로는 무해하지만, 일단 수집되면 위험해지는 양질의 세션이라는 건초더미 속에 흩어져 있는 바늘과 같을 수 있습니다. 건초더미를 짚 하나하나씩 뒤지는 대신(즉, 세션별 검사), Magnet은 그 이름이 암시하는 바와 같이 세션과 시간을 가로질러 건초더미 속에서 관련 있는 바늘들을 끌어당겨, 탐지기가 조치할 수 있는 압축된 증거 꾸러미로 모읍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기