MemSecBench: 지속성에서 결과 및 복구에 이르는 에이전트 메모리 오염 추적
요약
에이전트 메모리 시스템의 보안 취약점을 평가하기 위한 새로운 벤치마크인 MemSecBench를 소개합니다. 악의적인 지시문이 장기 메모리에 저장되어 이후 행동에 미치는 영향과 복구 가능성을 다양한 환경에서 추적합니다.
핵심 포인트
- 에이전트 메모리 오염의 지속성 및 다운스트림 영향을 평가하는 벤치마크 제안
- 코드, 과학, 사무 등 48개 현실적 맥락의 310개 사례 포함
- 실험 결과 악의적 메모리의 84.2%가 지속됨을 확인
- 메모리 시스템 스택에 따른 라이프사이클 보안 차이 입증
메모리 시스템은 에이전트가 과거 상호작용으로부터 정보를 유지하고 재사용할 수 있게 해주지만, 악의적인 콘텐츠가 지속되도록 방치할 수도 있습니다. 공격자가 정교하게 제작한 악의적인 지시문은 장기 메모리(long-term memory)에 저장되어 훨씬 나중에 호출될 수 있으며, 실제 행동을 조용히 형성할 수 있습니다. 최근 벤치마크들은 에이전트 메모리 보안을 점점 더 많이 조사하고 있지만, 다양한 메모리 백엔드(memory-backend) 비교 하에서 지속성, 다운스트림 결과(downstream consequences), 그리고 선택적 복구(selective repair)에 걸쳐 동일한 악의적 의미론(semantics)을 추적하는 경우는 거의 없습니다. 이러한 격차를 해소하기 위해, 우리는 에이전트 메모리 시스템의 라이프사이클 보안을 위한 태스크 기반 벤치마크인 MemSecBench를 소개합니다. 이는 코드 및 과학, 일상생활, 사무 업무에 걸친 48개의 현실적인 맥락에서 추출된 310개의 사례를 포함합니다. 각 사례는 에이전트 하네스(agent harness), 메모리 백엔드(memory backend), 그리고 LLM 백엔드(LLM backend)로 정의된 정확한 에이전트 구성 하에서 격리된 런타임(runtime) 내의 통제된 Write--Execute--Forget 프로토콜을 따릅니다. 증거 기반 판정(Evidence-based adjudication)은 결정론적 쓰기 확인(deterministic write check), 체크포인트별 판사 모델(judge-model) 평가, 그리고 7개의 라이프사이클 체크포인트에 걸친 프로그래밍 방식의 게이트(programmatic gates)를 결합합니다. 실험 설계는 2개의 에이전트 하네스, 4개의 메모리 백엔드, 3개의 LLM 백엔드로 구성된 24개 구성 매트릭스를 아우릅니다. 24개 구성 전체에서 악의적인 메모리는 모든 사례의 84.2%에서 지속되며, 전체 Write--Execute 체인은 50.3%의 성공률을 보입니다. 성공적으로 오염된 사례 중 59.6%는 전체 Execute 체인을 완료하며, 56.1%는 선택적 복구(selective repair)를 달성합니다. 매칭된 네이티브(Native) 구성과 비교했을 때, 가장 큰 절대적 차이는 엔드투엔드(end-to-end) 공격 성공률에서 16.1%포인트, 선택적 복구에서 41.3%포인트입니다. 이러한 기술적 대조는 평가된 메모리 시스템 스택이 악의적인 메모리의 전파와 메모리 오염 성공 후의 선택적 복구 측면 모두에서 라이프사이클 보안이 다름을 나타냅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기