영국 정부가 이 오픈 소스 AI 보안 벤치마크를 국가 평가 프레임워크에 통합했습니다
요약
영국 정부의 AI Safety Institute가 오픈 소스 AI 에이전트 보안 벤치마크인 AgentThreatBench를 공식 평가 프레임워크에 통합했습니다. 이 벤치마크는 AI 에이전트의 메모리 포이즈닝 공격 저항성을 테스트하기 위해 설계되었습니다.
핵심 포인트
- AgentThreatBench는 200개 이상의 공격 페이로드를 포함함
- AI 에이전트의 메모리 포이즈닝 취약성을 집중적으로 테스트
- 영국 정부의 공식 AI 안전 평가 툴킷으로 채택됨
- 프롬프트 인젝션 등 5가지 공격 카테고리를 다룸
발생한 일
지난달, 영국 정부의 AI Safety Institute는 AgentThreatBench를 공식 inspect_evals 프레임워크에 통합했습니다. 이 프레임워크는 OpenAI, Anthropic, Google DeepMind의 프런티어 AI (Frontier AI) 모델을 평가하는 데 사용되는 것과 동일한 프레임워크입니다.
AgentThreatBench는 제가 구축한 오픈 소스 적대적 벤치마크 (Adversarial Benchmark)로, AI 에이전트 (AI agents)가 메모리 포이즈닝 (Memory Poisoning) 공격에 저항할 수 있는지 테스트하기 위해 특별히 설계된 **200개 이상의 공격 페이로드 (Attack Payloads)**를 포함하고 있습니다.
이것이 중요한 이유
AI 에이전트는 지속적인 메모리 (Persistent Memory)를 갖춘 채 점점 더 많이 배포되고 있습니다. 즉, 과거의 대화, 사용자 선호도, 세션 간의 문맥을 기억합니다. 이는 새로운 공격 표면 (Attack Surface)인 **메모리 포이즈닝 (Memory Poisoning)**을 생성합니다.
에이전트의 메모리에 악성 콘텐츠를 주입할 수 있는 공격자는 다음과 같은 행위를 할 수 있습니다:
- 이후 세션에서 민감한 데이터 유출 (Exfiltrate)
- 안전 지침 (Safety Instructions)을 지속적으로 무시하도록 덮어쓰기
- 사용자가 모르는 사이에 에이전트의 행동을 조작
OWASP Agentic Security Initiative는 이를 ASI06 — 에이전트 메모리 포이즈닝 (Agent Memory Poisoning)으로 식별했습니다.
AgentThreatBench가 테스트하는 것
이 벤치마크는 5가지 공격 카테고리를 다룹니다:
| 카테고리 | 페이로드 (Payloads) | 설명 |
|---|---|---|
| 프롬프트 인젝션 (Prompt Injection) | 40+ | 메모리 콘텐츠로 위장된 지침 |
| ... |
사용 방법
pip install agentthreatbench
# 에이전트를 대상으로 전체 벤치마크 실행
...
BEIS 검증
영국 정부의 AI Safety Institute는 inspect_evals를 다음과 같은 용도로 사용합니다:
- 배포 결정 전 프런티어 모델 (Frontier Models) 평가
- 제공업체 간의 안전 완화 (Safety Mitigations) 벤치마킹
- 시간에 따른 안전 속성 (Safety Properties)의 퇴보 (Regression) 추적
AgentThreatBench가 이 프레임워크에 통합되었다는 것은 이제 이것이 AI 안전 평가를 위한 **정부 공식 툴킷 (Official Government Toolkit)**의 일부가 되었음을 의미합니다.
링크
링크
- GitHub: github.com/vgudur-dev/AgentThreatBench
- BEIS inspect_evals: github.com/UKGovernmentBEIS/inspect_evals
- OWASP ASI06: genai.owasp.org/resource/agentic-security-initiative
- PyPI: pypi.org/project/agentthreatbench
지속적인 메모리를 가진 AI 에이전트를 구축하고 계시다면, 메모리 보안에 대해 어떻게 생각하시는지 듣고 싶습니다. 어떤 공격 벡터가 가장 우려되십니까?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기