trajectory-sentinel v0.1.0: 에이전트 방어 신호의 상관관계 분석
요약
trajectory-sentinel v0.1.0은 여러 방어 신호를 결합하여 AI 에이전트의 공격을 탐지하는 모니터링 도구입니다. 개별 센서가 놓칠 수 있는 편차를 전체 궤적(trajectory) 분석을 통해 상관관계로 파악하여 보안을 강화합니다.
핵심 포인트
- 여러 방어 신호를 결합하여 단일 센서의 한계를 극복
- 전체 작업 궤적을 바탕으로 한 상관관계 분석 기능 제공
- goal-anchor의 편차 감지 시 위험 확인 및 재검토 로직 포함
- 현재 전체 작업 단위로 철회가 이루어지는 한계 존재
trajectory-sentinel v0.1.0: 에이전트 방어 신호의 상관관계 분석
adi-shield,wallet-guard및goal-anchor신호를 결합하여 단일 센서로는 감지할 수 없는 공격을 탐지하는 모니터입니다.
문제점
각 센서는 부분적인 정보만을 봅니다. 공격자는 한 센서가 "허용(allow)"이라고 말할 때 다른 센서가 편차(deriva)를 감지하더라도 통과할 수 있습니다. 개별적인 도구 호출(tool-call)이 아닌, 전체 궤적(trajectory)을 바탕으로 신호를 상관관계 분석(correlate)하고 결정할 수 있는 계층이 필요합니다.
기능
trajectory-sentinel은 TrajectorySentinel과 correlate()를 노출합니다. 결정론적 규칙(0-LLM)은 다음과 같습니다:
- 어떤 센서라도
block/kill을 발생시키면 차단됩니다. - 다른 센서들이
allow라고 할 때goal-anchor가 편차(deriva)를 감지하면 → 위험을 확인합니다. goal-anchor가drift_retract(지연된 인간 확장)를 발행하면 → 이전 경고를 동결하거나 숨기지 않고, 판정을allow로 재검토합니다.- 2개 이상의 센서가
confirm상태이면 → 통합 확인(confirm agregado)이 이루어집니다.
작동 방식
from trajectory_sentinel.monitor import TrajectorySentinel
from adi_shield.bus import LocalSignalBus
bus = LocalSignalBus()
...
실제 버스(LocalSignalBus)는 E2E 테스트에서 사용되며, goal-anchor와의 통합은 엔드 투 엔드(end-to-end)로 검증되었습니다.
감사(Audit) 결과
trajectory-sentinel의 13개 테스트 모두 통과(green);ruff클린.- 최신 클론(branch
main, commit35c02e2)에서 감사 완료.
한계점 (솔직하게)
철회(retractación)는 하위 목표(sub-objetivo) 단위가 아닌 전체 작업(tarea completa) 단위로 이루어집니다. 즉, 두 개의 하위 목표가 편차를 보이고 그중 하나만 철회되더라도, 전체 작업은 allow로 내려갑니다. 이 내용은 README에 문서화되어 있습니다. 이 시스템은 실제 에이전트의 미들웨어(middleware)로 배포된 상태는 아닙니다.
테스트 방법
git clone --branch main https://github.com/amurlaniakea/trajectory-sentinel.git
cd trajectory-sentinel && python -m venv .venv && . .venv/bin/activate
pip install -e . && pip install -e ../adi-shield && pip install -e ../goal-anchor
...
링크
라이선스: AGPL-3.0-or-later. 작성자: Pedro Sordo Martínez.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기