goal-anchor v0.1.0: 다단계 에이전트를 위한 목표 무결성
요약
본 문서는 다단계 에이전트가 목표 이탈(Goal Hijack)을 방지하기 위한 'goal-anchor' 프레임워크를 소개합니다. 이는 인간의 확인을 거친 앵커와 승인된 확장을 통해, 에이전트가 합의된 목표에서 벗어나는 것을 감지하는 센서 역할을 합니다. 구조적 및 의미론적 레이어를 제공하며, 사후 검증된 확장(confirm_amplification) 기능을 통해 이탈 흔적을 기록합니다.
핵심 포인트
- Goal-Anchor는 다단계 에이전트의 목표 무결성을 유지합니다.
- 인간 확인 기반 앵커와 승인된 확장을 사용해 목표 이탈을 방지합니다.
- 구조적(Layer 1) 및 의미론적(Layer 2) 감지 기능을 제공합니다.
goal-anchor v0.1.0: 다단계 에이전트를 위한 목표 무결성
Agent Goal Hijack 방지 센서: 인간의 확인을 거친 앵커와 단계 중간에 승인된 확장을 통해 합의된 목표의 이탈을 감지합니다.
문제점
긴 작업에서 공격자는 성공하는 것처럼 보이는 상태를 유지하면서 에이전트를 다른 목표로 유도할 수 있습니다 (WebTrap). 인간이 확인하고 에이전트가 단독으로 재작성할 수 없는 목표 참조가 필요합니다.
기능
goal-anchor는 GoalAnchor, AnchorProposal, 그리고 DriftMonitor를 노출합니다.
- 레이어 1 (구조적, 0-LLM): 앵커 외부에서 주장된 마일스톤의 누적 신호. 급격한 이탈을 감지합니다 (코퍼스의 T3 사례).
- 레이어 2 (의미론적): 플러그인 가능한 embedder 인터페이스. 기본 스텁은 의도적으로 작동하지 않도록 되어 있습니다 — 알려진 격차로 문서화되었습니다.
- confirm_amplification(): 사후 검증된 확장(앵커가 먼저 확인되어야 함)으로, 흔적을 지우지 않고 흉터를 기록합니다.
작동 방식
from goal_anchor.anchor import GoalAnchor, AnchorProposal
ga = GoalAnchor(
- **Repo:** [https://github.com/amurlaniakea/goal-anchor](https://github.com/amurlaniakea/goal-anchor)
_라이선스: AGPL-3.0-or-later. 작성자: Pedro Sordo Martínez._
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기