scope-lib v0.1.0: AI 에이전트를 위한 3가지 기준의 범위 평가
요약
scope-lib v0.1.0은 LLM 에이전트의 안전성을 높이기 위한 범위 평가 라이브러리입니다. 이 라이브러리는 특정 행동을 실행하기 전에 세 가지 기준(i_subobjective, ii_resource, iii_transitive)으로 검토하여 승인된 범위 내에 있는지 결정합니다. 이를 통해 자율 에이전트가 의도치 않은 외부 데이터나 행동으로 인해 벗어나는 것을 방지하는 결정론적 fail-safe를 제공합니다.
핵심 포인트
- 자율 에이전트의 신뢰성 확보를 위한 필수적인 안전 계층입니다.
- 행동을 세 가지 기준(하위 목표 기여, 자원 사용, 전이성)으로 평가합니다.
- 기본 실패 처리 방식은 '거부(deny)'로 설정되어 안전성을 보장합니다.
scope-lib v0.1.0: AI 에이전트를 위한 3가지 기준의 범위 평가
LLM 에이전트 방어 시스템의 기본 계층입니다. 실행하기 전에 특정 행동이 승인된 범위 내에 있는지 결정하며, 결정론적 fail-safe를 제공합니다.
문제점
자율 에이전트는 작업을 받고 툴 호출(tool-calls)을 실행합니다. 만약 범위 경계가 없다면, 신뢰할 수 없는 모든 데이터(이메일, 웹 등)가 합의된 범위를 벗어난 행동으로 에이전트를 이탈시킬 수 있습니다. 프롬프트에 숨겨진 것이 아니라 명시적이고 검토 가능한 결정 지점이 필요합니다.
기능
scope-lib는 PolicyStore와 load_policy_store를 노출하며, 각 행동을 세 가지 기준(ScopeVerdict.criterion)으로 평가합니다:
- i_subobjective: 해당 행동이 앵커(anchor)의 하위 목표에 기여하는지 여부.
- ii_resource: 선언된 자원(측면적이지 않은)을 사용하는지 여부.
- iii_transitive: 하위 목표 간의 지원이 전이적이고 제한적인지 여부.
기본 실패 처리(fail-safe)는 **거부(deny)**입니다. 앵커가 확인되지 않으면 결코 허용하지 않습니다. 이것이 바로
라이선스: AGPL-3.0-or-later. 작성자: Pedro Sordo Martínez.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기