SlotGuard: LLM 에이전트 전사 과정에서 개인적인 로컬 컨텍스트의 과도한 공유 방지
요약
LLM 에이전트의 전사 과정에서 발생할 수 있는 개인정보 및 자격 증명 유출을 방지하는 SlotGuard를 제안합니다. 기존 비식별화 방식의 한계를 극복하여 에이전트의 성능을 유지하면서도 민감한 데이터를 효과적으로 보호합니다.
핵심 포인트
- 구조적 바인딩을 타입화된 슬롯으로 재작성하여 데이터 보호
- 형식을 유지하는 합성 값으로 대체하여 추론 능력 보존
- 경량 세션 그래프를 통해 턴 간 참조 연결 및 데이터 복원
- 자격 증명 유출 0.0% 달성 및 기존 방식 대비 높은 작업 성공률 유지
- 에이전트 턴당 매우 낮은 오버헤드(중앙값 14.424μs) 제공
LLM 에이전트는 에이전트 관찰값(예: 도구 출력, 셸 로그, 파일 읽기)이 제공자에게 전송되는 전사(transcripts)에 추가됨에 따라 개인정보(예: 경로, 이메일) 및 자격 증명(예: API 키)을 유출할 수 있습니다. 기존의 플레이스홀더(placeholder) 기반 비식별화(redaction) 방식은 취약합니다. 이는 내장된 참조나 대화 턴(turn)을 넘나드는 참조를 놓칠 수 있고, 무해한 유사 항목을 과도하게 비식별화하며, 추론에 유용한 구조를 파괴할 수 있습니다. 우리는 에이전트의 성능을 유지하면서 민감한 데이터를 숨길 수 있는 로컬 전사 경계인 SlotGuard를 제안합니다. SlotGuard는 구조적 바인딩(structural bindings)을 타입화되고 접미사 인지(suffix-aware)가 가능한 슬롯(slots)으로 재작성하고, 비밀 정보를 형식을 유지하는 합성 값(format-preserving synthetic values)으로 대체하며, 경량 세션 그래프(session graph)를 통해 턴 간 참조를 연결하고, 신뢰할 수 있는 런타임(runtime) 내부에서만 원본 값을 복원합니다. 통제된 리포지토리 지향 에이전트 전사 데이터에서 SlotGuard는 9,229개의 경로에 걸쳐 주석 처리된 20,814개의 구조적 민감 문자를 모두 제거하였으며, 심어진 852개의 값에 대해 자격 증명 유출을 0.0%로 줄였습니다. SlotGuard는 일반적인 비식별화 방식이 2.5%로 떨어지는 동안, 4개의 업스트림 모델(upstream models) 전반에서 원본 전사 기반의 작업 성공률과 유사한 수준을 유지합니다. 전사 재작성(Transcript rewriting)은 에이전트 턴당 중앙값 14.424~$μ$s가 소요됩니다. 코드는 https://github.com/illinoisdata/SlotGuard 에서 공개적으로 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기