에이전트가 당신처럼 행동하는 법을 배울 때: 페르소나 스킬에서의 개인정보 유출, 사칭 위험 및 방어 체계 벤치마킹
요약
페르소나 스킬을 통한 에이전트 개인화 과정에서 발생하는 개인정보 유출 및 사칭 위험을 분석한 연구입니다. 새로운 벤치마크인 AntiSkillBench를 통해 스킬 증류 전략에 따른 보안 취약점과 기존 방어 체계의 한계를 체계적으로 평가합니다.
핵심 포인트
- 페르소나 스킬 증류 시 개인정보 유출 및 행동 사칭 위험 존재
- 새로운 보안 평가 벤치마크 AntiSkillBench 제안
- 기존 방어 체계가 다양한 증류 전략에 일반화되지 못함을 확인
- 에이전트 백본과 관계없이 성격 및 스타일 정보 노출 지속
페르소나 스킬 (Persona skills)은 개인의 상호작용 이력을 하위 에이전트 (downstream agents)를 위해 휴대 가능하고 실행 가능한 산출물로 증류합니다. 이는 유연한 개인화를 가능하게 하지만, 이 과정에서 파편화된 개인 신호들이 집중되고 재사용을 통해 그 영향력이 증폭되며, 개별 기록이나 검색 기반 메모리 (retrieval-based memory)를 위해 설계된 방어 체계에 도전 과제를 제기합니다. 페르소나-스킬 파이프라인의 안전성을 체계적으로 조사하기 위해, 우리는 페르소나-스킬 파이프라인 전반의 위험과 방어를 평가하기 위한 엔드 투 엔드 (end-to-end) 벤치마크인 AntiSkillBench를 소개합니다. 이는 다음으로 구성됩니다: (i) 다양한 작업 시나리오에 걸쳐 행동적으로 풍부한 50개의 프로필로부터 구축된 7,500개의 페르소나 기반 대화 추적 데이터셋; (ii) 세 가지 스킬 증류 (skill-distillation) 전략에 걸쳐 스킬 수준의 개인정보 유출 (privacy leakage)과 에이전트 수준의 속성 노출 (attribute disclosure) 및 행동 사칭 (behavioral impersonation)을 측정하는 평가 스위트; (iii) 능동적 위험 억제 (active risk suppression) 및 수동적 출처 보호 (passive provenance protection)를 포함하여 온라인 및 사후 개입 (post-hoc interventions) 전반의 네 가지 구성을 다루는 방어 평가. 세 가지 프런티어 에이전트 (frontier agents)를 대상으로 한 실험 결과, 페르소나-스킬 위험은 에이전트 백본 (agent backbones)과 증류 프로토콜에 관계없이 명시적 속성에서부터 의사소통 스타일 및 성격 특성에 이르기까지 지속됨을 보여줍니다. 기존의 방어 체계는 제한적이고 증류 방식에 의존적인 효과를 보였으며, 위험 및 증류 전략 전반에 걸쳐 일반화하는 데 실패했습니다. 이러한 결과는 AntiSkillBench가 개인정보 보호 및 진본성 인식 (authenticity-aware) 페르소나 스킬을 개발하기 위한 도전적인 벤치마크임을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기