압축 환경에서의 제어: 도구 사용 에이전트를 위한 신뢰성 경계 (Reliability Frontiers)
요약
도구 사용 에이전트의 제어 컨텍스트(ACC) 압축 시 발생하는 신뢰성 문제를 다루는 연구입니다. 새로운 벤치마크인 CompressAgent를 통해 압축률에 따른 에이전트의 실행 성공률과 신뢰성 경계를 분석했습니다.
핵심 포인트
- 에이전트 제어 컨텍스트(ACC) 압축 시 런타임 신뢰성 검증이 필수적임
- 새로운 벤치마크 CompressAgent를 통해 압축 효율과 성공률 관계 분석
- 컨텍스트 유지율이 50% 미만으로 떨어질 때 방법론별 성능 차이가 급격히 발생
- 압축 실패는 주로 도구 실행 및 액션 파싱 오류에서 기인함
도구 사용 언어 모델 에이전트 (Tool-using language-model agents)는 작업 프롬프트 (task prompts)뿐만 아니라 도구, 인자 (arguments), 정책 (policies), 실행 프로토콜 (execution protocols) 및 복구 (recovery)를 지정하는 지속적인 시스템 측 지침 (system-side instructions)에 의해 제어됩니다. 이러한 에이전트 제어 컨텍스트 (Agent Control Contexts, ACCs)를 압축하면 입력 비용과 컨텍스트 사용량을 줄일 수 있지만, 기존의 프롬프트 압축 (prompt-compression) 평가 방식은 결과적으로 생성된 제어가 운영 측면에서 신뢰할 수 있는지를 밝혀내지 못합니다. 우리는 9개의 독립적으로 구축된 ACC, 3개의 작업군 (task families), 3개의 고정된 Qwen API 모델 식별자, 6개의 유지 컨텍스트 예산 (retained-context budgets), 그리고 15,525회의 실행을 통해 ACC 압축을 환경 검증하는 벤치마크인 CompressAgent를 소개합니다. 우리는 비선형적이고 방법론에 따라 달라지는 신뢰성 경계 (reliability frontier)를 발견했습니다. 75%의 컨텍스트 유지율에서 일반적인 재작성 (generic rewriting) 및 섹션 기반 압축 (section-based compression)은 92.7%와 92.4%의 성공률을 달성하여, 93.8%인 전체 컨텍스트 기준선 (full-context baseline)에 근접했습니다. 50%에서 35% 사이에서는 방법론들이 급격히 갈라지며, 35% 지점에서 섹션 기반, 의무 인지 (obligation-aware), 그리고 일반적 재작성 방식은 각각 47.0%, 39.0%, 19.9%를 달성했습니다. 25%에서 10% 사이의 컨텍스트 유지 예산에서는 실행 가능한 프로토콜 (executable protocols)이 취약해집니다. 신뢰성은 또한 ACC에 따라 상당히 달라지며, 이는 보편적인 압축기 순위 매기기가 부적절함을 나타내고 컨텍스트별 자격 검증 (per-context qualification)의 필요성을 부여합니다. 실패 분석에 따르면 압축은 주로 도구 실행 (tool-execution) 및 액션 파싱 (action-parsing) 오류로 나타납니다. 이러한 발견은 ACC 압축을 단순한 토큰 감소의 문제가 아니라, 실행 가능한 결과 (executable outcomes)를 통해 평가되어야 하는 런타임 신뢰성 (runtime-reliability) 문제로 재정의합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기