점수는 결정이 아니다: LLM 에이전트의 도구 획득을 위한 비용 인식 중단 전략
요약
LLM 에이전트가 외부 도구를 선택할 때 발생하는 비용과 컨텍스트 부하 문제를 해결하기 위한 새로운 전략을 제안합니다. 비용 인식 한계 결정 중심 중단(CAM-DF) 방식을 통해 도구 획득의 최적 지점을 결정하며, 기존 방식 대비 도구 노출 수를 37% 줄이면서도 높은 성능을 유지합니다.
핵심 포인트
- 도구 과다 획득 시 발생하는 비용 및 개인정보 노출 문제 해결
- 비용 인식 한계 결정 중심 중단(CAM-DF) 알고리즘 제안
- LLM 미세 조정 없이 적용 가능한 경량화된 플러그인 방식
- 도구 사용 수를 37% 절감하면서도 작업 성공률 유지
LLM 에이전트가 검색 엔진, 데이터베이스, 커넥터와 같은 다양한 외부 서비스에 점점 더 의존함에 따라, 에이전트 하네스(agent harnesses)는 근본적인 도구 선택 과제에 직면해 있습니다. 즉, 도구를 너무 적게 획득하면 작업에 대한 정보가 부족해지고, 너무 많이 획득하면 비용, 컨텍스트 부하(context load) 및 개인정보 노출이 증가합니다. 라우터(Routers)와 검색기(retrievers)는 후보 도구들을 관련성에 따라 순위를 매길 수 있지만, 순위만으로는 얼마나 많은 도구를 선택할 가치가 있는지를 결정하지 못합니다. 기존 방식들은 이질적인 비용(heterogeneous costs) 하에서의 획득 문제를 해결하지 못하고 있습니다. 우리는 이 결정을 순위가 매겨진 도구 접두사(tool prefixes)에 대한 비용 인식 한계 결정 중심 중단(cost-aware marginal decision-focused stopping, CAM-DF)으로 공식화하며, 컴팩트하고 해석 가능한 변형인 CAM-DF-lite를 제안합니다. 우리는 '지금 중단하는 것'과 '최선의 지속' 사이의 오프라인 격차(offline gap)를 바탕으로 직접 학습합니다. 이 격차의 부호(sign)는 결정을 라벨링하며, 그 크기(magnitude)는 걸려 있는 보상(payoff)에 따라 각 오류의 가중치를 부여합니다. 우리는 이 목적 함수가 중단 목표와 베이즈 정렬(Bayes-aligned)되어 있으며, 점수만 사용하는 규칙은 이질적인 비용 하에서 하위 최적(suboptimal)임을 증명합니다. 우리는 5개의 도구 사용 도메인에 걸친 1,343개의 작업에서 이를 평가했습니다. $\tau$-bench Retail에서 CAM-DF는 배포 가능한 방법들 중 가장 높은 보상을 달성했으며, 5개의 모든 순위 소스와 2개의 비용 체계(cost regimes)에서 '예측 후 임계값 설정(predict-then-threshold)' 베이스라인보다 높은 성능을 보였습니다. 우리의 접근 방식은 이질적인 비용과 높은 비용 압박 하에서 최첨단(state-of-the-art) 성능을 보여주며, 순위가 약할수록 더 큰 이득을 얻습니다. 실제 실행 시, CAM-DF는 전체 접근 방식과 유사한 작업 성공률을 유지하면서도 에이전트가 노출되는 도구의 수를 37% 줄였습니다. CAM-DF 제품군은 기존 도구 순위를 기반 모델인 LLM을 미세 조정(fine-tuning)하지 않고도 더 낮은 비용의 획득 결정으로 전환해 주는 경량화된 실행 전 플러그인(pre-execution plugin)입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기