E-Bench: 실제 제품 시나리오에서의 다단계 도구 사용 (Multi-Step Tool-Use) 에이전트 벤치마킹
요약
실제 제품 시나리오에서 에이전트의 다단계 도구 사용 능력을 평가하기 위한 새로운 벤치마크인 E-Bench를 소개합니다. 환경과 작업을 합성하여 제어 가능성과 확장성을 확보했으며, 최신 LLM들이 여전히 복잡한 다단계 작업에서 한계를 보임을 입증했습니다.
핵심 포인트
- 실제 제품 도메인을 반영한 323개의 상태 변화 작업 포함
- 환경 합성 및 작업 합성을 분리하여 제어 가능성과 확장성 확보
- 정보 격차와 도구 격차를 활용한 고난도 다단계 도구 사용 요구
- 최신 LLM들의 Pass^3 성능이 60~70% 미만임을 확인
대규모 언어 모델 (LLMs)은 숨겨진 정보를 수집하고, 도구 호출 (tool calls)을 구성하며, 상태 변화를 확정하는 등 여러 단계에 걸쳐 상태 유지 환경 (stateful environments)과 상호작용하는 에이전트로 점점 더 많이 배치되고 있습니다. 우리는 이러한 능력을 다단계 도구 사용 (multi-step tool use)이라고 부릅니다. 기존의 벤치마크들은 도구 사용 에이전트 평가를 발전시켜 왔으나, 종종 고립된 API 호출, 짧은 궤적 (trajectories), 또는 확장하거나 제어하기 어려운 설정에 집중해 왔습니다. 우리는 Honor of Kings, QQ Music, Tencent Meeting의 세 가지 제품 도메인에 걸쳐 323개의 상태 변화 작업을 포함하는 완전 합성 벤치마크인 E-Bench를 소개합니다. E-Bench는 환경 합성 (environment synthesis)과 작업 합성 (task synthesis)을 분리합니다. 그래프 가이드 데이터베이스 채우기 (graph-guided database filling)는 재사용 가능하고 고립되지 않은 (orphan-free) 제품 환경을 구축하며, 생성기-해결사 비대칭성 (generator-solver asymmetry)은 정보 격차 (information gap)와 도구 격차 (tool gap)를 모두 가진 작업을 생성하여, 에이전트가 상태를 변경하기 전에 숨겨진 데이터를 발견하고 여러 번의 도구 호출을 구성하도록 요구합니다. 결과는 데이터베이스 상태 차이 (database-state diffs)에 의해 결정론적으로 채점됩니다. 환경과 작업이 모두 합성된 것이므로, E-Bench는 환경 수준에서 제어 가능하며 작업 수준에서 확장 가능합니다. 11개의 최첨단 LLMs를 벤치마킹한 결과, 다단계 도구 사용은 여전히 도전적인 과제로 남아 있음을 보여줍니다. 가장 강력한 모델들의 Pass^3는 60% 미만에 머물러 있으며, E-Bench-Code 확장 기능에서 코드 실행을 포함하더라도 신뢰도 (Pass^3)는 70% 미만입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기