Argo-Bench: 기업 규모 워크플로우에서 데이터 에이전트 평가
요약
Argo-Bench는 기존의 텍스트-투-SQL 한계를 넘어선 데이터 에이전트 평가 프레임워크입니다. 뉴욕시 푸드 배달 플랫폼을 시뮬레이션한 대규모 ERP 웨어하우스를 기반으로, 단순 쿼리 생성을 넘어 탐색과 행동(사기 차단, 인센티브 할당 등)까지 요구합니다. 이를 통해 실제 엔터프라이즈 데이터 사이언스 워크플로우에 적합한 에이전트 성능을 측정할 수 있습니다.
핵심 포인트
- Argo-Bench는 210개의 복잡한 데이터 분석 태스크를 포함하는 평가 프레임워크입니다.
- 단순 SQL 생성 대신, 웨어하우스 탐색 및 실제 행동(Action) 수행 능력을 평가합니다.
- 뉴욕시 푸드 배달 플랫폼을 모델링하여 현실적인 대규모 ERP 환경을 시뮬레이션했습니다.
- 최첨단 모델들의 평균 점수는 59.5점으로, 에이전트 성능 향상의 필요성을 보여줍니다.
실제 엔터프라이즈 데이터 사이언스 및 분석 워크플로우는 수십 개의 테이블에 걸친 추론, 통계적 분석 수행, 그리고 그 결과에 따른 행동을 필요로 합니다. 기존의 텍스트-투-SQL(text-to-SQL) 벤치마크는 단순히 쿼리 생성만을 평가하며, 감사 결과에서도 정답 키가 자주 틀린 것으로 나타났습니다. 실제 기업 데이터 웨어하우스는 민감하여 공개하기 어렵기 때문에, 이러한 벤치마크들은 비즈니스 이벤트가 단일 테이블에 포함되는 공개 데이터셋을 기반으로 구축되었습니다. 우리는 210개의 데이터 사이언스 및 분석 태스크로 구성된 평가 프레임워크인 Argo-Bench를 소개합니다. 공공 데이터, 동료 검토 산업 문헌, 규제 신고 자료 등을 활용하여, 뉴욕시의 푸드 배달 플랫폼을 실제 규모(2024년 8,100만 건 주문)로 시뮬레이션하고, 경제적 기반, 사기 패턴, 마켓플레이스 인센티브를 구현했습니다. 이 세계는 Oracle E-Business Suite 스키마를 모델링한 235개 테이블과 75억 개의 행을 가진 ERP 웨어하우스로 내보내집니다. 시뮬레이터의 정답 상태(ground-truth state)는 에이전트가 보는 웨어하우스로부터 숨겨지므로, 태스크들은 행동을 취하기 전에 웨어하우스를 탐색하여 사실들을 재구성하도록 요구합니다. Argo-Bench는 텍스트-투-SQL을 넘어섭니다: 에이전트는 사기 계정 차단, 배달원 인센티브 예산 할당, 또는 밀린 급여 지급과 같은 행동을 수행하며, 평가자는 시뮬레이터 내에서의 그 결과에 따라 각 행동을 점수화합니다. 모든 태스크는 웨어하우스만을 사용하여 해결 가능함을 입증하는 실행 가능한 레퍼런스 솔루션을 가지고 있습니다. 14개의 최첨단(frontier) 및 오픈 가중치 모델 중 가장 강력한 모델은 단지 34.8%의 태스크에서 95점 이상을 기록했으며 평균 점수는 59.5점이었습니다. 우리는 Argo-Bench가 실제 데이터 환경 내에서 이해하고, 탐색하며, 행동하는 에이전트를 향한 진전을 이끌기를 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기