APEX-Accounting
요약
Mercor와 Ramp가 협력하여 개발한 APEX-Accounting 벤치마크를 소개합니다. 이 벤치마크는 프론티어 모델이 계정 조정, 비용 발생 등 실제 회계 업무를 수행할 수 있는 능력을 평가합니다.
핵심 포인트
- 회계 전문가가 직접 설계한 160개의 복합적인 회계 작업 포함
- Claude-Fable-5 (Max)가 테스트 결과 가장 높은 성능 기록
- 토큰 예산 증가에 따른 성능 변화와 심슨의 역설 관찰
- 스프레드시트, PDF 등 다양한 파일 형식을 포함한 환경 제공
우리는 프론티어 모델(frontier models)이 회계사의 실제 업무를 수행할 수 있는지 평가하기 위해 Mercor가 Ramp와 협력하여 구축한 벤치마크인 APEX-Accounting을 소개합니다. 작업에는 계정 조정(reconciling accounts), 비용 발생(accruing expenses), 트랜잭션 전기(posting transactions) 및 보고서 생성(producing reports)이 포함됩니다. 비공개 평가 세트(private eval set)는 10개의 월드(worlds)로 나뉜 160개의 작업으로 구성됩니다. 각 월드에는 회계 시스템뿐만 아니라 스프레드시트, PDF 및 기타 파일이 포함되어 있습니다. 모든 작업은 회계 및 장부 기록 전문가들이 작성하고 해결하였으며, 이들은 채점 루브릭(grading rubrics)도 직접 작성했습니다. 9개의 프론티어 모델을 대상으로 테스트한 결과, Claude-Fable-5 (Max)가 56.4%의 Mean Criteria@3로 선두를 차지했으며, Muse-Spark-1.1 (xHigh)가 52.6%로 그 뒤를 이었습니다. 어떤 모델도 2.6% 이상의 Pass^8 (GPT-5.6-Sol (Max+Pro))을 기록하지 못했으며, 가장 높은 Pass@8은 21.5% (Muse-Spark-1.1 (xHigh))였습니다. 우리는 토큰 예산(token budget)을 $1에서 $50로 늘리는 실험을 진행하였으며, 심슨의 역설(Simpson's paradox) 사례를 관찰했습니다. 즉, 토큰 예산이 증가함에 따라 점수는 상승하지만, 주어진 예산 제한 하의 하네스(harness) 내에서는 모델이 더 많은 토큰을 사용하는 작업에서 점수가 더 낮게 나타납니다. APEX-Accounting은 폐쇄형 벤치마크이므로, 요청 시 모든 프론티어 모델에 대해 리더보드 평가(leaderboard evals)를 실행할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기