결과를 넘어: 효율적인 에이전트 벤치마킹을 위한 이중 관점 관계 학습
요약
본 논문은 높은 평가 비용 때문에 발생하는 에이전트 벤치마크의 비효율성을 해결하기 위해 DualViewEval을 제안했습니다. 이 방법은 최종 결과(outcome)와 프로세스 관계를 결합하여 학습함으로써, 전체 성능을 예측하는 최소한의 태스크 집합을 찾아냅니다. 이를 통해 에이전트 모델 개발에 필요한 진단적이고 효율적인 피드백을 제공합니다.
핵심 포인트
- DualViewEval은 결과와 프로세스 관계를 결합하여 벤치마크 압축을 수행합니다.
- 최소한의 태스크만으로도 높은 정확도의 성능 예측이 가능함을 입증했습니다.
- 에이전트 모델 개발 시 효율적이고 진단적인 피드백을 제공하는 것이 핵심입니다.
에이전트 벤치마크는 기존 LLM 벤치마크보다 평가 비용이 훨씬 많이 듭니다. 따라서 벤치마크 압축은 자연스러운 해결책이지만, 기존 방법들은 주로 태스크-모델 최종 점수 분포에서의 중복성을 모델링합니다. 이는 에이전트 평가에서 중요합니다. 이러한 한계를 해결하기 위해, 우리는 대규모 트래젝토리를 분석하고 최종 에이전트 성능과 체계적으로 연관된 여섯 가지 보완적인 프로세스 신호를 식별했습니다. 에이전트 성능의 중복성을 완전한 관점에서 분리하기 위해, 우리는 DualViewEval을 제안합니다. 이는 결과(outcome)와 프로세스 관계를 결합하여 활용함으로써 정확한 크기의 최소집합(miniset)을 학습하고 전체 벤치마크 점수를 예측하는 에이전트 벤치마크 압축 방법입니다. 다섯 가지 에이전트 벤치마크와 다섯 가지 대표적인 기준선(baseline)에 걸쳐, DualViewEval은 모든 데이터셋에서 최고의 결과를 달성했습니다. 단 20개의 태스크만으로 APEX-Agents와 BFCL에서 $24 imes$--$40 imes$ 압축을 달성했으며, SWE-bench Verified의 경우 가장 강력한 경쟁 모델 대비 평균 절대 오차(MAE)를 $14.5 ext{ extperthousand}$--$28.2 ext{ extperthousand}$ 감소시키고 Kendall's $ au$를 최대 $7.2 ext{ extperthousand}$까지 개선했습니다. 이렇게 선택된 최소집합은 다양한 에이전트 간의 역량 차이를 더욱 명확히 보여주어, 효율적인 에이전트 모델 개발을 위한 간결하고 진단적인 피드백을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기