GDPevo: 실제 비즈니스 태스크에서의 에이전트 자기 진화 (Agent Self-Evolution) 평가
요약
에이전트의 자기 진화(Self-Evolution) 능력을 평가하기 위한 새로운 벤치마크인 GDPevo를 제안합니다. 기업 워크플로우를 기반으로 자동화된 데이터 파이프라인을 통해 데이터 오염 문제를 해결하고, 실제 비즈니스 태스크에서의 성능 향상을 정밀하게 측정합니다.
핵심 포인트
- 에이전트 자기 진화 평가를 위한 GDPevo 벤치마크 공개
- 기업 워크플로우 기반의 자동화된 데이터 생성 파이프라인 구축
- 규칙 하이브리드화 메커니즘을 통한 데이터 오염 방지
- 자기 진화가 홀드아웃 정확도를 최대 16.44%p 향상시킴을 입증
에이전트 자기 진화 (Agent self-evolution)는 이전 경험으로부터 에이전트의 지속적인 상태 (persistent state)를 업데이트하고, 이를 재사용하여 관련 태스크를 더욱 효과적으로 해결합니다. 자기 진화를 평가하는 것은 어렵습니다. 기존의 벤치마크 (benchmarks)는 경제적 가치가 있는 태스크 도메인을 제한적으로 다루며, 테스트 시점의 이득 (test-time gains)이 훈련 경험에 기인하도록 훈련 및 테스트 태스크를 항상 설계하지는 않으며, 데이터 오염 (data contamination)에 취약한 상태로 남아 있습니다. 우리는 GDP 관련 기업 워크플로우 (enterprise workflows)에 기반한 진화 네이티브 벤치마크인 GDPevo와 이를 생성하는 완전 자동화된 데이터 파이프라인 (data pipeline)을 제시합니다. 핵심 메커니즘인 규칙 하이브리드화 (rule hybridization)는 각 기업 워크플로우를 원자적 비즈니스 규칙 (atomic business rules)으로 분해하고, 이러한 규칙의 하위 집합을 훈련 태스크에 분산시킨 후, 테스트 시점의 이득을 귀속시킬 수 있도록 홀드아웃 테스트 태스크 (held-out test tasks)에서 이를 재결합합니다. GDPevo는 CRM, ERP, 금융, 의료, 법률 및 데이터 중심 워크플로우를 아우릅니다. V1 릴리스에는 12개 그룹의 120개 태스크가 포함되어 있으며, 그룹당 5개의 훈련 태스크와 5개의 홀드아웃 테스트 태스크가 포함됩니다. 완전 자동화를 통해 파이프라인은 이 제품군을 이틀 내에 24개 그룹의 240개 태스크(V2)로 확장할 수 있어, 오염 문제에 대한 실질적인 대응을 제공합니다. GDPevo를 사용하여, 우리는 네 가지 감독 유형 (supervision types) 하에서 하네스 (harness)와 모델로 구성된 네 가지 에이전트를 평가합니다. 자기 진화는 홀드아웃 정확도 (held-out accuracy)를 최대 16.44 퍼센트 포인트까지 일관되게 향상시킵니다. 그러나 가장 잘 진화된 에이전트들도 완전한 정보를 가진 오라클 천장 (oracle ceiling)인 91.6%에는 훨씬 못 미치며, 이는 현재 에이전트의 자기 진화 능력이 아직 완전히 실현되지 않았음을 나타냅니다. 우리는 파이프라인, 벤치마크 및 전체 평가 결과를 https://github.com/Prism-Shadow/GDPevo 에서 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기