AgentBug-Smith: 에이전트 시스템의 실제 환경 하네스 버그 자동 재현
요약
본 연구는 오픈소스 에이전트 시스템의 실제 환경 하네스 버그를 지속적으로 발견하고 재현하는 자동화된 접근 방식인 AgentBug-Smith를 제시합니다. 이를 통해 200개의 재현 가능한 하네스 버그를 포함하는 Live-Harness-Bench라는 확장 가능한 벤치마크를 구축했습니다. 이 벤치마크는 에이전트의 실제 문제 해결 능력을 평가하고, 복구 기술을 증류하여 에이전트를 개선하는 데 활용될 수 있습니다.
핵심 포인트
- AgentBug-Smith: 실제 환경 하네스 버그 자동 재현 접근 방식 제시
- Live-Harness-Bench 구축: 200개의 재현 가능한 하네스 버그 포함
- 에이전트 평가 및 개선 기반 마련: 에이전트의 실질적인 문제 해결 능력 측정 가능
- 재귀적 자가 개선(recursively self-improving) 에이전트에 기여하는 확장성 확보
에이전트 하네스 버그는 고유한 특성을 보이며, 최첨단 소프트웨어 에이전트가 수리하기 어려운 난제로 남아 있습니다. 이 분야의 발전은 기존 벤치마크들 때문에 더욱 방해를 받는데, 이 벤치마크들은 실행 가능한 하네스 버그를 소수만 고정적으로 포함하고 있으며, 이를 구축하는 데 수백 시간의 인력이 필요합니다. 본 연구는 오픈소스 에이전트 시스템에서 실제 환경의 하네스 버그를 지속적으로 발견하고 재현하는 자동화된 하네스 버그 재현 접근 방식인 AgentBug-Smith를 제시합니다. 다양한 백본 LLM(LLMs)을 통해, AgentBug-Smith는 일반 소프트웨어에 대해 설계된 기존 버그 재현 기술들보다 일관되게 우수한 성능을 보여주며, 하네스 버그 재현 성공률에서 10.67% ~ 27.56% 높은 수치를 달성했습니다. 우리는 AgentBug-Smith를 실제 환경의 오픈소스 에이전트 시스템에 적용하여 Live-Harness-Bench를 구축했습니다. 이는 현재 200개의 재현 가능한 하네스 버그를 포함하는 살아있고 확장 가능한(live and extensible) 벤치마크입니다. 나아가, 우리는 두 가지 다운스트림 애플리케이션을 통해 Live-Harness-Bench의 유용성을 입증합니다. 첫째, Live-Harness-Bench를 평가 벤치마크로 사용하여 최첨단 소프트웨어 에이전트들을 체계적으로 평가하고, 이들이 실제 환경 하네스 버그를 수리하는 데 있어 제한적인 능력을 가지고 있음을 밝혀냈습니다. 둘째, Live-Harness-Bench를 실제 환경 하네스 버그 수정 지식 기반으로 사용하여, 재사용 가능한(reusable) 복구 기술을 증류해 기존 소프트웨어 에이전트를 개선할 수 있으며, 이를 통해 하네스 버그 수리율을 6.32% 증가시켰습니다. 종합적으로, AgentBug-Smith와 Live-Harness-Bench는 하네스 버그 수리에 대해 소프트웨어 에이전트를 지속적으로 평가하고 개선하기 위한 확장 가능한 기반을 마련하며, 실제 환경의 에이전트 실패 사례를 실행 가능한 평가 인스턴스와 하네스 개선을 위한 재사용 가능한 지식으로 전환함으로써, 궁극적인 목표인 재귀적 자가 개선(recursively self-improving) 에이전트에 기여합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기