E2E-SWE: 처음부터 작동하는 코드베이스 구축에 대한 LLM 벤치마킹
요약
본 글은 LLM 기반 코딩 에이전트가 완전하고 기능적인 소프트웨어 저장소를 처음부터 끝까지 구축할 수 있는지 평가하는 새로운 벤치마크인 E2E-SWE를 소개합니다. 이 벤치마크는 11개 언어에 걸쳐 186개의 과제를 포함하며, 에이전트가 자연어 명세만으로 작동 가능한 프로젝트를 구현하도록 요구합니다. 테스트 결과, 최첨단 모델 간의 종단 간 저장소 생성 능력에서 큰 편차가 관찰되었습니다.
핵심 포인트
- E2E-SWE는 LLM 코딩 에이전트의 완전한 저장소 구축 능력을 평가하는 벤치마크입니다.
- 186개의 과제와 11개 언어를 포괄하며, 시스템 수준 추론을 요구합니다.
- 최신 모델들의 pass@1 점수 편차가 커서 모델 간 성능 차별화가 명확합니다.
- 성공적인 코드베이스 구축에는 장기적이고 계획적인 추론 능력이 중요함을 시사합니다.
대규모 언어 모델(LLMs) 기반의 코딩 에이전트는 국소적인 코드 변경을 하는 것에서 완전한 소프트웨어 저장소를 개발하는 단계로 진화하고 있습니다. 하지만, 저장소 규모의 생성을 평가하는 것은 여전히 어렵습니다. 과제는 시스템 수준의 추론을 요구해야 하며, 모든 평가된 동작은 정확하게 명시되고 특정 구현에 독립적이어야 합니다. 우리는 코딩 에이전트가 완전하고 기능적인 소프트웨어 저장소를 종단 간(end to end)으로 구축할 수 있는지 평가하기 위한 벤치마크인 E2E-SWE를 소개합니다. E2E-SWE는 11개 프로그래밍 언어에 걸쳐 186개의 전체 저장소 생성 과제를 포함하고 있습니다. 자연어 명세와 빈 작업 공간만을 주어진 상태에서, 에이전트는 포괄적인 숨겨진 테스트를 만족시키는 완전하고 설치 가능한 프로젝트를 구현해야 합니다. 각 과제는 소프트웨어 엔지니어가 LLM과 협력하여 구성하며, 함께 테스트 스위트와 이에 상응하는 구현 독립적 명세를 개발합니다. 과제가 잘 명시되었고 실제로 해결 가능하도록 보장하기 위해, 우리는 이들을 자체 에이전트가 정적 검사 및 실제 모델 롤아웃에서 관찰된 실패를 사용하여 과제 결함을 감사하고 수정하는 반복적인 검증 과정에 추가로 거칩니다. 13개의 최첨단 모델을 평가한 결과, 종단 간 저장소 생성 능력에 상당한 편차가 있으며, pass@1은 11.7%에서 67.7%까지 범위가 나타나 강력한 모델 차별화를 제공하는 동시에 향후 발전을 위한 상당한 여지를 남깁니다. 에이전트 궤적 분석은 또한 길고 초기에 집중된 추론 패턴을 밝혀내어, 처음부터 작동하는 코드베이스를 구축하는 데 필요한 계획 및 시스템 수준의 추론을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기