SWE-Race: 188개의 실제 동시성 버그를 다룬 코딩 에이전트 벤치마크, 세 모델의 결과 공개
요약
SWE-Race는 100개 Python 프로젝트에서 수집한 실제 동시성 버그를 다루는 코딩 에이전트 벤치마크입니다. 이 벤치마크는 에이전트가 Git 히스토리 없이 단일 커밋 상태에서 문제를 해결하도록 설계되었습니다. GLM-5.3 Flash와 GPT-5.6 Luna 등 세 모델의 성능을 공개하며, 특히 어려운 태스크에서의 성능 차이를 분석했습니다.
핵심 포인트
- 실제 동시성 버그를 다루는 전문 벤치마크입니다.
- 에이전트가 Git 히스토리 없이 작업하도록 제한합니다.
- GLM-5.3 Flash와 GPT-5.6 Luna의 성능을 비교 공개했습니다.
- 모델들이 불필요한 네트워크 접근이나 반복적인 시도를 하는 경향을 분석했습니다.
저희는 약 100개의 Python 프로젝트에서 병합된 PR(Pull Request)을 통해 얻은 실제 동시성 버그(race conditions, deadlocks, cancellation issues)를 모아 벤치마크를 구축했습니다. 각 태스크는 네트워크 연결이 없는 컨테이너 내에서 해당 프로젝트 자체의 테스트로 평가되며, 에이전트가 git 히스토리로부터 수정 사항을 복구할 수 없도록 레포지토리는 단일 커밋으로 잘려 나갑니다.
https://preview.redd.it/0uopztlmpsth1.png?width=1200&format=png&auto=webp&s=59c0698ca0a76c17be41e41362324d6a262f1f25
몇 가지 발견 사항:
각 태스크당 한 번의 시도로 GLM-5.3 Flash는 85%를 기록했습니다. 두세 번의 시도에서는 82%를 기록했는데, 이는 GPT-5.6 Luna(81%)의 오차 범위 내에 있습니다.
https://preview.redd.it/9dqmk9uppsth1.png?width=1200&format=png&auto=webp&s=006cd587d11c03e47baf50c9954d95d937d09005
현재 리더보드에는 모든 점수에 대한 시도 횟수와 간격이 표시됩니다.
태스크의 절반 정도는 모든 모델에게 쉬워서(거의 100%) 통과합니다. 나머지 절반에서 실제로 차이가 발생하는데, 각각 50%, 45%, 23%를 기록했습니다. 모델 간의 가장 큰 차이는 이 어려운 부분에서 나옵니다.
모든 수정 사항이 GitHub에 공개되어 있어, 저희는 에이전트가 실행한 모든 11k개의 명령을 검토했습니다. 그중 69개는 네트워크 접근을 시도했지만 모두 실패했습니다. GLM은 자신이 수정하려던 라이브러리의 이미 수정된 버전을 pip 다운로드하려고 50번이나 시도했습니다.
저희는 또한 이전 버그(2026년 이전)와 유사한 크기의 최신 버그를 비교하여 오염 여부도 확인했습니다. 이전 버그가 약 9포인트 더 자주 해결되었지만, 신뢰 구간이 0을 가로지르기 때문에 아직 많은 것을 말할 수는 없습니다.
태스크의 절반은 비공개입니다. 현재까지는 세 모델 모두 공개 점수와 비공개 점수가 일치합니다.
결과 및 모든 에이전트 실행 내역: https://labs.evaligo.com/swe-race?utm_source=reddit&utm_medium=ml&utm_campaign=launch
태스크 목록: https://huggingface.co/datasets/evaligo/swe-race
프로토콜은 DeepSWE(100단계)를 따릅니다. 이에 대한 피드백과 다음에 어떤 모델을 실행할지에 대한 제안을 환영합니다.
제출자 /u/heyitsdannyle
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기