PAIChecker: SWE-bench 유사 벤치마크에서의 PR-Issue 불일치 발견 및 검증
요약
SWE-bench 유사 벤치마크에서 PR과 이슈 간의 불일치 문제를 분석하고, 이를 검증하기 위한 멀티 에이전트 시스템인 PAIChecker를 제안합니다. 연구 결과, 벤치마크 인스턴스의 약 13.6%에서 불일치가 발견되었으며 PAIChecker는 높은 정확도로 이를 탐지합니다.
핵심 포인트
- SWE-bench 유사 벤치마크의 PR-Issue 불일치 패턴 발견
- 멀티 에이전트 기반의 검증 시스템 PAIChecker 제안
- 3단계 설계(패턴 식별, 레이블 합성, 코드 검증) 채택
- SWE-Gym 및 SWE-bench Multilingual에서 높은 탐지 성능 입증
SWE-bench 유사 벤치마크는 LLM(Large Language Model)의 이슈 해결 능력을 평가하기 위해 널리 사용됩니다. 이러한 벤치마크는 일반적으로 공통적인 구축 파이프라인을 따릅니다. 즉, PR(Pull Request) 설명에서 이슈 참조를 추출하여 각 PR을 연결된 이슈와 쌍으로 묶으며, 이슈 설명은 문제 정의(problem statement)로 사용되고 PR 패치(patch)는 테스트 오라클(test oracle) 역할을 합니다. 그러나 대규모 저장소(repository)를 개발하고 유지 관리하는 데 따르는 내재적인 복잡성으로 인해, 실제로는 이러한 PR-Issue 쌍이 불일치하는 경우가 빈번합니다. 본 연구에서는 SWE-bench Verified 인스턴스를 체계적으로 조사하여, 11개의 세분화된 시나리오 내 5가지 패턴에 걸쳐 13.6%가 불일치를 보인다는 것을 발견했습니다. 향후 이러한 벤치마크의 신뢰할 수 있고 확장 가능한 구축을 가능하게 하기 위해, 우리는 SWE-bench 유사 벤치마크에서 PR-Issue 불일치를 검증하기 위한 멀티 에이전트 시스템(multi-agent system)인 PAIChecker를 제안합니다. 구체적으로, PAIChecker는 특정 패턴 식별, 에이전트 간 레이블 합성(cross-agent label synthesis), 그리고 코드 수준의 검증을 결합한 3단계 설계를 채택하여, 더욱 정확하고 일반화 가능하며 점진적으로 검증된 탐지를 가능하게 합니다. SWE-Gym 및 SWE-bench Multilingual에 대한 실험 결과, PAIChecker는 4가지 LLM 백본(backbone) 모두에서 최고의 성능을 달성하였으며, 이진 정확도(binary accuracy) 측면에서 각각 최대 92.12%와 91.67%에 도달했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기