CheckerBench: 장기 지평선 에이전트가 정적 분석 체커를 합성할 수 있는가?
요약
CheckerBench라는 새로운 벤치마크를 소개하며, 이는 에이전트가 실제 저장소에서 작동하는 정적 분석 체커를 처음부터 끝까지 개발할 수 있는지 평가합니다. 이 벤치마크는 297개의 CVE 기반 작업으로 구성되어 있으며, 공통 평가 프레임워크인 CheckerLab도 함께 제공됩니다. 실험 결과, 현재 코딩 에이전트의 평균 Pass@1은 32.30%에 그쳐 신뢰성 있는 체커 개발이 여전히 어려운 과제임을 보여줍니다.
핵심 포인트
- CheckerBench는 297개의 CVE 기반 작업으로 구성된 실용적인 벤치마크입니다.
- 체커Lab이라는 공통 평가 프레임워크를 통해 성능을 다각도로 측정합니다.
- 현재 코딩 에이전트의 체커 개발 능력은 평균 Pass@1이 32.30%에 머물러 제한적입니다.
정적 분석 체커(Static-analysis checker) 합성은 에이전트가 결함 사양을 해석하고, 저장소를 검사하며, 분석기별 로직을 구현하고, 반복적인 컴파일 및 분석 피드백을 통해 체커를 개선해야 합니다. 기존의 코딩 에이전트 벤치마크는 패치 생성이나 취약점 탐지 같은 작업에 초점을 맞추고 있어, 에이전트가 저장소에서 작동하는 체커를 처음부터 끝까지 개발할 수 있는지 평가하는 경우는 드뭅니다. 우리는 167개 저장소, 85개 CWE(Common Weakness Enumeration), 그리고 다섯 가지 언어 생태계에 걸쳐 297개의 CVE(Common Vulnerabilities and Exposures)에서 파생된 300개 작업으로 구성된 실행 가능한 벤치마크인 CheckerBench를 소개합니다. 각 작업에는 취약한 버전과 수정된 버전, 고정된 분석 환경, 그리고 체커 스캐폴드(checker scaffold)가 포함되어 있습니다. 또한, 우리는 제출된 체커를 독립적으로 재구축하고 취약-수정 진단 대비(vulnerable-fixed diagnostic contrast), 패치 위치 특정화(patch localization), 오탐지율(false positives), 도구 사용을 측정하는 공통 평가 프레임워크인 CheckerLab도 소개합니다. 21가지 모델-하네스 구성과 각 구성당 세 번의 독립적인 반복에 걸쳐, 평균 Pass@1은 32.30%이며, 최고 기록은 45.33%에 달했습니다. 이러한 결과는 신뢰할 수 있고 재사용 가능한 체커 개발이 현재 코딩 에이전트에게 여전히 어려운 과제임을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기