코딩 에이전트 벤치마크는 사용자의 작업 흐름을 반영해야 한다
요약
본 연구는 코딩 에이전트 평가는 실제 엔지니어의 작업 흐름을 반영해야 한다고 주장합니다. 4,782개의 프로덕션 세션을 분석한 결과, 사용자 요청은 질문, 계획, 검토 등 광범위하며 유형 간 전환이 빈번하여 단일 분포로는 현실적이지 않음을 밝혀냈습니다. 이에 따라 SWE-TaskFlow라는 새로운 접근 방식을 제시합니다.
핵심 포인트
- 코딩 에이전트 평가는 실제 엔지니어의 작업 흐름을 반영해야 합니다.
- 사용자 요청은 광범위하며, 유형 간 전환이 빈번한 장기 세션이 중요합니다.
- SWE-TaskFlow는 상호작용을 목표 작업 흐름으로 유도하는 새로운 접근 방식입니다.
- 상호작용 프로토콜 자체가 에이전트 평가의 중요한 차원임을 강조합니다.
코딩 에이전트의 평가는 일반적으로 가능한 한 현실적이어야 합니다. 저희 연구에서는 JetBrains IDE를 사용하는 실제 소프트웨어 엔지니어들의 4,782개 에이전트 세션을 수집했으며, 이를 프로덕션 세션(Production Sessions)이라고 부릅니다. 우리의 대상은 상호작용하는 에이전트이므로, 최소한 세 개의 사용자 메시지를 포함하는 세션을 연구했습니다 (샘플의 33%). 이러한 장기 세션은 이슈 기반 벤치마크 작업과 두 가지 면에서 다릅니다: (i) 사용자 요청이 프로젝트 코드에 대한 질문, 계획 수립, 검토, 리팩터링, 실행 등 훨씬 더 광범위한 작업 유형을 아우르며, (ii) 사용자가 세션 전반에 걸쳐 유형 간 전환을 합니다. 세 개의 공개 상호작용 코퍼스에서 가져온 장기 세션 샘플들은 현저하게 다른 작업 흐름(Task Flows)을 보여줍니다 (세션 길이, 작업 유형 및 유형 간 전환의 분포). 따라서 단일한 상호작용 분포가 보편적으로 현실적이지 않으며, 벤치마크는 특정 목표 사용 사례를 명시하고 그 측정값에 맞춰 조정되어야 합니다. 저희는 모든 이슈 기반 벤치마크를 변환하는 접근 방식인 SWE-TaskFlow를 제시합니다. 이는 프롬프트 분할(prompt splitting)과 검증 가능한 리포지토리 QA를 통해 검증된 작업과 테스트를 유지하면서 상호작용을 목표 작업 흐름으로 유도하며, 생성된 궤적들 중에서 선택하기 위한 TaskFlow Alignment Score (TFAS)를 사용합니다. 700개의 SWE-Bench Pro 작업을 대상으로 한 파일럿 테스트에서, 작업을 여러 단계에 걸쳐 순차적으로 해결하는 것은 해소율(resolve rate)의 안정적인 변화 없이 에이전트 비용을 약 두 배로 증가시킵니다: 상호작용 프로토콜 자체가 평가의 중요한 차원입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기