Scrouting: 저장소를 먼저 탐색하여 코딩 에이전트의 비용 효율적인 라우팅 수행
요약
저장소를 먼저 탐색하여 코딩 에이전트의 비용 효율적인 라우팅을 수행하는 SuperScout 프레임워크를 제안합니다. 7B 규모의 탐색기가 저장소를 분석하고 구조화된 핸드오프를 생성하여, 최적의 모델로 작업을 배정함으로써 비용을 획기적으로 절감합니다.
핵심 포인트
- 저장소 탐색 후 라우팅을 수행하여 비용 효율성 극대화
- 최상위 모델과 유사한 성능을 유지하며 비용은 약 1/5 수준으로 절감
- 구조화된 핸드오프를 통해 모델 간 작업 재분배 및 성능 최적화
- 새로운 해결사 추가 시 별도의 재학습이 필요 없는 구조
프런티어 언어 모델(Frontier language models)은 저장소 수준(repository-level)의 소프트웨어 문제를 해결할 수 있지만, 각 시도는 비용이 많이 들며, 기존의 라우터(routers)는 이슈 텍스트만으로 모델을 선택합니다. 우리는 저장소를 먼저 탐색(scouting)한 후 라우팅을 수행하는 SuperScout를 제안합니다. 7B 규모의 탐색기(searcher)인 SuperScout-7B가 먼저 저장소를 탐색하고, 재현 주장(reproduction claims)이 샌드박스(sandbox)에서 검증되며 전달 전 허위 주장이 제거된 구조화된 핸드오프(handoff)를 생성합니다. 그 후 탐색기의 은닉 상태(hidden states)를 작업 텍스트와 함께 재개 기반 라우터(resume-based router)에 입력하여, 작업을 네 가지 프런티어 해결사(frontier fixers) 중 하나로 배정합니다. 새로운 해결사를 추가할 때 재학습은 필요하지 않습니다. 벤치마크의 공식 제한 예산 계층(capped budget tier) 하에서 SWE-bench Pro의 전체 Python 슬라이스(266개 작업)를 대상으로 테스트했을 때, SuperScout는 최상의 단일 모델의 해결률(266개 중 SuperScout 159개, 최상 모델 158개)과 맞먹으면서도 해결당 총 비용은 약 5분의 1 수준입니다. 보고된 설정은 무작위 트래픽 분할(random traffic-splitting) 베이스라인보다 높은 성능을 보입니다. 라우터가 없는 절제 연구(ablation)로서 핸드오프와 함께 항상 가장 저렴한 해결사를 사용하는 경우, 이 벤치마크에서 라우팅된 시스템과 동일한 성능을 보였으며, 이는 라우팅 결정보다는 핸드오프 자체가 결과에 기여함을 의미합니다. 쌍을 이룬 보정 연구(paired calibration study)는 그 메커니즘을 지적합니다. 핸드오프는 해결 능력을 추가하기보다는 재분배하는 것으로 보이며, 가장 강력한 모델의 성능은 약간 저하시키는 반면 세 개의 더 저렴한 해결사 성능은 향상시킵니다. 다만 $N=99$일 때 해결사별 효과는 방향성만 나타납니다. 탐색기의 은닉 상태는 보정 레이블(calibration labels)에서 비용 효율적인 라우팅을 개선하지만, 핸드오프 자체의 텍스트는 그렇지 않습니다. 탐색기의 연산 비용은 작업당 GPU 시간으로 0.5센트 미만입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기