코딩 에이전트를 위한 전역적으로 재사용 가능한 기술 학습
요약
LLM 에이전트의 기술 진화 시 발생하는 과적합 문제를 해결하기 위해 전역적 기술 진화 프레임워크인 GSE를 제안합니다. GSE는 기술 관계 그래프(SRG)를 통해 기술 간 호환성을 유지하며, 클러스터 기반 통합을 통해 재사용 가능한 능력을 추상화합니다.
핵심 포인트
- GSE 프레임워크는 기술 간 관계를 모델링하여 전역적 최적화 수행
- 클러스터 기반 기술 통합으로 국소적 업데이트의 과적합 방지
- OpenHands 및 mini-SWE-agent에서 뛰어난 성능 향상 입증
- 소프트웨어 공학 작업(버그 발견, 필터링)에서 높은 정밀도와 재현율 달성
자동화된 기술 진화 (skill evolution)는 대규모 언어 모델 (LLM) 에이전트가 비용이 많이 드는 재학습 없이도 지속적으로 개선될 수 있게 합니다. 그러나 기존 방식들은 일반적으로 기술 진화를 일련의 국소적 업데이트 (local updates)로 취급하여, 기술 간의 관계를 간과하고 여러 작업에 걸쳐 일반화되지 못하는 과적합 (overfitted)된 기술 업데이트를 생성하는 경우가 많습니다. 우리는 기술 호환성 (skill compatibility)과 기술 일반화 (skill generalization)를 공동으로 최적화하는 전역적 기술 진화 프레임워크인 GSE를 제안합니다. 기술 뱅크 (skill bank) 전반의 일관성을 유지하기 위해, GSE는 기술 간 관계를 명시적으로 모델링하고 공동 진화시키는 기술 관계 그래프 (Skill Relation Graph, SRG)를 유지합니다. 일반화를 개선하기 위해, GSE는 클러스터 기반 기술 통합 (cluster-based skill consolidation)을 수행하여 국소적 업데이트로부터 재사용 가능한 능력을 추상화하며, 과적합과 행동 퇴행 (behavioral regressions)을 방지하기 위해 재생 기반 검증 (replay-driven verification)을 채택합니다. 우리는 두 가지 대표적인 소프트웨어 공학 작업인 버그 발견 테스트 생성 (bug-revealing test generation)과 오탐 버그 보고서 필터링 (false-positive bug report filtering)에서 GSE를 평가합니다. 두 가지 최첨단 코딩 에이전트인 OpenHands와 mini-SWE-agent에 대해, GSE는 일관되게 최고의 정밀도 (precision), 재현율 (recall), 그리고 F1-score를 달성합니다. 기존의 진화 기술과 비교했을 때, GSE는 테스트 생성의 경우 정밀도와 재현율을 각각 6.1%~34.1% 및 31.8%~180.0% 향상시켰으며, 오탐 필터링의 경우 15.4%~96.4% 및 13.1%~19.8% 향상시켰습니다. 내부 산업용 에이전트에 배포한 결과 F1-score가 61.4% 추가 향상되었으며, 이는 효과적인 기술을 진화시키는 데 있어 GSE의 효과성과 일반화 가능성을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기