FC-SWE: 장기 지평 소프트웨어 엔지니어링 에이전트를 위한 실패 조건부 강화학습 (RL)
요약
본 논문은 소프트웨어 엔지니어링 에이전트(SWE)를 위한 실패 조건부 강화학습 프레임워크인 FC-SWE를 제안합니다. 기존 RL 방법론의 한계점인 실패 패치에서 얻는 진단 정보를 재사용하지 못하는 문제를 해결했습니다. FC-SWE는 실패 시 저장소를 복원하고, 실패한 패치와 검증기 피드백을 회복 궤적 컨텍스트로 활용하여 SWE 성능을 향상시킵니다.
핵심 포인트
- FC-SWE는 실패 조건부 RL 프레임워크를 도입했습니다.
- 실패한 패치의 진단 정보를 후속 시도에 재사용합니다.
- 회복 궤적 학습을 위해 두 가지 메커니즘을 조정했습니다.
- SWE-bench 작업에서 기존 방법 대비 높은 성능을 입증했습니다.
저장소 수준의 소프트웨어 엔지니어링(SWE)은 도전적인 장기 지평 설정입니다. 에이전트는 확장된 상호작용을 추론하고, 도구를 사용하며, 상태를 갖는 환경에 적응해야 합니다. 최근 연구들은 Group Relative Policy Optimization (GRPO)과 같은 강화학습(RL) 방법을 사용하여 SWE 에이전트를 훈련시킵니다. 이 방법은 이슈당 여러 궤적을 독립적으로 샘플링하고, 결과로 나온 패치를 테스트하며, 고정된 그룹 내에서 최종 보상을 비교합니다. 하지만 이러한 훈련 설정은 실패한 패치로부터 얻은 검증기(verifier)의 피드백을 후속 시도의 컨텍스트로 재사용하지 못하는데, 이 피드백에는 무엇이 잘못되었는지에 대한 귀중한 진단 정보가 포함되어 있습니다. 회복 궤적(recovery trajectories)으로 훈련하는 것은 어렵습니다. 왜냐하면 선행 결과가 다음 궤적이 생성될지 여부를 결정하고, 실패한 실행은 그 조건부 컨텍스트를 결정하기 때문입니다. 우리는 정책 훈련에 회복 시도를 통합하는 실패 조건부 RL 프레임워크인 FC-SWE를 소개합니다. 패치가 검증에 실패하면, FC-SWE는 저장소를 원래의 작업 상태로 복원하고, 실패한 패치와 검증기 피드백을 회복 궤적의 컨텍스트로 사용합니다. FC-SWE는 두 가지 메커니즘을 통해 GRPO를 이러한 완전하고 다중 턴 도구 사용 궤적 체인에 맞게 조정합니다. 궤적별 보상(Trajectory-local rewards)은 각 시도의 검증기 결과를 보존하여, 회복 성공이 이전 실패한 패치를 보상하는 것을 방지합니다. 능동 집합 우위 추정(Active-set advantage estimation)은 동일한 이슈에 대해 실제로 실행된 모든 초기 및 회복 궤적들로 비교 그룹을 형성하므로, 실패한 시도는 그룹 내에 남아있고 미실행된 시도는 제외됩니다. 검증기 지원 프로토콜 하의 500개 SWE-bench Verified 작업에서, FC-SWE는 Qwen3.5-4B와 SWE-agent를 사용하여 GRPO가 달성한 38.9% 및 48.5%에 비해 각각 41.7%의 Resolved@1과 52.8%의 Resolved@2를 달성했습니다. 비록 체인당 최대 두 번의 시도로 훈련되었음에도 불구하고, FC-SWE는 11번의 시도 예산(test-time budget) 하에서 70.7%의 Resolved@11에 도달합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기