반사실적 롤아웃 리플레이: 소프트웨어 엔지니어링 에이전트를 위한 분기 가능한 환경을 무료 과정 보상으로 활용
요약
본 논문은 소프트웨어 엔지니어링(SWE) 에이전트의 훈련을 위한 새로운 방법론인 Counterfactual Rollout Replay (CRR)를 제안합니다. CRR은 분기 가능한 실행 환경을 활용하여 단계별 리턴 대비를 얻는 효율적인 훈련 시간 절차입니다. 이 방법은 인간 레이블이나 과정 보상 모델 없이도 SWE-bench 등에서 높은 성능 향상을 입증했습니다.
핵심 포인트
- CRR은 분기 가능한 환경으로 SWE 에이전트의 훈련을 개선합니다.
- 인간 감독이나 복잡한 과정 보상 모델이 필요 없어 비용 효율적입니다.
- SWE-bench Verified 테스트에서 기존 GRPO 대비 우수한 성능 향상을 보여주었습니다.
결과(Outcome)-전용 강화학습은 소프트웨어 엔지니어링(SWE) 에이전트에게 최종 성공 신호는 제공하지만, 중간 결정에 대한 직접적인 지침은 거의 제공하지 못합니다. 우리는 분기 가능한 실행 환경을 사용하여 단계별 리턴 대비를 얻는 훈련 시간 절차인 Counterfactual Rollout Replay (CRR)를 소개합니다. CRR은 소수의 결정 지점을 선택하고, 각 상태를 복원하며, 대안적인 행동을 샘플링하고, 정책 하에서 해당 브랜치를 전진합니다. 이는 실현된 훈련 궤적을 유지하고, 선택된 단계의 어드밴티지(advantage)를 최종 리턴과 샘플링된 반사실적 리턴 간의 차이로 대체합니다. 이 방법은 인간의 과정 레이블이나 학습된 과정 보상 모델이 필요하지 않습니다. 여기서 '무료(free)'는 재현(replay) 컴퓨팅 비용이 아닌, 감독(supervision) 비용을 의미합니다. 14B 정책으로 CRR은 SWE-bench Verified, SWE-bench Live, 그리고 SWE-rebench에서 pass@1 성능을 향상시키며, 과정 보상 및 궤적 검색 방법과 결합됩니다. SWE-bench Verified의 경우, 동일한 하드웨어에서 동등한 벽시계 시간 비교를 통해 확장된 결과 전용 GRPO(GRPO)가 36.7%인 것에 비해 41.7%를 달성하여, 분기 오버헤드를 포함하더라도 5.0포인트의 이득을 얻었습니다. 이러한 결과는 비용 효율적이고 신뢰할 수 있는 상태 복원이 가능한 환경에 적용되며, 확률론적 연속(stochastic continuations)과 비용이 많이 들거나 불완전한 리플레이가 여전히 한계로 남아 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기