사무 업무 기반의 사후 학습(Post-Training)이 소프트웨어 엔지니어링 능력을 향상시킨다: 교차 도메인 전이에 대한 행동적 설명
요약
사무 업무 기반의 장기적 사후 학습(Post-Training)이 소프트웨어 엔지니어링 능력을 향상시킨다는 연구 결과입니다. Qwen3.5 모델을 사무 워크플로우로 학습시킨 결과, 소프트웨어 관련 과업이 아님에도 SWE-Bench Pro 점수가 향상되었습니다.
핵심 포인트
- 사무 업무 기반 사후 학습이 소프트웨어 엔지니어링 능력으로 전이됨
- 목표 지향적 실행(GDE)의 네 가지 핵심 행동이 도메인 전반에서 강화됨
- Qwen3.5-122B-A10B 모델의 SWE-Bench Pro 점수 5.8포인트 향상
- 장기적 과업 수행 시 지식 조직 및 적용 방식의 변화 확인
장기적 과업(Long-horizon tasks)은 에이전트가 중첩되고 분기되는 작업 전반에 걸쳐 일관된 상태와 목표를 유지할 것을 요구합니다. 우리는 이러한 능력을 목표 지향적 실행(goal-directed execution, GDE)이라고 부릅니다. 이는 네 가지 행동, 즉 목표 선택, 작업 관련 상태 구축, 상위 수준 목표에 대한 충실도 유지, 그리고 환경에 대한 완료 검증의 반복적인 적용을 의미합니다. 우리는 장기적 사후 학습(long-horizon post-training)이 도메인을 넘어 이러한 행동들을 강화한다고 가설을 세웠습니다. 우리는 사무 워크플로우에서 추출한 363개의 장기적 멀티-툴 에이전트(Long-Horizon Multi-Tool Agent, LHMTA) 과업을 통해 Qwen3.5-122B-A10B를 사후 학습시킴으로써 이를 테스트했습니다. 이 컬렉션에는 소프트웨어 엔지니어링 과업이 포함되지 않았음에도 불구하고, 모델의 SWE-Bench Pro pass@1 점수가 5.8포인트 향상되었습니다. 일치하는 궤적 분석(Matched trajectory analysis) 결과, 사무 워크플로우와 소프트웨어 저장소(repository) 모두에서 네 가지 GDE 행동 모두가 향상되었음을 보여줍니다. 종합적인 SWE-Bench Pro 통계는 정보 수집, 구현 및 검증에서의 관련 변화를 보여주었습니다. 종합적으로, 이러한 결과는 장기적 사후 학습이 모델이 과업 전반에 걸쳐 지식을 조직하고 적용하는 방식을 변화시켰으며, 그 효과가 훈련 도메인을 넘어 확장된다는 행동적 해석을 뒷받침합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기