CalibForge: 학습 가능한 터미널 태스크를 위한 적대적 솔버 보정
요약
CalibForge는 터미널 에이전트 훈련을 위해 학습에 적합한 도전적인 태스크를 자동으로 합성하는 시스템입니다. 적대적 솔버 보정 기술을 통해 솔버 간의 불일치나 특정 통과/실패 관계를 활용하여 고품질의 학습 데이터를 생성합니다.
핵심 포인트
- 적대적 솔버 보정을 통한 자율적 터미널 태스크 합성 시스템 제시
- 다중 솔버 및 대조적 솔버 보정 전략을 통한 학습 영역 최적화
- Terminal-Bench 2.0 및 SWE-bench Pro 등 주요 벤치마크 성능 대폭 향상
- 솔버 상대 학습성이 효과적인 에이전트 훈련 데이터 구축의 핵심임을 입증
터미널 에이전트 훈련에는 단순히 해결 가능할 뿐만 아니라, 학습에 적절하게 도전적인 실행 가능하고 검증 가능한 태스크가 필요합니다. 실행 가능한 검증은 실현 가능성을 확립하지만, 주어진 솔버 설정과 관련하여 태스크가 어떻게 작동하는지를 알려주지는 못합니다. 본 논문에서는 CalibForge를 제시합니다. 이는 검증된 솔버 동작을 사용하여 적대적 솔버 보정(adversarial solver calibration)을 통해 후보 태스크를 수정하는 자율적인 터미널 태스크 합성 시스템입니다. 다중 솔버 보정(Multi-solver calibration)은 이질적인 솔버 풀 내의 불일치(disagreement)를 목표로 하는 반면, 대조적 솔버 보정(contrastive solver calibration)은 지정된 강한 통과/약한 실패 관계(strong-pass/weak-fail relation)를 목표로 합니다. 두 방식 모두 입증된 해결 가능성에 기반을 둔 솔버 상대 학습 영역(solver-relative learnable zone)을 작동화합니다. CalibForge를 사용하여, 우리는 5,431개의 보정된 터미널 태스크를 구성했습니다. 우리의 제거 연구(ablations)는 두 전략 모두 작성 및 검증만 하거나 일반적인 단일 솔버 피드백보다 더 효과적인 지도 학습을 제공함을 보여줍니다. 전체 컬렉션으로 훈련된 모델은 Terminal-Bench 2.0에서 각각 32.58%와 47.57%를 달성했습니다. 해당 기본 모델 대비 가장 큰 향상은 Terminal-Bench 2.0에서 24.71 퍼센트 포인트, SWE-bench Pro에서 27.68 포인트, Doc2Repo에서 30.04 포인트를 기록했습니다. 종합적으로 이러한 결과는 솔버 상대 학습성(solver-relative learnability)이 효과적이고 전이 가능한 에이전트 훈련 데이터를 구축하기 위한 실용적인 목표임을 뒷받침합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기