해결하기 전에 예측하기: 베이스 모델에서 파인튜닝된 코딩 에이전트의 성능 예측
요약
본 연구는 값비싼 에이전트적 후속 훈련에 앞서, 어떤 베이스 체크포인트가 코딩 에이전트로 활용될 가치가 있는지 예측하는 새로운 방법을 제시합니다. 기존의 end-to-end 평가는 다단계 상호작용 중 발생하는 도구 호출 실패를 포착하지 못한다는 한계가 있습니다. 이를 극복하기 위해, 성공적인 에이전트 궤적을 베이스 모델 잠재력의 선행 지표로 활용하는 세 가지 평가 프레임워크(Decisive-Action BPB, Patch MCQ, prefix-conditioned pass@$K$)를 개발했습니다.
핵심 포인트
- 에이전트 코딩은 단순한 end-to-end 테스트로는 성능 예측이 어렵습니다.
- 제안된 방법은 성공적인 에이전트 궤적을 베이스 모델의 잠재력 지표로 사용합니다.
- 세 가지 새로운 평가 프레임워크는 실제 SWE-bench와 유사하게 높은 순위 매김 능력을 보였습니다.
- 본 방법론은 미래의 에이전트 코딩 벤치마크 구축에 적용 가능합니다.
어떤 베이스 체크포인트가 값비싼 에이전트적(agentic) 후속 훈련을 받을 가치가 있는지 어떻게 예측할 수 있을까요? end-to-end pass@$K$는 성공적인 행동이 이미 베이스 모델의 분포에 나타나는지 테스트하지만, 이는 에이전트적 코딩에는 적합하지 않습니다. 많은 베이스 체크포인트가 작업을 end-to-end로 완료하는 데 필요한 잘 구성된 도구 호출(tool invocation)을 신뢰성 있게 생성할 수 없기 때문입니다. 단일 샷 또는 짧은 범위의 작업은 다단계 상호작용을 고정된 프롬프트와 단일 패치로 압축하여 이러한 도구 호출 실패를 피하지만, 우리가 중요하게 생각하는 핵심 능력, 즉 리포지토리가 발전함에 따라 많은 도구를 사용하는 단계 동안 일관된 상태(coherent state)를 유지하는 것을 우회합니다. 이 격차를 해소하기 위해, 우리는 성공적인 후속 훈련 에이전트 궤적을 베이스 모델 잠재력의 선행 지표로 간주합니다. 각 궤적을 재현하고 코드 변경 단계마다 테스트를 다시 실행함으로써 결정적인 단계를 식별합니다: 누적 패치가 리포지토리를 실패에서 성공으로 바꾸는 첫 번째 단계이며, 이는 기록된 행동이 이전 컨텍스트가 주어졌을 때 작업을 해결함을 인증합니다. 에이전트적 트레이스에 대한 커버리지 원칙(coverage principle)에 동기 부여되어, 우리는 이 단계에서 베이스 체크포인트가 콜드 스타트부터 하니스를 구동하는 데 필요하지 않은 세 가지 화면을 구축했습니다: (i) Decisive-Action BPB (bits per byte)는 인증된 행동에 대한 확률 질량(probability mass)을 측정하고, (ii) Patch MCQ는 해당 행동과 동일한 검증기(verifier)가 거부한 대안들 사이에서 체크포인트의 선택을 테스트하며, (iii) prefix-conditioned pass@$K$는 기능적으로 올바른 생성에 대한 지원을 평가하고 테스트가 수락하는 모든 연속성을 인정합니다. 열 쌍의 공개 베이스 및 후속 훈련 모델에 걸쳐, 세 가지 화면 모두 코호트(cohort)를 post-trained SWE-bench Verified pass@$1$과 근접하게 순위 매겼습니다. 우리의 방법은 단지 벤치마크의 성공적인 궤적과 그 검증기만 필요로 하므로, 미래의 에이전트적 코딩 벤치마크를 베이스 모델 평가로 전환하는 데 적용될 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기