동일한 실행에도 다른 결과가 나오는 AI 코딩 에이전트 벤치마킹 (Open-Weight 모델 기반)
요약
본 연구는 코딩 에이전트를 반복 실행했을 때 벤치마크 점수가 크게 변동하는 현상을 분석했습니다. 동일한 과제를 여러 번 수행해도 결과의 신뢰성이 낮아, 단순히 몇 번의 시도로 에이전트 순위를 매기기 어렵다는 결론을 내렸습니다. 따라서 에이전트는 규정 준수 여부를 포함하여 조합으로 평가되어야 합니다.
핵심 포인트
- 에이전트 코딩 성능은 반복 실행 시 높은 변동성을 보임.
- 신뢰성 있는 비교를 위해서는 수십~백 회 이상의 반복 실험 필요.
- 최적의 결과는 단순히 점수가 아닌 규정 준수 여부를 고려해야 함.
- 모델 간 비용 차이는 주로 프롬프트 캐시 사용량에서 발생함.
같은 코딩 에이전트를 반복해서 실행해도 서로 다른 벤치마크 점수가 나오는 것으로 알려져 있습니다. 우리는 이 변동성이 한 팀이 자체 과제에 에이전트를 적용할 때 어떤 의미를 갖는지 알아보기 위해, 하나의 머신러닝 과제를 집중적으로 복제했습니다. 즉, 항공 지연을 위한 XGBoost 분류기 훈련 코드를 에이전트가 개선했고, 이를 에이전트가 한 번도 보지 못한 홀드아웃 데이터로 점수를 측정했습니다. 총 584회의 실행에 걸쳐, 우리는 여섯 개의 오픈-웨이트 모델 엔드포인트에서 여섯 개의 에이전트를 비교했으며, 고정된 설정 하에 여섯 가지 에이전트-모델 조합을 각각 52번 실행했고, 그중 세 가지는 같은 계열의 더 큰 모델로 반복했습니다. 하나의 조합에 대한 동일한 실행들이 서로 다른 조합들 간의 차이보다 더 많이 변동하여, 몇 번의 실행만으로는 순위를 매기기에 신뢰성이 떨어졌습니다. 우리가 관찰한 에이전트 간의 차이를 해결하려면 각 경우 최소 수십 회에서 백 회 이상의 반복이 필요했습니다. 더 큰 모델에서의 실행은 분명히 더 높은 점수를 기록했지만, 그 차이는 한 번의 실행 대비 표준 편차보다 작았고, 이 격차는 다른 조합들에 비해 특정 에이전트와 비교했을 때 두 배 이상 컸습니다. 20번 중 1회 미만에서 과제의 데이터 규칙을 위반하는 경우가 있었지만, 그러한 실행들이 가장 높은 점수를 기록했습니다. 이러한 실행들을 먼저 거부하고 몇 번의 시도 중에서 가장 규정을 준수한 최적의 결과를 유지하는 것이 전달된 모델을 신뢰성 있게 개선했지만, 몇 번의 실행만으로는 에이전트들의 순위를 매길 수 없었습니다. 나중 연도의 항공편에 대해서는, 전달된 모델들이 초기 코드 대비 얻은 이득의 3분의 1만을 유지했습니다. 최소 가격 기준으로 볼 때, 동일한 모델에서 두 에이전트 간의 비용 차이는 주로 프롬프트 캐시를 통해 20배 이상 발생했습니다. 에이전트와 모델은 품질과 함께 규정 준수 여부를 보고하며, 반복적인 시도에 걸쳐 조합으로 평가되어야 합니다. 데이터, 코드 및 전달된 모든 프로그램: https://github.com/earino/identical-runs-different-results
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기