에이전트 리더보드의 측정 기반 감사: 오염 취약성, 매치드-컨트롤 재평가 및 스코어러 검증
요약
본 글은 에이전트 리더보드의 신뢰성을 높이기 위한 측정 기반 감사 프레임워크를 제안합니다. 이 프레임워크는 훈련 노출, 평가 검색, 파이프라인 누수 등 세 가지 채널을 분리하여 오염 여부를 체계적으로 검증합니다. GPT-4.1과 DeepSeek-V4-Flash 같은 모델들을 대상으로 테스트한 결과, 강력한 출처 증거와 통제 장치 없이는 오염 주장을 확정하기 어렵다는 결론을 내렸습니다.
핵심 포인트
- 오염 여부를 판단하는 측정 기반 감사 프레임워크를 제안함.
- 훈련 노출, 평가 검색, 파이프라인 누수 3가지 채널로 분리하여 분석.
- GPT-4.1과 DeepSeek-V4-Flash 테스트 결과, 오염 주장은 신중해야 함.
- 강력한 출처 증거와 통제 장치 없이는 점수 인플레이션을 확정할 수 없음.
에이전트 리더보드는 점점 더 접근 가능한 작업 명세와 솔루션 아티팩트를 가진 공개 벤치마크를 사용하여 시스템을 평가하고 있습니다. 우리는 오염 주장을 뒷받침하는 데 필요한 증거에 따라 오염 여부를 구별하는 측정 기반 감사 프레임워크를 제안합니다. 이 프레임워크는 서로 다른 증거가 필요한 세 가지 채널, 즉 훈련 시간 노출(training-time exposure), 평가 시간 검색(evaluation-time retrieval), 그리고 파이프라인/스캐폴드 누수(pipeline/scaffold leakage)를 분리합니다. 각 채널은 실패 폐쇄 규칙(fail-closed rule)에 따라 open, partial, closed 또는 unknown으로 코딩됩니다. 9가지의 Holistic Agent Leaderboard (HAL) 구성 전반에 걸쳐 27개 채널 평가 중 어느 것도 closed로 코딩되지 않았지만, 4가지 구성에서 사건이 확인되었습니다. 그런 다음 우리는 이 프레임워크의 행동적 구성 요소를 SWE-bench Verified에서 보고된 파일 위치 지정 격차(file-localization gap)에 적용했습니다. 이를 위해 결과에 눈가림을 한 동일 저장소 매치드-컨트롤 설계(outcome-blind, same-repository matched-control design)와 대칭 프롬프트 누수 선별(symmetric prompt-leakage screening), 쌍 및 저장소 인식 불확실성 분석(pair and repository-aware uncertainty analyses), 그리고 스코어러 검증을 사용했으며, GPT-4.1과 DeepSeek-V4-Flash를 대상으로 평가했습니다. 대칭 선별과 쌍 무결성 제외(pair-integrity exclusion) 후 유지된 100쌍 중에서, GPT-4.1은 $+10.0$점의 쌍 가중치 Top-3 벤치마크 관련 격차를 보였지만, 사전에 명시된 쌍 부트스트랩 절차와 사후 저장소 균형 분석 모두에서 95% 신뢰 구간이 0을 포함하여 이 벤치마크 관련 격차는 결론을 내릴 수 없었습니다. 재현 스코어러(reproduction scorer)는 검증 게이트를 통과하지 못했습니다. 합의된 인간 레이블에 비추어 볼 때, 두 모델 모두에 대해 충분한 스코어러 민감도를 확립할 수 없었으며, DeepSeek-V4-Flash가 올바른 골드 비교에서 발생시킨 모든 시도는 거짓 양성(false positives)이었습니다. 출처 증거(provenance evidence), 적절한 통제 장치(appropriate controls), 대칭 누수 선별, 그리고 검증된 스코어러 없이는 더 강력한 오염 주장은 정당화되지 않습니다. 이 결과는 훈련 데이터 멤버십, 오염 유병률 또는 벤치마크 유발 점수 인플레이션을 확립하지 못합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기