SciCode-Verified: 벤치마크 결함이 어떻게 언어 모델의 과학적 코딩 능력을 과소평가했는가
요약
SciCode 벤치마크의 결함으로 인해 언어 모델의 과학적 코딩 능력이 과소평가되었음을 밝히고, 이를 수정한 SciCode-Verified를 공개합니다. 전문가 감사를 통해 발견된 263개의 결함을 수정함으로써 최첨단 모델들의 실제 성능이 기존보다 훨씬 높음을 입증했습니다.
핵심 포인트
- SciCode 벤치마크 내 263개의 결함 발견
- 잘못된 정답 및 엄격한 허용 오차로 인한 모델 성능 저평가 확인
- SciCode-Verified를 통해 모델 정확도가 대폭 상승함이 증명됨
- 평가 도구의 품질이 모델 성능 측정의 병목 현상임을 시사
SciCode는 언어 모델의 과학적 코딩 (scientific-coding) 능력을 측정하는 표준 지표입니다. 이는 최첨단 과학 이론과 이를 작동 가능한 수치 코드 (numerical code)로 구현하는 능력을 모두 요구하는 연구 수준의 문제들로 구성됩니다. SciCode는 Artificial Analysis Intelligence Index의 구성 요소이며, 정부 및 국립 연구소 평가 세트에서 상시 평가 항목으로 사용되고 있습니다. 그러나 최근 그 점수가 정체되었습니다. 가장 강력한 2026년 모델들이 하위 문제 (subproblem) 정확도 60% 부근에 밀집되어 있으며, 후속 모델이 이전 모델과 대등한 성적을 내고 있습니다. 우리는 이러한 정체의 원인을 벤치마크 자체의 결함에서 찾았습니다. 65개의 모든 테스트 문제에 대해 도메인 전문가 (domain-expert)가 문제별 감사를 실시한 결과 263개의 결함이 발견되었습니다. 이 중 91%의 주요 문제에 걸쳐 퍼져 있는 192개의 결함은 재현 불가능한 정답 (gold answers), 지나치게 엄격한 허용 오차 (tolerances), 또는 자기 모순적인 사양 (specifications)을 통해, 지시사항을 올바르게 따른 솔루션조차 잘못 거부되게 만들고 있었습니다. 결정적으로, 이러한 점수를 억제하는 결함의 78%는 단순한 사무적 교정 (clerical proofreading)이 아닌, 전문적인 물리학 또는 수학 지식을 필요로 합니다. 우리는 확인 가능한 모든 결함을 수정하여 SciCode-Verified를 제작했습니다. 수정 사항은 잘 정의된 문제 (well-posed problem)에 필요한 사양만을 추가하고, 채점 방식을 수리하며, 너무 관대했던 테스트를 강화하는 것뿐입니다. 모든 변경 사항은 근거와 함께 기록되었으며, 두 번째 도메인 전문가에 의해 독립적으로 재검토되었습니다. 우리는 수정된 벤치마크를 통해 12개의 최첨단 모델 스냅샷을 재평가하였으며, 상당한 회복을 확인했습니다. 하위 문제 정확도는 4560%에서 8498%로 상승하였고, 주요 문제 정확도는 927%에서 6992%로 상승했습니다. 최첨단 모델들은 SciCode가 시사했던 것보다 과학적 코딩에 훨씬 더 능숙합니다. 병목 현상은 모델의 능력이 아니라 평가 도구 (evaluation instrument)의 품질이었습니다. 우리는 완전한 감사 기록 (audit trail)과 함께 수정된 공개 표준으로서 SciCode-Verified를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기