
GPQA, MMLU-Pro, MMMU-Pro의 오류 질문 감사 결과, 최대 12% 제거 및 정제된 버전 공개
요약
GPQA, MMLU-Pro, MMMU-Pro 벤치마크를 감사한 결과, 약 12%의 오류 질문을 발견하여 이를 정제한 버전을 공개했습니다. 오류 수정 후 최상위 모델들의 성능이 약 98%까지 상승함을 확인했습니다.
핵심 포인트
- GPQA, MMLU-Pro, MMMU-Pro에서 약 12%의 오류 질문 발견
- 정제된 벤치마크 버전 및 오류 플래그 장부 공개
- 오류 수정 시 최상위 모델의 성능이 98%로 향상됨
- Hugging Face 데이터셋 및 lm-eval-harness 태스크 지원
저는 왜 모든 모델들이 GPQA-Diamond에서 약 92% 또는 93% (AA) 부근에서 정체되는지 매우 궁금했습니다. 그래서 지난 몇 주 동안 GPQA (Diamond 및 Extended)를 면밀히 검토했으며, 이후 MMLU-Pro와 MMMU-Pro에 대한 감사(auditing)로 범위를 확장했습니다. 솔직히 말씀드리면, 형식이 잘못되었거나, 정답 키(answer keys)가 틀렸거나, 혹은 현실적으로 정답이 여러 개인 질문이 얼마나 많은지 보고 상당히 충격을 받았습니다. 실제로 GPQA-Extended, MMLU-Pro, MMMU-Pro에서 약 12%의 질문이 검증 가능한 오류(broken)로 판명되었습니다! 이를 수정한 후, 최상위 모델들은 약 98%에 도달했습니다. 전체 논문은 여기에서 공개되었습니다: https://github.com/adamallcock/answer-key-audit 이 과정의 일환으로, 오류 항목을 제거한 네 가지 벤치마크의 정제된(Clean) 버전과 함께, 왜 제거되었는지 정확히 확인할 수 있는 전체 플래그 지정 후보 장부(flagged-candidate ledger)도 준비했습니다. 또한 원본 대 정제본의 이중 점수 산출(dual original-vs-cleaned scoring), lm-eval-harness 태스크 및 Hugging Face 데이터셋도 포함했습니다. 논문에 대한 피드백이나 제가 다음에 살펴봐야 할 벤치마크가 있다면 언제든 환영합니다. 추신: 직접 확인하고 싶으시다면 28페이지에 오류가 있는 질문들의 토씨 하나 틀리지 않은(verbatim) 예시들이 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기