Hugging Face가 48개의 공식 벤치마크를 갖게 되었습니다. 지도를 확인해 보세요
요약
Hugging Face가 GPQA Diamond, MMLU-Pro 등 총 48개의 공식 벤치마크를 지정하고 이를 한눈에 볼 수 있는 새로운 Space를 공개했습니다. 이 지도는 에이전트 관련 벤치마크의 증가 추세를 보여주지만, 실제 제출물은 과학 및 지식 분야에 집중되어 있습니다. 또한, 소수의 인기 벤치마크가 전체 비교 결과를 주도하고 있어 결과 해석 시 주의가 필요합니다.
핵심 포인트
- 공식 벤치마크 총 48개 확보로 모델 평가의 투명성 증대
- 최근 트렌드는 에이전트 및 터미널 작업 관련 벤치마크 증가
- 실제 제출물은 과학/지식 분야에 집중되어 있어 활용도가 높음
- 소수 인기 벤치마크가 대부분의 비교 결과를 좌우함 (결과 해석 주의)
Hugging Face가 점점 더 많은 데이터셋을 **공식 벤치마크(official benchmarks)**로 지정하고 있습니다. 각 데이터셋에는 해당 모델 저장소에서 게시하는 .eval_results 파일로부터 자동으로 채워지는 리더보드가 마련되어 있습니다. 현재 GPQA Diamond, MMLU-Pro부터 SWE-bench, Terminal-Bench, AIME 2026, Open ASR Leaderboard에 이르기까지 총 48개의 공식 벤치마크가 존재합니다.
지금까지 부족했던 점은 이들을 한눈에 볼 수 있는 방법이 없었다는 것입니다. 각 리더보드는 자체 페이지에 존재하기 때문에 "어떤 분야를 다루는지?" 또는 "모델 제작자들이 실제로 제출하는 곳은 어디인지?"와 같은 질문에 답하기 어려웠습니다.
새로운 Space인 Hugging Face Official Benchmarks: Map and Participation이 모든 공식 리더보드를 하나의 라이브 페이지로 모았습니다. 이 페이지는 방문할 때마다 공개 Hugging Face API를 브라우저에서 읽어오기 때문에, 아래 수치는 2026년 10월 4일자 스냅샷이며 페이지 자체는 항상 최신 상태를 보여줍니다.
지도가 보여주는 내용은 다음과 같습니다.
1. 벤치마크의 경향은 에이전트(agents) 쪽으로 기울고 있다
분야별로 48개 벤치마크를 그룹화하면 다음과 같습니다:
| 분야 | 공식 벤치마크 수 |
|---|---|
| 에이전트 및 터미널 작업 (Agents and terminal tasks) | 17 |
| ... |
공식 세트의 3분의 1 이상이 에이전트를 측정합니다. 즉, 터미널 작업, 도구 사용(tool use), 장기 계획 작업(long-horizon tasks), 브라우징 및 다단계 워크플로우를 포함합니다. 이는 지난 한 해 동안 업계 논의가 이동해 온 방향과 일치합니다.
2. 제출물은 다른 곳으로 향한다
벤치마크 개수 대신 실제 리더보드 항목(entries)을 세어보면 그림이 달라집니다. 약 1,020개의 항목 중:
| 분야 | 항목 수 |
|---|---|
| 과학 및 지식 (Science and knowledge) | 348 |
| ... |
에이전트 관련 벤치마크가 가장 많지만, 실제 제출물은 과학 및 지식 분야에서 가장 많이 발생합니다. 그 이유 중 일부는 실용적입니다. GPQA와 MMLU-Pro는 실행 비용이 저렴하고 보고되는 경우가 많지만, 에이전트 벤치마크는 하네스(harnesses), 샌드박스(sandboxes) 및 장시간 실행을 필요로 합니다. 많은 새로운 에이전트 벤치마크들은 아직 소수의 항목만을 보유하고 있습니다.
3. 참여도는 매우 불균형하다
- 평균 공식 벤치마크에는 약 12개의 리더보드 항목이 있습니다.
- 그중 14개는 다섯 개 이하의 항목을 가지고 있습니다.
- 가장 활발한 5개 보드(MMLU-Pro 약 141개 항목, GPQA 약 111개, HLE 약 89개, SWE-bench Verified 약 67개, Open ASR 약 62개)가 모든 항목의 **46%**를 차지합니다.
따라서 소수의 벤치마크가 대부분의 비교 결과를 좌우하며, 긴 꼬리(long tail)는 빈약한 편입니다. 항목이 140개인 보드에서 1위를 하는 것과 항목이 3개인 보드에서 1위를 하는 것은 매우 다르므로, 리더보드 결과가 인용될 때마다 이 점을 염두에 두는 것이 중요합니다.
4. 누가 제출하는가 (Who submits)
공식 리더보드에는 95개 조직의 약 410개 모델이 등장합니다. 항목 수 기준으로 가장 활동적인 발행사들은 다음과 같습니다:
| Organization | Entries |
|---|---|
| Qwen | 136 |
| ... |
발행 조직의 국가별로 그룹화했을 때, 항목의 약 55%가 중국에서, 23%가 미국에서, 4%가 한국에서, 2%가 프랑스에서 나왔으며, 나머지 13%는 명확한 공적 본사가 없는 조직에서 나왔습니다. 이 국가 라벨은 Space에서 수동으로 지정되며 수정이 가능합니다.
5. 페이지에 무엇이 더 있는가 (What else is on the page)
- #1 자리: 각 벤치마크별로 어떤 모델이 1위인지, 그리고 각 조직이 몇 개의 1위를 차지했는지, 게다가 어느 분야를 주도하는지 보여주는 히트맵(heatmap)을 제공합니다.
- 격차 (Gaps): 각 보드에서 1위가 2위보다 얼마나 앞서 있는지 백분율로 나타냅니다.
- 참여한 보드 대 선두를 차지한 보드 (Boards entered vs. boards led): 조직이 많은 보드에 참여하여 우승하는지, 아니면 적은 수의 보드에서 가장 많이 우승하는지를 보여줍니다.
- 모든 벤치마크: 항목 수별로 정렬되어 있으며, #1과 #2를 표시합니다.
읽는 방법 (How to read it)
이 리더보드를 기반으로 구축된 모든 보기(view)에는 두 가지 주의사항이 적용됩니다.
첫째, 항목은 모델 저자들이 자체 레포지토리에서 게시하며, 설정이 다릅니다. 샘플링(sampling), 다수 투표(majority voting), 사고 예산(thinking budget), 프롬프트 형식(prompt format) 등 모든 제출물마다 상이합니다. 리더보드는 저자들이 보고한 수치를 순위 매길 뿐, 모델 자체를 실행하지는 않습니다.
둘째, 조직(organization)은 모델 저장소의 네임스페이스입니다. 다른 네임스페이스에서 공개된 파인튜닝 결과는 기본 모델 제작자가 아닌 해당 네임스페이스에 카운트됩니다.
이 점을 염두에 두고 보면, 이 지도는 단일 리더보드가 답하는 질문과는 다른 종류의 질문에 유용합니다. 즉, '누가 X에서 최고인가'가 아니라, '무엇이 측정되고 있는지, 각 측정 항목이 얼마나 포화 상태인지, 그리고 누가 등장하고 있는지'입니다.
Space: [https://huggingface.co/spaces/quantid/huggingface-official-benchmark-leaderboards]
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기