VIDRAFT Tops 10 Hugging Face 공식 리더보드 — 48개 모든 벤치마크의 실시간 지도 공개
요약
QuantID가 Hugging Face의 48개 공식 벤치마크 리더보드를 단일 인터랙티브 대시보드로 통합하여 공개했습니다. 이 도구는 실시간 API 조회를 통해 데이터의 투명성을 확보하며, 어떤 역량 영역에서 경쟁이 치열한지 한눈에 파악할 수 있게 합니다. 한국 스타트업 VIDRAFT가 10개 리더보드에서 1위를 차지하는 등 주요 참여 현황을 분석했습니다.
핵심 포인트
- Hugging Face의 48개 벤치마크를 단일 대시보드로 통합하여 시각화함.
- 실시간 API 조회로 데이터 조작 없이 투명한 정보를 제공함.
- 과학/지식 분야가 가장 많은 제출 건수를 기록하며 경쟁이 치열함.
- VIDRAFT는 10개의 리더보드에서 1위를 차지하는 등 높은 활동성을 보임.
VIDRAFT Tops 10 Hugging Face 공식 리더보드 — 48개 모든 벤치마크의 실시간 지도 공개
요약: QuantID(퀀트ID)가 Hugging Face에서 공식적으로 인정하는 48개의 모든 벤치마크 리더보드를 단일 화면에 통합한 실시간 대시보드를 출시했습니다. 이 도구는 페이지 로드 시마다 Hugging Face의 공개 API를 라이브로 조회하여 캐싱되거나 수정된 데이터 없이 참여 패턴, 카테고리 분포, 생태계 전반의 1위 순위를 보여줍니다. 주요 발견 사항: 한국의 Pre-AGI AI 스타트업 VIDRAFT (Hugging Face org:
FINAL-Bench)가 현재 48개 중 10개 리더보드에서 1위를 차지하며, 다른 어떤 조직보다도 많은 수치입니다.
개요
한국의 AI 분석 회사인 QuantID는 Hugging Face가 공식 벤치마크로 지정하는 48개의 데이터셋을 하나의 인터랙티브 지도에 통합한 실시간 시각화 도구 **'Hugging Face 공식 벤치마크: 지도 및 참여(Hugging Face Official Benchmarks: Map and Participation)'**를 공개했습니다.
Hugging Face는 이 48개 데이터셋 각각에 대한 리더보드를 유지하고 있습니다 (여기에는 GPQA, MMLU-Pro, SWE-bench, AIME과 같은 잘 알려진 평가가 포함됩니다). 모델 개발자들은 공개적인 성능 기록을 수립하기 위해 해당 리더보드에 점수를 제출합니다. 문제는 이 48개의 리더보드가 48개의 별도 페이지에 존재하여 다음과 같은 질문에 답하기 어렵다는 것입니다:
- 어떤 역량 영역이 가장 경쟁이 치열한가?
- 어떤 조직들이 가장 광범위하게 경쟁하고 있는가?
- 현재 누가 1위를 차지하고 있으며, 얼마나 앞서고 있는가?
QuantID의 지도는 오직 공개적으로 사용 가능한 데이터만을 사용하여 이 세 가지 질문에 한 화면에서 답을 제공합니다.
작동 방식
이 도구는 아키텍처가 간단합니다:
작동 방식
이 도구는 아키텍처가 간단합니다:
- Live API 읽기: 페이지 로드 시마다 대시보드는 Hugging Face의 공개 API를 호출하여 현재 리더보드 상태를 가져옵니다. 독점적인 데이터 저장소나 원본 점수 수정은 없습니다.
- 투명한 집계: 분류 논리(도메인별, 조직 국가별, 참여 범위별)는 페이지에 직접 문서화되어 있습니다.
- 파생 모델 대 기본 모델 필터링: Hugging Face 리더보드의 기본 보기에서는 다른 모델의 미세 조정된 파생 모델이 제외됩니다. QuantID는 두 가지 보기(view)를 모두 제공하여, 사용자가 기본 필터링된 개수와 함께 전체 제출 수(파생 모델 포함)를 볼 수 있게 합니다.
이러한 설계 덕분에 대시보드는 항상 상위 Hugging Face 데이터와 동기화되며 점수나 순위에 편집적 편향을 도입하지 않습니다.
벤치마크 및 결과
2026년 10월 5일 기준 (출처에 보고된 수치):
카테고리 분포 (총 48개 벤치마크):
- Agent / 터미널 작업: 17개 벤치마크 — 가장 큰 단일 카테고리
- 과학 / 지식: 6개
- 문서 / OCR: 5개
- 코딩, 비디오 및 법률: 각 4개
참여 현황 (기본 모델 기준, 약 1,023건 제출; 파생 모델 포함 시, 약 1,469건):
- 과학 / 지식은 348건의 제출로 선두를 차지합니다 — 에이전트 카테고리보다 벤치마크는 적지만 가장 경쟁이 치열한 도메인입니다.
- 에이전트 작업: 197건 | 코딩: 158건
- 모든 제출의 약 **30%**가 Hugging Face 기본 리더보드 보기에서 숨겨져 있는데, 이는 파생 모델이기 때문입니다.
조직 현황:
- 95개 조직, 411개 모델이 대표됩니다
- 조직 국가별: 중국 55%, 미국 23%, 한국 4%
- 제출 건수 기준 가장 활동적인 조직: Alibaba Qwen (136), Zhipu AI (84), DeepSeek & Moonshot AI (각 65), NVIDIA (63)
- 가장 광범위한 벤치마크 커버리지: Zhipu AI (32개 벤치마크), Alibaba Qwen (31개 벤치마크)
- 조직의 47% (95개 중 45개)가 단 하나의 벤치마크에만 제출했습니다
최우수 순위:
- **23개 조직(organizations)**이 최소 한 개의 최고 순위(first-place position)를 차지했습니다.
- VIDRAFT (
FINAL-Bench)가 10개의 최고 순위로 선두를 이끌고 있습니다. 이는 다른 어떤 조직보다 많은 수치입니다. - Zhipu AI: 4개 | Xiaomi, DeepSeek, Moonshot AI: 각 3개
VIDRAFT의 10개 최고 순위 벤치마크 (보고된 점수):
| 벤치마크 | 점수 |
|---|---|
| GPQA Diamond | 94.44 |
| ... |
순위 경쟁력: 최소 두 개의 제출물이 있는 42개 리더보드 중, 최고 순위와 2위 사이의 중앙값 격차는 **5.2 퍼센트 포인트(percentage points)**입니다. 7개의 리더보드는 격차가 1% 미만으로, 단 하나의 새로운 제출물로도 순위를 바꿀 수 있습니다.
사용 방법 (How to try it)
QuantID 벤치마크 지도는 공개적으로 접근 가능한 웹 도구입니다. 계정이나 API 키 없이 직접 탐색할 수 있습니다. Hugging Face에서 VIDRAFT의 제출물을 직접 찾아보려면, Hugging Face hub에서 조직 이름 FINAL-Bench를 검색하십시오.
기반 데이터는 전적으로 Hugging Face의 공개 API에서 오므로, 개발자들은 표준 Hugging Face datasets 인터페이스를 통해 개별 리더보드 데이터셋을 쿼리할 수도 있습니다:
# 예시: Hugging Face에서 모든 공식 벤치마크 데이터셋 탐색
huggingface-cli repo info datasets/<dataset-name>
벤치마크 데이터를 보거나 QuantID 대시보드를 이용하는 데 사적인 접근, 대기 목록(waitlist), 또는 특별한 자격 증명은 필요하지 않습니다.
FAQ
질문: QuantID 지도에 있는 데이터는 얼마나 최신인가요?
답변: 이 대시보드는 페이지가 로드될 때마다 Hugging Face의 공개 API에서 데이터를 가져오므로, 접속하는 순간 모든 48개 공식 리더보드의 현재 실시간 상태를 반영합니다. 예약된 배치 새로고침이나 캐시된 스냅샷은 없습니다.
Q: 뷰에 따라 제출(submission) 수가 ~1,023개에서 ~1,469개로 차이가 나는 이유는 무엇인가요?
A: Hugging Face의 기본 리더보드 표시 방식은 기존 베이스 모델을 파인튜닝하거나 파생된 모델을 필터링합니다. QuantID 맵은 이 두 수치를 모두 보여줍니다. 즉, 사용자가 Hugging Face에서 기본적으로 보게 될 ~1,023개의 '베이스 모델' 수와 모든 파생 제출(derivative submissions)을 포함한 총 ~1,469개 수치입니다. 후자는 대부분의 사용자가 일반적으로 보는 것보다 약 30% 더 많은 항목을 포함합니다.
Q: VIDRAFT의 벤치마크 점수는 표준 Hugging Face 리더보드 페이지에 표시되나요?
A: 네, 그렇습니다. VIDRAFT는 Hugging Face에서 FINAL-Bench 조직(organization) 아래 제출하며, 그들의 점수는 QuantID가 취합하는 동일한 공개 리더보드 데이터의 일부입니다. 모든 점수는 해당 Hugging Face 리더보드 페이지에서 직접 확인할 수 있습니다.
원래 디지털타임스 (2026-10-06) 보도 — 출처 기사.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기