허깅페이스 리더보드 1위 9개: 오픈소스 LLM Darwin-180B-RSI와 재귀적 자가개선(RSI) 개발자 가이드
요약
VIDRAFT의 오픈소스 LLM인 Darwin-180B-RSI 계열이 허깅페이스 벤치마크 48개 중 9개에서 1위를 차지하며 주목받고 있습니다. 이 모델은 '모델 수준 재귀적 자가개선(Model-level RSI)'이라는 독특한 방식으로, 검증 가능한 문제를 스스로 풀고 정답으로 확인된 자기 풀이만 학습하여 성능을 극대화했습니다.
핵심 포인트
- Darwin-180B-RSI는 9개의 허깅페이스 벤치마크에서 1위를 기록했습니다.
- 핵심 기술은 '모델 수준 재귀적 자가개선(Model-level RSI)'입니다.
- ZTC 시스템은 외부 API 판정 대비 정확도는 유지하며 속도를 약 10배 향상시켰습니다.
- 구조화 출력 및 정보 추출 등 실무형 영역에서 높은 성능을 보였습니다.
TL;DR
- 비드래프트(VIDRAFT)의 오픈소스 LLM Darwin-180B-RSI 계열이 허깅페이스 공인(official) 벤치마크 48개 중 9개에서 1위입니다. 95개 조직 가운데 가장 많고, 다음은 문샷AI·지푸AI(각 4개)입니다.
- 새로 추가된 1위는 실무형 두 개입니다. IFStruct 98.95%(구조화 출력, 2,000문항 중 1,979 통과)와 ExtractBench 90.29(PDF 370건 정보 추출, R3 버전)입니다.
- 비결은 모델 수준 재귀적 자가개선(Model-level RSI): 사람이 쓴 정답 없이 검증 가능한 문제를 스스로 풀고, 정답으로 확인된 자기 풀이만 골라 다시 학습합니다.
- 같은 팀의 ZTC는 답을 한 글자도 생성하지 않고 판정합니다. 외부 API 판정(JEV)과 정확도는 통계적으로 같고(AUC 0.7289 vs 0.7350), 판정 1회는 0.0615초 vs 0.591초로 약 10배 빠릅니다.
- 아래에 리더보드를 직접 조회하는 Python 코드, vLLM·Transformers 실행 코드, FAQ를 정리했습니다. 모든 리더보드 수치는 2026년 10월 5일 허깅페이스 API로 다시 확인했습니다.
허깅페이스 공인 리더보드 1위 9개는 정확히 무엇인가요?
허깅페이스는 일부 데이터셋을 "공인 벤치마크(benchmark:official)"로 지정하고, 각 데이터셋 페이지에 리더보드를 붙여 둡니다. 모델 제작자는 자기 모델 저장소에 .eval_results/*.yaml 파일로 점수를 등록하고, 허깅페이스가 이를 모아 순위를 매깁니다. 현재 공인 벤치마크는 48개, 참가 조직은 95개입니다.
2026년 10월 5일 API 기준 Darwin-180B-RSI 계열이 1위인 9개 보드와 바로 아래 모델은 다음과 같습니다.
| 영역 | 벤치마크 (데이터셋 ID) | Darwin 점수 | 2위 모델 | 2위 점수 |
|---|---|---|---|---|
| 과학 | GPQA Diamond (Idavidrein/gpqa) | 94.44 | moonshotai/Kimi-K3 | 93.5 |
| 지식 | MMLU-Pro (TIGER-Lab/MMLU-Pro) | 88.12 | MiniMaxAI/MiniMax-M2.1 | 88.0 |
| 수학 | AIME 2026 (MathArena/aime_2026) | 100 | thinkingmachines/Inkling | 97.1 |
| 수학 | HMMT Feb 2026 (MathArena/hmmt_feb_2026) | 100 | moonshotai/Kimi-K2.6 | 92.7 |
| 시각 추론 | MMMU-Pro (MMMU/MMMU_Pro) | 79.48 | moonshotai/Kimi-K2.6 | 79.4 |
| 법률 | LEXam (LEXam-Benchmark/LEXam) | 68.94 | deepseek-ai/DeepSeek-R1 | 52.41 |
| 법률 | LEXam-hard (joelniklaus/LEXam-hard) | 45.72 | thinkingmachines/Inkling | 40.82 |
| 기업 실무 | ExtractBench (llamaindex/ExtractBench) | 90.29 (R3) | Qwen/Qwen3.8-Flash-Next | 89.88 |
| 기업 실무 | IFStruct (LiquidAI/ifstruct-v1.0) | 98.95 | InternScience/Agents-A1 | 93.25 |
참가 모델이 가장 많은 MMLU-Pro(약 141개)와 GPQA(약 111개)에서도 1위입니다. 경쟁이 가장 붐비는 보드와 실무형 보드를 함께 잡았다는 점이 개발자 입장에서 의미 있는 부분입니다.
정직하게 덧붙이면, 이 점수들은 모두 제작사가 공식 평가 도구로 측정해 등록한 자체 측정값입니다. 다수결 점수(예: AIME maj@16, GPQA 최대 16샘플 다수결)는 모델 카드에 그렇게 표기되어 있습니다. 숫자를 비교할 때 설정까지 같이 보시길 권합니다.
리더보드 순위를 코드로 직접 확인하려면 어떻게 하나요?
블로그 글의 숫자를 믿을 필요 없이, 허깅페이스 공개 API로 바로 확인할 수 있습니다. 토큰도 필요 없습니다.
import requests
from collections import Counter
API = "https://huggingface.co/api"
# 1) 공인 벤치마크 목록
boards = requests.get(f"{API}/datasets",
params={"filter": "benchmark:official", "limit": 200}).json()
print("공인 벤치마크 수:", len(boards))
# 2) 보드별 1위 집계
firsts = Counter()
for b in boards:
rows = requests.get(f"{API}/datasets/{b['id']}/leaderboard").json()
if not isinstance(rows, list) or not rows:
continue
top = rows[0] # rank 1
firsts[top["modelId"].split("/")[0]] += 1
if top["modelId"].startswith("FINAL-Bench/"):
r2 = rows[1] if len(rows) > 1 else {}
print(b["id"], top["value"], top["modelId"],
"| 2위", r2.get("modelId"), r2.get("value"))
print(firsts.most_common(5))
# 2026-10-05 실행 결과: FINAL-Bench 9, moonshotai 4, zai-org 4, XiaomiMiMo 3, deepseek-ai 3
각 행에는 rank, value, modelId, source(모델 카드 링크), verified 같은 필드가 들어 있습니다. 사내 모델 선정 대시보드를 만들거나, 특정 벤치마크의 1위 변동을 주기적으로 감시하는 데 그대로 쓸 수 있습니다.
IFStruct 98.95%는 개발자에게 왜 중요한가요?
IFStruct는 미국 리퀴드AI(Liquid AI)가 만든 구조화 출력 벤치마크입니다. 실제 사용자가 요청하는 다양한 표현으로 JSON 또는 YAML 스키마를 지정하고, 모델이 그대로 지키는지 문항마다 합격/불합격으로 채점합니다. 기준이 꽤 엄격합니다.
- 항목 개수(또는 범위), 감싸는 키, JSON과 YAML 구분
- 코드 펜스를 요구하거나 금지하는 조건, "설명 없이"라는 요청
- 모든 필드의 자료형, 허용값(enum), 숫자 범위, 중첩 리스트 길이
- 스키마가 요구하지 않은 필드를 하나라도 지어내면 불합격
제약 디코딩(constrained decoding)을 쓰지 않으므로 모델 자체의 규율만 측정됩니다. Darwin-180B-RSI는 공식 하네스 기본값(temperature 0, 최대 16,000토큰, 생각 켬)으로 2,000문항 중 1,979문항을 통과했습니다. 한 문항은 하네스의 120초 읽기 시간 제한에 걸려 불합격 처리되었으니, 이 숫자는 보수적인 값입니다. 같은 모델에서 생각 모드를 끄면 89.7%로 내려갑니다. 마지막 몇 개의 제약 위반을 잡아내는 것이 바로 추론 단계라는 뜻입니다.
에이전트 파이프라인이나 백오피스 자동화에서 모델의 출력은 사람이 아니라 코드가 읽습니다. 자료형 하나, 지어낸 키 하나에 json.loads나 스키마 검증이 실패하고 파이프라인이 멈춥니다. 재시도 루프와 수리(repair) 로직을 줄일 수 있다는 점에서, 98.95%와 93.25%의 차이는 운영 비용의 차이입니다.
ExtractBench 90.29는 어떻게 나왔나요?
ExtractBench는 라마인덱스(LlamaIndex)가 만든 문서 정보 추출 벤치마크입니다. 몇 쪽짜리 서식부터 190여 쪽에 이르는 파일까지 PDF 370건에서 구조화된 필드를 뽑아야 합니다. 자가개선을 한 번 더 거친 Darwin-180B-RSI-R3가 90.29점으로 1위에 올랐고, 종전 1위는 이 모델의 기반인 알리바바 Qwen3.8-Flash-Next(89.88), 그다음은 Qwen3.8-27B(89.75)입니다. 이 실행은 공식 하네스로 생각 모드를 끈 상태였고, 제출 노트에 그렇게 명시했습니다.
기반 모델을 자기 계보의 다음 세대가 넘었다는 점이 RSI의 효과를 가장 직접적으로 보여 줍니다.
재귀적 자가개선(Model-level RSI)은 어떻게 작동하나요?
Darwin-180B-RSI는 알리바바의 오픈 모델 Qwen3.8-Flash-Next에서 출발합니다. 그 위에 비드래프트의 **모델 수준 재귀적 자가개선(Model-level RSI)**을 적용했습니다. 원리는 세 줄로 요약됩니다.
- 모델이 검증 가능한 문제를 스스로 풉니다.
- 풀이 중 정답으로 확인된 자기 풀이만 남깁니다.
- 그 풀이로 다시 학습하고, 이 과정을 반복합니다.
사람이 쓴 정답 풀이나 추론 흔적은 쓰지 않습니다. 검증되지 않은 풀이는 학습 데이터에 들어가지 않기 때문에, 모델이 자기 오류를 강화하는 일이 구조적으로 막힙니다. R3는 이 반복을 한 바퀴 더 돈 결과입니다.
흥미로운 점은 법률이나 문서 추출을 따로 가르치지 않았는데도 LEXam, LEXam-hard, ExtractBench에서 1위가 나왔다는 것입니다. 회사는 검증 가능한 문제를 풀며 익힌 꼼꼼한 단계별 추론 습관이 다른 영역으로 옮겨 간 결과로 보고 있습니다.
"Model-level"이라는 이름은 작업틀(하네스) 쪽 프롬프트나 도구를 고치는 방식과 구분하기 위한 것입니다. 바뀌는 것은 매뉴얼이 아니라 모델의 가중치, 즉 두뇌 자체입니다.
Darwin-180B-RSI를 직접 실행하려면 어떻게 하나요?
아래 코드는 모델 카드의 Quickstart를 그대로 옮긴 것입니다. 사양을 먼저 확인하세요.
- 구조: Mixture-of-Experts, 하이브리드 어텐션(선형 어텐션 36층 + 완전 어텐션 12층)
- 전문가 512개 중 토큰당 10개 활성 + 공유 전문가
- 컨텍스트 262,144토큰, 이미지+텍스트 입력, 텍스트 출력
- bf16 기준 약 336GB
vLLM으로 서빙 (B200 8장 또는 동급)
vllm serve FINAL-Bench/Darwin-180B-RSI \
--tensor-parallel-size 8 --enable-expert-parallel \
--max-model-len 135168 --trust-remote-code
OpenAI 호환 API로 호출
from openai import OpenAI
c = OpenAI(base_url="http://localhost:8000/v1", api_key="-")
r = c.chat.completions.create(model="FINAL-Bench/Darwin-180B-RSI",
messages=[{"role": "user", "content": "Explain why the sky is blue in two sentences."}],
temperature=1.0, top_p=0.95, extra_body={"top_k": 20})
print(r.choices[0].message.content)
Transformers로 로드
from transformers import AutoProcessor, AutoModelForImageTextToText
model_id = "FINAL-Bench/Darwin-180B-RSI"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype="auto", device_map="auto")
실전 팁 두 가지입니다. 첫째, 이것은 생각(thinking) 모델입니다. 어려운 추론에는 32K에서 131K토큰의 생각 예산을 권장하며, 짧게 자르면 정확도가 떨어집니다. 둘째, 모델 카드의 평가 설정은 temperature 1.0, top_p 0.95, top_k 20입니다. 다만 IFStruct처럼 형식이 중요한 작업은 공식 하네스가 temperature 0을 썼다는 점도 참고하세요.
ZTC는 무엇이고 JEV와 무엇이 다른가요?
AI 에이전트가 메일을 보내고, 결제를 하고, 코드를 실행하는 시대에는 틀린 행동을 실행 전에 거르는 판정(decision) 기술이 중요해졌습니다. 타입세이프(Typesafe)의 판정 API JEV가 이 분야의 표준 규격을 만들었고, 이를 평가하는 Decision Index에는 70개가 넘는 모델이 올라 있습니다. 9월 30일에는 클라우드플레어가 JEV 호환 판정 모델 Clef를 공개했습니다.
비드래프트의 **ZTC(Zero-Token Confidence, 무토큰 확신도)**는 접근이 다릅니다. 다른 AI에게 "이 답이 맞나요?"를 물어 글로 된 답을 받는 대신, 답을 만든 모델의 내부 상태를 한 번 읽어 정답일 확률을 계산합니다. 추가로 생성하는 토큰이 0개입니다.
이를 직접 보여 주는 앱이 Gate Arcade이고, 9월 28일 주간 허깅페이스 "이주의 스페이스(Spaces of the Week)"에 선정되었습니다. 에이전트가 행동을 제안하면 관문이 실행 또는 보류를 정합니다. 맞는 행동 실행 +1, 틀린 행동 실행 -1, 보류 0점입니다. 2026년 9월 24일 기준, 폐쇄망 배치 실측값은 다음과 같습니다.
| 판정 없음 | JEV (외부 API) | ZTC (비드래프트) | |
|---|---|---|---|
| 판정 정확도 (AUC) | 없음 | 0.7350 | 0.7289 |
| 판정 1회 시간 | 0초 | 0.591초 | 0.0615초 |
| 300초 처리 건수 | 해당 없음 | 135건 | 177건 |
정확도는 통계적으로 같은 수준이고 속도는 약 10배입니다. 2,000판 대결에서 ZTC가 73.7%를 이겼습니다. 판정을 위해 데이터를 밖으로 보낼 필요가 없어 인터넷이 막힌 폐쇄망에서도 돌아갑니다. 같은 방식으로 Darwin-397B-ZTC는 자기 답의 정답 여부 판정 정확도를 0.76에서 0.88로 끌어올렸습니다.
한계도 분명합니다. 모델 내부를 읽어야 하므로 API로만 쓰는 폐쇄형 모델에는 적용할 수 없고, 모델마다 판독기를 맞춰야 합니다. 그래서 최종 판정자라기보다 빠르고 싼 1차 관문으로 쓰는 것이 맞습니다. 참고로 Darwin-180B-RSI 저장소에 함께 들어 있는 ZTC 판독기는 모델 카드에 "초기 공개(early release)"로 표기되어 있으니, 높은 위험의 행동에는 카드 설명을 확인하고 쓰세요.
자주 묻는 질문 (FAQ)
Q1. 허깅페이스 리더보드 1위 9개는 어디서 확인하나요?
각 데이터셋 페이지(예: huggingface.co/datasets/LiquidAI/ifstruct-v1.0)의 리더보드 탭이나, 위의 Python 코드처럼 https://huggingface.co/api/datasets/{id}/leaderboard를 호출하면 됩니다. 48개 보드를 한 화면에 모은 스페이스도 있습니다.
Q2. 점수는 누가 측정했나요? 검증된 값인가요?
허깅페이스 공인 리더보드는 제작사가 공식 평가 도구로 측정해 .eval_results로 등록하는 구조입니다. Darwin의 점수도 자체 측정값이며, 샘플 수와 생각 예산 같은 설정을 모델 카드에 모두 공개했습니다.
Q3. 재귀적 자가개선(RSI)에 사람이 만든 정답이 정말 전혀 안 들어가나요?
네. 모델이 검증 가능한 문제를 풀고, 정답으로 확인된 자기 풀이만 남겨 다시 학습합니다. 사람이 쓴 풀이나 추론 흔적은 쓰지 않습니다.
Q4. 오픈소스 LLM으로 바로 써도 되나요? 하드웨어는 얼마나 필요한가요?
가중치는 허깅페이스에 공개되어 있습니다. bf16 기준 약 336GB이므로 모델 카드는 B200 8장(또는 동급)에서 vLLM 텐서 병렬 8, 전문가 병렬을 권장합니다.
Q5. 구조화 출력(JSON) 작업에 왜 이 모델인가요?
제약 디코딩 없이 IFStruct 98.95%를 기록했습니다. 2위(93.25%)보다 5.7%p 높아, 출력 수리와 재시도 로직을 줄이는 데 유리합니다.
Q6. ZTC를 우리 서비스에 붙이려면?
모델 내부 상태를 읽을 수 있는 오픈 웨이트 모델이어야 합니다. Gate Arcade에서 동작 방식을 먼저 체험해 보고, 모델 카드의 ztc/ 폴더 예제를 참고하세요.
링크
- 비드래프트: https://vidraft.net
- 모델: https://huggingface.co/FINAL-Bench/Darwin-180B-RSI
- R3 (ExtractBench 1위): https://huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3
- Gate Arcade (이주의 스페이스): https://huggingface.co/spaces/FINAL-Bench/gate-tetris
시험을 잘 푸는 모델에서, 정해진 형식대로 일하는 모델로. 그리고 그 모델이 행동하기 전에 확신 없는 순간을 0.06초 만에 잡아내는 관문까지. 직접 돌려 보시고 결과를 댓글로 알려 주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기