허깅페이스 공인 1위 10개와 무토큰 판정 ZTC: 시험 잘 보는 AI에서 일 잘하는 AI로
요약
비드래프트 모델이 허깅페이스 공인 리더보드에서 총 10개 부문 1위를 차지하며 업계 주목을 받고 있습니다. 특히 이번에 추가된 IFStruct와 ExtractBench는 단순한 '시험' 영역을 넘어, 실제 기업 업무 환경에서의 데이터 형식 준수 및 문서 정보 추출 능력을 측정하는 실무 역량을 입증했습니다.
핵심 포인트
- 비드래프트가 허깅페이스 공인 리더보드 10개 부문에서 최고 기록 달성.
- 새로운 IFStruct는 AI의 JSON/YAML 등 '형식 준수'를 검증하여 실제 업무 활용도를 높임.
- ExtractBench는 대규모 PDF 문서에서 필요한 정보를 정확하게 추출하는 실무 능력을 측정함.
- ZTC(Zero-shot Token Confidence)는 외부 API 대비 빠르고 정확한 행동 판정 기술을 제시함.
TL;DR
- 비드래프트가 허깅페이스 공인 리더보드에서 1위를 추가해 총 10개 부문 1위에 올랐다. 공인 벤치마크 48개, 95개 조직이 겨루는 무대에서 가장 많은 1위이고, 2위 지푸AI(4개)의 두 배가 넘는다.
- 새로 추가된 두 부문은 '시험'이 아니라 '실무'다. 형식 준수를 재는 IFStruct 98.95%, 문서 정보 추출을 재는 ExtractBench 90.29점으로 둘 다 1위.
- AI 에이전트의 행동을 실행 전에 판정하는 **ZTC(무토큰 확신도)**는 외부 API 판정(JEV)과 같은 정확도(AUC 0.7289 vs 0.7350)에, 판정 1회 0.06초로 약 10배 빠르다.
- Darwin-180B-RSI는 알리바바 Qwen3.8-Flash-Next를 '모델 수준 재귀적 자가개선(Model-level RSI)'으로 끌어올린 오픈 모델이다.
10개 부문 1위가 왜 중요한가?
허깅페이스 공인 리더보드는 각 제작사가 공식 평가 도구로 측정한 값을 등록하는 무대다. 비드래프트가 1위를 지키는 10개 부문은 '시험' 영역과 '실무' 영역을 모두 가로지른다.
| 영역 | 벤치마크 | 점수 |
|---|---|---|
| 과학·지식 | GPQA Diamond | 94.44 |
| 과학·지식 | MMLU-Pro | 88.12 |
| 수학 | AIME 2026 | 100 |
| 수학 | HMMT 2026 | 100 |
| 시각 추론 | MMMU-Pro | 79.48 |
| 법률 | LEXam | 68.94 |
| 법률 | LEXam-hard | 45.72 |
| 기업 실무 | ExtractBench | 90.29 |
| 기업 실무 | IFStruct | 98.95 |
| 문서 파싱 | MDPBench | 83.65 |
참가 모델이 가장 많은 MMLU-Pro(141개)와 GPQA(111개)에서도 1위를 지키고 있어, 경쟁이 가장 치열한 무대와 실무 영역을 함께 아우른다. 1위 보유 상위 조직은 비드래프트 10, 지푸AI 4, 샤오미 3, 딥시크 3, 문샷AI 3 순이다.
새로 추가된 1위는 왜 '실무'인가?
지금까지의 1위가 과학·수학·법률 같은 시험 영역이었다면, 이번 두 부문은 기업이 AI를 실제 업무에 투입할 때 가장 먼저 부딪히는 능력이다.
IFStruct 98.95%. 리퀴드AI(Liquid AI)가 만든 IFStruct는 AI가 요청받은 형식(JSON·YAML) 그대로 데이터를 만들어 내는지를 본다. 항목 개수, 필드 이름, 자료형, 허용값, 숫자 범위까지 조건을 하나라도 어기거나, 요청하지 않은 항목을 하나라도 지어내면 불합격이다. 비드래프트 모델은 2,000문항 가운데 1,979문항을 통과해 98.95%를 기록했다. 종전 1위 Agents-A1(93.25%), 오픈AI gpt-oss-20b(91.95%), 엔비디아 Nemotron-3-Nano(86.80%)를 큰 차이로 앞섰다.
AI의 출력을 프로그램이 곧바로 읽어 다음 단계로 넘기는 파이프라인에서는 형식이 한 글자만 틀려도 업무가 멈춘다. 아래처럼 스키마 검증을 바로 통과해야 쓸 수 있다.
import json, jsonschema
schema = {
"type": "object",
"properties": {"name": {"type": "string"}, "age": {"type": "integer"}},
"required": ["name", "age"],
"additionalProperties": False, # 요청 안 한 항목을 지어내면 불합격
}
out = model.generate(prompt) # 모델 출력
jsonschema.validate(json.loads(out), schema) # 한 글자만 틀려도 예외
ExtractBench 90.29점. 라마인덱스(LlamaIndex)가 만든 ExtractBench는 수 쪽에서 190여 쪽에 이르는 PDF 370건에서 필요한 정보를 정확히 뽑아내는 능력을 잰다. 자가개선을 한 번 더 거친 Darwin-180B-RSI-R3가 90.29점으로 1위에 올랐다. 종전 1위는 이 모델의 기반인 알리바바 Qwen3.8-Flash-Next(89.88점)였다.
스스로 배우는 AI, RSI는 어떻게 동작하나?
Darwin-180B-RSI는 알리바바의 오픈 모델 Qwen3.8-Flash-Next를 기반으로, 비드래프트의 '모델 수준 재귀적 자가개선(Model-level RSI)' 기술로 성능을 끌어올렸다. 핵심은 세 단계다.
- 모델이 검증 가능한 문제를 스스로 푼다.
- 정답으로 확인된 자기 풀이만 골라낸다.
- 그 풀이만으로 다시 학습한다.
사람이 쓴 정답이나 풀이가 필요 없고, 검증되지 않은 풀이는 배우지 않아 오류가 강화되지 않는다. 법률이나 문서 추출을 따로 가르치지 않았는데도 이 영역에서 1위에 오른 것은, 검증 가능한 문제를 풀며 익힌 꼼꼼한 추론 습관이 다른 영역으로 옮겨 간 결과로 회사는 보고 있다.
ZTC는 어떻게 한 글자도 만들지 않고 판정하나?
AI 에이전트가 사람 대신 메일을 보내고 결제를 하고 코드를 실행하는 시대가 되면서, 틀린 행동을 실행 전에 걸러내는 '판정(decision)' 기술이 새 격전지가 됐다. 통상 방식은 다른 AI에게 "이 답이 맞느냐"를 물어 글로 된 답을 받는다. ZTC(Zero-Token Confidence, 무토큰 확신도)는 다르다. 답을 만든 모델의 내부 상태를 한 번 읽어 정답일 확률을 계산한다. 추가로 생성하는 글자가 0개다.
- 같은 정확도, 10배 빠른 속도. 판정 정확도(AUC)는 ZTC 0.7289, JEV 0.7350으로 통계적으로 같은 수준이다. 판정 1회 시간은 ZTC 0.06초, JEV 0.59초다. 같은 300초 동안 ZTC는 177건, JEV는 135건을 처리했고, 2,000판 대결에서 ZTC가 73.7%를 이겼다.
- 데이터가 밖으로 나가지 않는다. ZTC는 모델 옆 GPU에서 바로 돌아 외부 API를 왕복하지 않는다. 인터넷이 차단된 폐쇄망에서도 작동해 국방·금융·공공 현장에 적합하다.
- 추가 비용이 거의 없다. 이미 답을 만든 모델의 내부를 읽기만 한다. Darwin-397B-ZTC는 이 방식으로 자기 답의 정답 여부 판정 정확도를 0.76에서 0.88로 끌어올렸다.
| 지표 | 플레인 | JEV(외부 API) | ZTC(비드래프트) |
|---|---|---|---|
| 판정 정확도(AUC) | 없음 | 0.7350 | 0.7289 |
| 판정 1회 시간 | 0초 | 0.591초 | 0.0615초 |
| 300초 처리 건수 | 해당 없음 | 135건 | 177건 |
같은 시기, AI 에이전트의 행동을 판정하는 비드래프트의 체험 앱 Gate Arcade는 허깅페이스 '이주의 스페이스(Spaces of the Week)'에 선정됐다. 약 150만 개 앱 가운데 매주 8개를 고르는 큐레이션으로, 비드래프트는 한 달 새 두 번째로 이름을 올렸다.
FAQ
Q1. 리더보드 점수는 누가 측정하나?
각 제작사가 공식 평가 도구로 측정해 등록한 값이다. 허깅페이스 공인 벤치마크는 측정 방법과 데이터가 공개돼 재현할 수 있다.
Q2. IFStruct에서 '불합격' 기준은 무엇인가?
항목 개수, 필드 이름, 자료형, 허용값, 숫자 범위 중 하나라도 어기거나, 요청하지 않은 항목을 하나라도 지어내면 불합격이다. 2,000문항 중 1,979문항 통과가 98.95%다.
Q3. ZTC와 JEV의 정확도 차이는 유의미한가?
AUC 0.7289 대 0.7350은 통계적으로 같은 수준이다. 대신 판정 1회 시간이 0.06초 대 0.59초로 약 10배 빠르다.
Q4. ZTC는 폐쇄망에서도 쓸 수 있나?
그렇다. 모델 옆 GPU에서 바로 돌아 외부 API 왕복이 없으므로 인터넷이 차단된 환경에서도 작동한다.
Q5. RSI는 학습을 거듭하면 오류가 쌓이지 않나?
정답으로 검증된 자기 풀이만 다시 학습하므로, 검증되지 않은 풀이는 반영되지 않아 오류가 강화되지 않는다.
Q6. 모델은 어디서 볼 수 있나?
huggingface.co/FINAL-Bench/Darwin-180B-RSI 와 huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3 에 공개돼 있다.
Further reading
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기