시험에서 실제 업무까지: 180B 오픈 모델이 Hugging Face 공식 랭킹 10개 선두를 차지하다
요약
오픈 소스 모델인 Darwin-180B-RSI가 Hugging Face 48개 공식 벤치마크 중 10개에서 선두를 차지하며 강력한 성능을 입증했습니다. 특히 MDPBench, IFStruct 등 실제 업무 지향 테스트에서 높은 점수를 기록했으며, 이는 RAG 시스템의 핵심인 문서 파싱 및 구조화된 출력 능력을 의미합니다.
핵심 포인트
- Darwin-180B-RSI가 48개 공식 벤치마크 중 10개에서 최고 성능을 달성했습니다.
- MDPBench는 다국어 문서 파싱 등 실제 업무 환경의 핵심 능력을 측정합니다.
- IFStruct는 요청된 스키마를 준수하는 엄격한 JSON/YAML 출력을 요구하며 모델 자체의 규율을 테스트합니다.
- ZTC 기술은 에이전트가 내부 상태를 생성 없이 읽어내는 데 중요하여 프로덕션 에이전트에 활용됩니다.
요약 (TL;DR)
- 오픈 소스 모델인 Darwin-180B-RSI가 현재 경쟁하는 95개 조직 중 가장 많은 수인 Hugging Face의 48개 공식 벤치마크 중 10개에서 #1 순위를 차지했습니다. 2위는 Z.ai이며, 4개를 기록했습니다.
- 11번째 순위는 MDPBench(다국어 문서 파싱, 83.65)입니다. 이는 실제 업무 지향의 이전 두 가지 테스트인 IFStruct(구조화된 출력, 98.95%)와 ExtractBench(문서 추출, 90.29)에 추가됩니다.
- 이 모델은 **RSI(모델 수준에서의 자기 개선)**를 통해 향상되는데, 이는 검증 가능한 문제를 해결하고, 자신의 확인된 솔루션만을 정확하다고 간주한 뒤 이를 이용해 재훈련하는 방식입니다.
- 동시에 에이전트의 행동을 평가하는 앱인 Gate Arcade가 Hugging Face의 Spaces of the Week으로 선정되었습니다. 이 안에는 모델의 내부 상태를 아무 글자도 생성하지 않고 읽어내는 기술인 ZTC가 포함되어 있습니다.
본 게시물은 엔지니어링 배경을 가진 사람이 읽도록 작성되었으며, 벤치마크가 무엇을 측정하는지, 어떻게 달성했는지, 그리고 ZTC가 프로덕션 에이전트에게 왜 중요한지에 대해 다룹니다.
Hugging Face 공식 벤치마크 10개에서 선두를 차지한다는 것은 무엇을 의미할까요?
Hugging Face는 모든 조직이 각 테스트의 공식 평가 아머(arnés de evaluación)로 측정된 결과를 등록할 수 있는 공식 벤치마크 세트를 유지하고 있습니다. 현재는 48개의 벤치마크와 95개의 참여 조직이 있습니다. 하나의 모델 계열이 이 중 10개에서 선두를 차지하는 것은 높은 평균 점수를 받았다는 의미가 아닙니다. 이는 매우 다른 영역의 테스트들을 하나하나 통과했다는 것을 의미합니다.
흥미로운 점은 단순히 개수가 아니라 분포입니다. 이전까지는 상위권 순위들이 대학원 과학, 수학 올림피아드, 법률 스타일 질문 같은 시험 유형의 테스트에 집중되어 있었습니다. 최근 추가된 세 가지 테스트는 다른 것을 측정합니다. 바로 기업이 모델에게 실제로 맡기는 업무를 수행하는 능력입니다.
| 영역 | 벤치마크 | 점수 |
|---|---|---|
| 과학 및 지식 | GPQA Diamond | 94.44 |
| ... | ||
| Conviene subrayar un detalle: **MMLU-Pro (141개 모델 등록)**와 GPQA (111개 모델), 경쟁자가 가장 많은 두 가지 벤치마크에서 이 모델이 여전히 1위를 차지하고 있습니다. 사람들이 가장 많이 주목하는 곳에서 우승하는 것과 니치 테스트에서 우승하는 것은 다릅니다. |
MDPBench, IFStruct 및 ExtractBench는 무엇을 측정하나요?
MDPBench는 다국어 문서 파싱(parsing) 능력을 평가합니다. 즉, 표, 제목, 구조를 가진 실제 문서를 가져와 깨끗하고 사용 가능한 표현으로 변환하는 것입니다. 이는 거의 모든 RAG 시스템이나 문서 자동화의 눈에 보이지 않는 선행 단계입니다. 만약 파싱이 잘못되면 그 이후에 오는 모든 것이 오류를 물려받게 됩니다. 여기서 이 모델은 83.65를 기록했습니다.
Liquid AI에서 개발한 IFStruct는 모델이 요청된 스키마를 준수하는 유효한 JSON 또는 YAML을 반환하는지 확인합니다. 수정 여부는 프롬프트에 의해 승인되거나 보류되며, 매우 엄격합니다:
- 정확한 요소 개수(또는 범위), 래퍼 키, JSON 대 YAML
- 요구되거나 금지된 코드 블록, 요청 시 주석 없음
- 각 필드 유형, 열거형(enum), 숫자 제한 및 중첩 목록 길이
- 스키마가 요청하지 않은 모든 필드는 응답을 실패하게 만듭니다.
제한 디코딩(restricted decoding)은 사용되지 않으므로, 오직 모델 자체의 규율만 측정합니다. Darwin은 공식 아크(arnés)의 기본 값(온도 0, 16K 토큰, 추론 활성화)으로 2,000개 중 1,979개 프롬프트를 승인하여 **98.95%**를 달성했습니다. 하나의 프롬프트가 아크의 읽기 시간 제한(120초)을 초과하여 실패로 간주되었으므로, 이 수치는 보수적입니다.
| Modelo | IFStruct |
|---|---|
| Darwin-180B-RSI | 98.95 |
| ... | |
| ExtractBench에서는 de LlamaIndex가 짧은 양식부터 200페이지에 가까운 파일까지 총 370개의 PDF 문서에서 구조화된 필드를 추출하도록 요청했습니다. 두 번째 자가 개선 라운드인 Darwin-180B-RSI-R3는 90.29를 기록하며, 자체 기본 모델인 Qwen3.8-Flash-Next (89.88)보다 앞섰습니다. |
이 세 가지가 함께 중요한 이유: 에이전트 파이프라인에서 모델의 출력은 사람이 아닌 코드에 의해 읽힙니다. 데이터 유형이 잘못되었거나, 가짜 키를 사용하거나, 테이블이 제대로 구문 분석되지 않으면 프로세스가 중단됩니다. 이러한 테스트는 파일럿이 프로덕션에 도달할지 여부를 결정하는 부분을 정확하게 측정합니다.
사람이 레이블링한 데이터 없이 모델은 어떻게 개선되나요?
Darwin-180B-RSI는 Alibaba의 오픈 모델 Qwen3.8-Flash-Next를 기반으로 하며, 자체 모델 수준 RSI(Model-level RSI, 재귀적 자가 개선) 기술을 통해 성능을 향상시킵니다. 아이디어는 한 문장으로 요약하면 다음과 같습니다: 모델은 자신의 검증된 성공으로부터 학습합니다.
레시피나 하이퍼파라미터 없이 작동하는 루프:
- 모델은 답변이 자동으로 검증될 수 있는 문제를 해결합니다.
- 정확한 것으로 확인된 솔루션만 보존됩니다.
- 이 정제된 데이터셋으로 다시 훈련됩니다.
- 반복됩니다.
절대 검증되지 않은 솔루션으로부터 학습하지 않기 때문에 오류가 강화되지 않습니다. 주목할 만한 세부 사항은 다음과 같습니다: 아무도 모델에게 법률이나 문서 추출을 명시적으로 가르치지 않았음에도 불구하고, 이 영역들을 선두에서 이끌고 있습니다. 팀의 해석은 검증 가능한 문제를 해결하는 과정에서 습득된 신중하게 추론하는 습관이 새로운 도메인으로 전이된다는 것입니다.
ZTC란 무엇이며 왜 Spaces of the Week인가요?
AI 에이전트들이 우리를 대신하여 이메일을 보내고, 결제하고, 코드를 실행하기 시작하면서, 새로운 논쟁의 장은 판단(judgment) 그 자체입니다: 실행하기 전에 잘못된 행동을 걸러내는 것입니다. Typesafe의 JEV API는 참고 형식(reference format)을 확립했으며, 공개 결정 지수(Decision Index) 분류에는 이미 70개 이상의 모델이 있습니다. 9월 30일, Cloudflare는 이 형식과 호환되는 심사 모델(judge model)을 발표했고, Stanford와 NVIDIA 팀들은 같은 계열의 모델들을 선보였습니다.
ZTC(Zero-Token Confidence, 토큰 없는 신뢰도)는 또 다른 방향을 제시합니다. 다른 AI에게
| Plano | JEV (외부 API) | ZTC | |
|---|---|---|---|
| 판단 정확도 (AUC) | 데이터 없음 | 0.7350 | 0.7289 |
| ... |
자주 묻는 질문
모델이 정말 오픈 소스인가요?
Darwin-180B-RSI는 Alibaba의 Qwen3.8-Flash-Next에서 파생되었으며 Hugging Face에 FINAL-Bench/Darwin-180B-RSI로 게시되었습니다. ExtractBench에서 사용된 변형은 FINAL-Bench/Darwin-180B-RSI-R3입니다.
누가 점수를 측정하고 기록하나요?
각 조직이 해당 벤치마크의 공식 평가 도구를 사용하여 측정하고 값을 기록합니다. 여기에 인용된 결과는 2026년 10월 기준 Hugging Face의 공식 기록에 해당합니다.
IFStruct에서 98.95%이고 100%가 아닌 이유는 무엇인가요?
2,000개의 프롬프트 중 하나가 아크(arnés)의 120초 읽기 제한을 초과하여 실패로 간주되었습니다. 따라서 이 수치는 보수적입니다. 추론 기능을 비활성화하면 동일한 모델은 89.7%까지 떨어지는데, 이는 추론 단계가 마지막 제약 조건 위반을 막아주는 부분이기 때문입니다.
ZTC가 JEV와 같은 판단 API를 대체하나요?
꼭 그렇지는 않습니다. ZTC는 JEV와 동등한 정확도를 달성하지만 지연 시간이 약 10분의 1에 불과하고 데이터를 외부로 전송할 필요가 없어, 격리된 네트워크 및 대용량 부하에서 이상적입니다. JEV는 모델과 독립적인 외부 심판자가 선호될 때 여전히 유용합니다.
이것이 제 에이전트 파이프라인에 도움이 되나요?
출력이 코드를 소비하는 경우(JSON, YAML, PDF 추출), IFStruct, ExtractBench 및 MDPBench는 바로 그러한 신뢰도를 측정합니다. 그리고 낮은 지연 시간으로 어떤 행동이 실행될지 또는 보류되어야 할지를 결정해야 하는 경우, 그것이 ZTC의 사용 사례입니다.
추가 자료
- Darwin-180B-RSI: Hugging Face 공식 랭킹 9개 분류에서 #1인 오픈 소스 언어 모델
- 모델:
huggingface.co/FINAL-Bench/Darwin-180B-RSI및 `huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기