
GPQA Diamond에서 한국 1위를 차지한 모델은 24개의 GPU를 사용하는 스타트업의 결과물이며, 세계 3위에 올랐습니다
요약
스타트업 VIDRAFT의 Darwin-398B-JGOS 모델이 GPQA Diamond 벤치마크에서 한국 모델 중 1위, 세계 3위를 기록했습니다. 24개의 GPU를 사용하는 소규모 클러스터에서 진화적 병합(evolutionary merging) 방법론을 통해 글로벌 상위권 모델들을 앞질렀습니다.
핵심 포인트
- Darwin-398B-JGOS 모델이 GPQA Diamond에서 세계 3위 달성
- 24개의 GPU를 활용한 소규모 클러스터 기반의 성과
- 규모(Scale)보다 진화적 병합(evolutionary merging) 방법론의 중요성 입증
- DeepSeek, Qwen, Nvidia 모델보다 높은 추론 성능 기록
GPQA Diamond (대학원 수준의, "Google 검색으로 해결 불가능한" 과학적 추론)에서 가장 높은 점수를 기록한 한국 모델은 약 24개의 GPU를 운영하는 스타트업인 VIDRAFT의 Darwin-398B-JGOS입니다.
수치 (Base 모델 기준, 2026년 7월)
| 순위 | 모델 | 점수 |
|---|---|---|
| 1 | Kimi-K3 (CN) | 93.5 |
| ... |
오직 두 개의 중국 Frontier 모델만이 이 모델보다 높은 순위에 있으며, DeepSeek-V4-Pro, Qwen3.5-397B 및 Nvidia의 550B Nemotron-3-Ultra보다 앞서 있습니다.
한국의 격차
Sovereign-AI (주권 AI) 모델들은 뒤처져 있습니다: Solar-Open2-250B (86.3), A.X-K2 (85.6), K-EXA----ONE-2.0-750B-A37B (82.2). Darwin은 다음 순위의 한국 모델보다 약 4.6점 앞서 있습니다.
이것이 중요한 이유
GPQA Diamond는 웹 검색을 방어하므로, 점수는 암기가 아닌 추론 (Reasoning) 능력을 추적합니다. Darwin-398B는 소규모 클러스터에서 오픈 모델들의 **진화적 병합 (evolutionary merging)**을 통해 구축되었습니다. 즉, 규모(Scale)보다 방법론(Method)을 중시했음에도 불구하고 글로벌 상위권에 진입했습니다.
솔직한 범위
Base 모델 기준, 단일 벤치마크 스냅샷 (2026-07)입니다. 여전히 두 개의 중국 Frontier 모델이 앞서 있으며, GPQA 점수는 평가 설정에 따라 변동될 수 있습니다. 하나의 벤치마크가 전체 그림을 대변하지는 않습니다.
출처: GPQA Diamond (Idavidrein/gpqa). 더 보기: https://vidraft.net
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기