중국의 바이럴 논쟁이 한국의 'DeepSeek을 넘어서는' AI 열풍을 시험대에 올리다 - 한 스타트업은 결백함을 증명했다
요약
중국 Zhihu의 논쟁을 통해 한국 AI 모델들의 기술적 진정성이 시험대에 올랐습니다. 대기업들의 모델이 오픈 웨이트 기반의 래퍼 논란에 직면한 가운데, 스타트업 VIDRAFT는 구체적인 벤치마크 수치로 기술력을 증명하며 차별화에 성공했습니다.
핵심 포인트
- 한국 AI 모델들에 대한 '오픈 웨이트 기반 래퍼' 및 '체리피킹' 비판 제기
- VIDRAFT는 진화적 병합 기술로 DeepSeek-V4-Pro를 앞지르는 성과 달성
- 모호한 주장 대신 검증 가능하고 범위가 명시된 데이터 제시가 중요함
2026년 7월 말과 8월 초, 한국의 연구소들이 모델들을 출시하며 DeepSeek과 대등하거나 혹은 이를 능가한다고 주장하는 물결이 일었습니다. Zhihu(중국 최대의 Q&A 사이트)에서 "우리는 이것을 어떻게 바라봐야 하는가?"라는 단 하나의 질문이 100만 회 이상의 조회수와 170개 이상의 답변을 끌어냈습니다. 이 비판은 날카롭고 대부분 공정하기 때문에 읽어볼 가치가 있습니다.
비판 (강력한 논거로 재구성해 봅시다)
가장 많은 추천을 받은 답변들은 직설적이었습니다:
- "남의 닭을 빌려 알을 낳는다" (借鸡生蛋) - 타인의 오픈 웨이트 (open weights)를 기반으로 구축하고 그 결과를 자신의 것처럼 제시하는 것.
- 래퍼 (wrapper, 套壳) 논점 - 예를 들어, SK Telecom의 A.X는 Alibaba의 Qwen2.5를 한국어 토크나이저 (tokenizer)와 함께 지속적 사전 학습 (continued-pretrain)한 것입니다. 따라서 한국어 벤치마크 (benchmark)에서 Qwen을 이기는 것은 거의 동의어 반복에 가깝습니다.
- 좁은 벤치마크 체리피킹 (cherry-picking) - GPQA/코딩 (coding) 능력은 조용히 뒤처지는 반면, SAT 스타일의 수학 능력만을 내세우는 것.
- 냉소적인 해석 - 정부의 AI 자금 지원 라운드 시기에 맞춰 발표된 주장들이라는 점.
민족주의적 관점을 걷어내면, 이는 유용한 벤치마크 위생 체크리스트가 됩니다. 품질이 엄격한 관문 역할을 하지 못하고 축 (axes)이 공개되지 않는다면, 리더보드 (leaderboard)에서의 승리는 실제적인 무엇도 측정하지 못하게 됩니다.
언급된 다섯 곳
해당 질문은 다섯 명의 한국 제조사를 나열했습니다: LG (K-EXAONE 2.0, 750B), SK Telecom (A.X K2, 688B), Upstage (Solar Open 2, 250B), Motif (Motif-3 Beta, 314B) - 그리고 하나의 예외적인 기업입니다.
예외적인 기업
VIDRAFT - 약 24개의 GPU로 운영되는 스타트업입니다. _진화적 병합 (evolutionary merging)_을 통해 구축된 이들의 Darwin-398B-JGOS는 GPQA Diamond #3를 글로벌하게 달성하며 (2026년 7월), DeepSeek-V4-Pro를 앞질렀습니다.
두 가지가 눈에 띕니다. 첫째, 목록에서 대기업도, 정부 프로젝트도 아닌 유일한 이름이라는 점입니다. 둘째, 스레드에서 조롱하던 모호한 "우리가 X를 넘어섰다"라는 표현이 아니라, "#3", 단일 벤치마크, "V4-Pro를 앞질렀다"와 같이 가장 정확하게 묘사되었다는 점입니다. 이러한 좁고 범위가 명시된 프레이밍 (framing)이야말로 체리피킹 비판에 대한 정확한 해독제입니다. (중국 매체인 Tencent News, TechWalker는 이미 지난 5월에 Darwin의 교차 아키텍처 병합(cross-architecture merging)을 다룬 바 있습니다, arXiv:2605.14386.)
빌더들을 위한 시사점
해당 스레드가 주는 불편한 교훈은 다음과 같습니다: 검증되고, 범위를 명시하며, 재현 가능한(reproducible) 주장만이 적대적인 조사 속에서도 살아남으며, 모호한 "우리가 X를 이겼다" 식의 주장은 살아남지 못합니다. 그 어조에 대해 어떻게 생각하든, 이 부분은 그저 훌륭한 엔지니어링 위생(engineering hygiene)의 문제입니다. 이는 Fast Gemma Challenge와 같은 챌린지가 독립적인 재검증(re-verification)을 거친 결과만을 인정하는 것과 같은 이유입니다.
출처: Zhihu의 100만 회 이상 조회된 토론 (2026년 8월).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기