
오픈 모델이 이제 AI 토큰 트래픽의 63%를 처리합니다
요약
Mozilla의 보고서에 따르면 OpenRouter의 AI 토큰 트래픽 중 오픈 웨이트 모델이 차지하는 비중이 63%를 돌파했습니다. 비용 급감과 성능 동등성 확보가 주요 원인이며, 오픈 모델은 단순 비용 절감을 넘어 데이터 주권 확보의 수단으로 부상하고 있습니다.
핵심 포인트
- 오픈 웨이트 모델의 토큰 트래픽 점유율이 5% 미만에서 63%로 급증
- GPT-4급 성능 모델의 운영 비용이 36개월 만에 약 50배 감소
- 개발자의 79%가 오픈 모델을 사용하며 경제적 우위 입증
- 중국 및 동아시아 지역의 높은 오픈 소스 채택률과 데이터 주권 이슈
오픈 모델이 이제 AI 토큰 트래픽의 63%를 처리합니다
2년 전, 오픈 웨이트 (open-weight) 모델은 AI 생태계에서 가장 큰 모델 라우팅 (model-routing) 플랫폼인 OpenRouter를 통해 흐르는 토큰의 5% 미만을 처리했습니다. 오늘날 그 수치는 63%를 넘어섰으며, 계속 상승하고 있습니다. 7월 14일에 발표된 Mozilla의 첫 번째 State of Open Source AI 보고서는 그 증거를 제시했습니다. 토큰 수 기준 OpenRouter에서 가장 거래량이 많은 상위 5개 모델은 현재 모두 오픈 웨이트 (open-weight) 모델입니다. DeepSeek V4 Flash, Xiaomi의 MiMo-V2.5, Tencent의 Hy3 Preview, MiniMax M3, 그리고 Owl Alpha라고 불리는 스텔스 진입 모델은 Anthropic의 Claude 제품군을 포함하여 리더보드 상의 그 어떤 폐쇄형 (closed) 모델보다 더 많은 토큰을 공동으로 처리하고 있습니다.
차트와 임베디드 소스가 포함된 전체 버전은 ComputeLeap에서 확인하세요.
이것은 인기 투표가 아닙니다. 이것은 하루에 수십억 번 반복되는 구매 결정이며, 시장은 오픈 (open)을 선택하고 있습니다.
중요한 수치들
CTO Raffi Krikorian이 작성하고 950명 이상의 개발자 설문 조사와 플랫폼 텔레메트리 (telemetry)를 기반으로 작성된 Mozilla의 보고서는 이러한 구조적 변화를 실제 데이터로 보여줍니다.
비용의 붕괴가 핵심입니다. GPT-4와 동등한 성능을 가진 모델을 실행하는 비용은 2023년 중반 기준으로 100만 토큰당 약 20달러였습니다. 오늘날 동일한 성능의 비용은 약 0.40달러로, 36개월 만에 50배 감소했습니다. DeepSeek V4의 가격은 입력/출력 토큰 100만 개당 $0.55/$2.19인 반면, OpenAI의 o1은 $15/$60입니다. 90%의 성능 동등성 (capability parity) 기준에서 폐쇄형 (closed) 모델은 API 호출당 약 6배 더 많은 비용이 듭니다.
채택률 수치가 경제성을 입증합니다. AI 기능을 추가하는 개발자의 79%가 이제 오픈 모델을 사용하며, 폐쇄형 모델은 71%입니다. 절반의 개발자는 두 가지를 모두 사용합니다. 하지만 흥미로운 지점은 다음과 같습니다. 오픈 모델 팀 중 실제로 프로덕션에 도달한 비율은 51%에 불과한 반면, 폐쇄형 모델 팀은 63%입니다. 이 격차는 품질 문제가 아닙니다. 이는 툴링(tooling), 지원(support), 그리고 운영 성숙도 — 모질라가 '하네스(the harness)'라고 부르는 것 — 문제입니다.**
지리적 분할은 극명합니다. 중국 본토와 동아시아가 오픈 소스 채택률 89%로 선두를 달리고 있습니다. 남미와 서유럽만이 폐쇄형 모델의 채택이 오픈 모델을 초과하는 두 지역입니다. 지난 한 해 동안 12개의 새로운 국가 AI 전략이 발표되었고, 현재 47개국에서 핵심 워크로드에 대한 해외 처리(foreign processing)를 제한하고 있습니다. 오픈 모델은 단순한 비용 절감 수단을 넘어 주권(sovereignty)을 위한 수단이 되고 있습니다.
컨텍스트에서의 50배 비용 급증: 우버는 연간 AI 예산을 단 4개월 만에 모두 소진했습니다. 마이크로소프트는 토큰 청구가 부서 예산액을 소모하자 Claude Code 라이선스를 취소했습니다. 이것들은 관리 미숙에 대한 일화가 아닙니다. 이는 폐쇄형 모델 추론(inference)이 대규모에서 지속 불가능하게 만드는 가격 구조의 증상입니다. 비용 계산 방식 자체가 바뀌었습니다. 이제는 적게 지출할 것이 아니라, 더 많은 비용을 지불해야 할 이유를 입증해야 합니다.

'하네스(The Harness)'가 말해주는 실제 해자(Moat)에 대하여
모질라의 보고서에서 가장 중요한 개념은 모델이나 벤치마크가 아닙니다. 바로 '하네스'입니다. 만약 모델이 엔진이라면, 하네스는 그 엔진을 작동하는 차량으로 만드는 모든 것—메모리, 도구 연결(tool connections), 안전 제어 장치, 그리고 AI가 누군가를 대신하여 무엇을 할 수 있는지 결정하는 소프트웨어—을 의미합니다.
Mozilla의 데이터에 따르면, 모델 주변의 하네스 (harness)를 교체하는 것이 모델 자체를 교체하는 것보다 더 큰 성능 향상을 가져올 수 있습니다. Terminal-Bench 2.0에서 Anthropic의 자체 가중치 (weights)를 실행하는 제3자 스캐폴드 (scaffold)는 79.8%를 기록했습니다. 이는 동일한 가중치를 Anthropic의 자체 하네스와 함께 사용한 Claude Code의 58.0%와 대조적입니다. 즉, 도구 (tooling)만으로 21.8포인트의 격차가 발생한 것입니다. (연구소들이 하네스를 최적화할 수 있도록 허용한 Terminal-Bench 2.1은 그 격차를 약 3포인트로 좁혔으나, 이는 논점을 반박하기보다는 오히려 입증하는 결과였습니다.)
이는 추론 스택 (inference stack)을 선택하는 모든 이들에게 직접적인 시사점을 줍니다. 모델은 점점 더 가장 저렴하고 교체 가능한 구성 요소가 되고 있습니다. 여러분의 평가 프레임워크 (evaluation framework), 프롬프트 엔지니어링 (prompt engineering), 도구 오케스트레이션 (tool orchestration)인 하네스 (harness)야말로 차별화된 가치가 존재하는 곳입니다. 우리는 올해 초 왜 하네스 엔지니어링이 AI 모델보다 더 중요한지에 대한 분석에서 이러한 역학 관계에 대해 기술한 바 있으며, Mozilla의 데이터는 대규모 벤치마크를 통해 이 가설을 검증합니다.
수익의 역설: 물량은 얻고, 돈은 잃다
다음은 "오픈 모델이 승리하고 있다"는 서사가 가리고 있는 역설적인 해석입니다. 오픈 모델은 실제 AI 애플리케이션의 약 3분의 1을 구동하지만, 전 세계 AI 매출의 단 4%만을 차지합니다. 사용량이 매출보다 8배나 많은 이 비율은 성장 스토리 이면에 숨겨진 지속 가능성의 위기입니다.
오픈 모델 인프라로 흘러 들어가는 벤처 캐피털 (venture capital)은 실재합니다. Together AI는 최근 83억 달러의 기업 가치로 8억 달러 규모의 시리즈 C (Series C) 투자를 유치했으며, 연간 예약액 (annual bookings)은 11.5억 달러를 초과했습니다. Mistral은 전년 대비 20배 성장하며 약 4억 달러의 ARR (연간 반복 매출)을 보고했습니다. DeepSeek는 약 2.2억 달러의 ARR을 달성했으며 500억 달러 이상의 기업 가치로 74억 달러를 조달했습니다. 하지만 이러한 수치들도 폐쇄형 모델 (closed-model) 생태계의 매출 집중도에 비하면 여전히 미미한 수준입니다.
반대 의견 (Contrarian corner): 오픈 모델 (Open models)이 토큰 볼륨을 점유하는 이유는 반드시 더 뛰어나기 때문이 아니라, 더 저렴하기 때문입니다. 추론 (Reasoning), 긴 문맥 검색 (Long-context retrieval), 그리고 복잡한 에이전트 작업 (Complex agentic tasks) 측면에서는 여전히 폐쇄형 모델 (Closed models)이 앞서고 있습니다. Gemini 3의 멀티 니들 검색 (Multi-needle retrieval)은 1M 토큰에서 89%를 기록한 반면, DeepSeek V4-Pro는 41%에 그쳤습니다. 프로덕션 배포 격차 (51% 대 63%)는 기업들이 여전히 미션 크리티컬한 (Mission-critical) 워크로드에 대해서는 폐쇄형 제공업체를 신뢰하고 있음을 시사합니다. 만약 폐쇄형 모델이 고마진의 고위험 작업을 계속 가져가고 오픈 모델이 범용적인 (Commodity) 작업에만 집중된다면, 이러한 볼륨의 승리는 공허할 수 있습니다.
반론은 자명합니다. 성능 격차가 가속화되는 속도로 좁혀지고 있다는 점입니다. 폐쇄형과 오픈형의 격차는 2024년 1월 8.04%에서 2026년 3월 3.3%로 줄어들었습니다. 이번 봄, 가장 강력한 폐쇄형 모델은 종합 벤치마크에서 60점을 기록했고, 가장 강력한 오픈 모델은 54점을 기록했습니다. 1년 전만 해도 선두 오픈 모델의 점수는 22점에 불과했습니다. 이 추세가 유지된다면, 추론 및 긴 문맥 처리 능력에서의 동등함 (Parity)은 6개월에서 12개월 이내에 도달할 것이며, 비용 우위는 계속 유지될 것입니다.

중국 요인: 자선이 아닌 전략
오픈 모델 급증의 지리적 구성은 그 규모만큼이나 중요합니다. 중국의 오픈 웨이트 (Open-weight) 모델은 2024년 말 OpenRouter 토큰의 2% 미만에서 2026년 6월 기준 가장 많이 사용되는 상위 10개 모델 중 61%로 급증했습니다. 볼륨이 가장 높은 5개 모델 중 4개가 중국 모델입니다. 2년 전 오픈 웨이트 순위를 주도했던 Meta의 Llama는 시장 점유율이 1% 미만으로 하락했습니다.
이는 우연이 아닙니다. 중국의 "AI Plus" 이니셔티브(AI Plus Initiative)와 국가 5개년 계획(National Five-Year Plan)은 오픈 소스 AI를 국가 전략의 초석으로 취급합니다. DeepSeek, Moonshot (Kimi), Zhipu AI (GLM), Alibaba (Qwen), 그리고 MiniMax와 같은 연구소들은 허용적인 라이선스(permissive licenses) 하에 서구의 폐쇄형 제공업체보다 10~30배 저렴한 가격으로 프런티어급(frontier-class) 모델들을 출시하고 있습니다. Qwen 하나만으로도 2026년 1월에 Hugging Face 다운로드 10억 건을 돌파했으며, 현재 전 세계 모든 오픈 모델 다운로드의 50% 이상을 차지하고 있습니다.
HN 스레드에서 가장 많은 추천을 받은 댓글이 언급했듯이, 프런티어 모델은 "강점이자 동시에 부채(an edge and a liability) — 훈련 비용이 천문학적으로 비싸다"는 것입니다. 해당 스레드에서는 오픈 모델이 프런티어 AI 기업들에게 구조적인 위협이 될 것인지에 대한 진정한 불확실성이 드러났으며, 대부분의 참여자들은 명확한 승자를 선언하기보다는 성능(capability), 비용(cost), 접근성(accessibility) 사이의 절충점(trade-offs)을 인정했습니다.

Fable 5 사건: 통제가 중요한 이유
Mozilla의 보고서에는 오픈 모델의 정당성을 뒷받침하는 가장 날카로운 사례 연구 중 하나가 포함되어 있습니다. 2026년 6월, Claude Fable 5는 단 한 번의 정부 수출 명령 이후 전 세계적으로 서비스가 중단되었습니다. 금요일 오후 5시 21분에 사전 통보도, 지리적 타겟팅도, 점진적인 축소도 없이 모든 사용자의 접속이 차단되었습니다. Fable 5를 기반으로 프로덕션 스택(production stack)을 구축했던 모든 팀이 동시에 접속 권한을 잃었습니다.
이것이 바로 토큰 점유율 데이터가 추상화하여 가려버리는 단일 벤더 리스크(single-vendor risk)입니다. 당신의 모델이 API 호출 방식이라면, 당신의 모델은 타인의 정책 결정에 종속됩니다. "누가 AI 모델의 소멸 여부를 결정할 권한을 갖는가?"라는 Mozilla의 프레이밍(framing)이 울림을 주는 이유는 이 사건이 실제로 발생했기 때문입니다. 이는 이론적인 위험이 아닙니다. 실제 프로덕션 중단(production outages)을 초래한 기록된 사건입니다.
보고서에서 인용된 NTIA의 권고 사항은 오픈 가중치 (open weights)를 제한하기보다는 모니터링하는 것이며, 보안 문제는 하네스 계층 (harness-layer) 제어를 통해 해결 가능하다는 점을 언급하고 있습니다.

커뮤니티의 반응
Hacker News 토론 (386 포인트, 284개 댓글)은 실무자들이 직면한 미묘한 현실을 반영합니다. 가장 많은 추천을 받은 댓글은 프런티어 모델 (frontier models)은 "훈련 비용이 천문학적으로 비싸기" 때문에 오픈 모델이 Anthropic과 OpenAI의 비즈니스 모델을 약화시킬 것이라고 주장하며, 실제 가치는 모델을 결정론적 (deterministic)으로 만드는 하네스 (harness)에 있다고 말합니다.
하지만 해당 스레드가 일관되게 오픈 모델에 대해 낙관적인 것은 아닙니다. 여러 댓글 작성자들은 48GB RAM 설정임에도 불구하고 로컬 오픈 가중치 (open weights)가 실제 코딩 작업에서 여전히 Claude Sonnet보다 성능이 떨어진다는 점을 지적합니다. 다른 이들은 프런티어 기업들이 하드웨어 접근 제어를 통해 지배력을 유지할 것이라고 예측합니다. 이에 대한 반론은 다음과 같습니다. Meta와 다른 기업들이 남는 컴퓨팅 자원을 판매함으로써 하드웨어 비용을 범용화 (commoditize)할 것이며, RAM 가용성은 지수적 성장 패턴을 따른다는 것입니다.
X에서의 논쟁도 비슷한 이야기를 들려줍니다. Mozilla는 "AI 스택이 실시간으로 재편되고 있다"고 지적했으며, Jason Calacanis(좋아요 1,838개)는 실무자들의 정서를 다음과 같이 포착했습니다: "오픈 소스 (Open Source) 모델은 복리로 성장하고 있다. 프런티어 모델 (Frontier Models)은 정교해지고 있다." 이는 바로 어제 Kimi K3와 Thinking Machines의 Inkling이 24시간 이내에 출시되었을 때 우리가 목격한 것과 일치하며, 두 모델 모두 Opus 4.8 및 Fable 5를 대상으로 벤치마크를 수행했습니다.

기업의 계산: 리패트리에이션 (Repatriation)은 현실이다
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기