오픈 웨이트 (Open-weight) 모델 점유율 29%로 급증, 토큰당 가격은 정체
요약
2026년 6월 AI Gateway 데이터에 따르면 오픈 웨이트 모델의 토큰 점유율이 29%로 급증했습니다. 기업들이 비용 효율을 위해 저비용 모델과 고성능 프런티어 모델을 전략적으로 분리 사용하는 '라우팅 규율'이 정착되고 있습니다.
핵심 포인트
- 오픈 웨이트 모델 점유율이 4월 대비 약 3배 증가
- DeepSeek가 Google을 바짝 추격하며 시장 점유율 확대 중
- 비용 절감을 위해 작업 성격에 따른 모델 라우팅 전략 강화
- 저가형 오픈 웨이트 모델의 급격한 성장세 확인
AI Gateway Production Index — 2026년 7월
매달 우리는 프로덕션 애플리케이션과 AI 연구소(AI labs) 사이에서 수십조 개의 토큰을 라우팅하며, 오늘날 기업의 실제 AI 사용 현황을 파악하고 있습니다. 우리는 그 현황을 이곳에 공개합니다. AI Gateway에서 발행된 5월 및 6월의 Production Index 보고서를 확인하세요.
7월 지표는 2026년 6월에 수집된 AI Gateway 데이터를 보고합니다.
6월에는 토큰 볼륨(token volume)과 지출액이 각각 29%와 27%로 거의 동일한 속도로 성장한 반면, 토큰당 가격(price per token)은 안정적으로 유지되었습니다. 그 전 달에는 지출액이 볼륨보다 두 배 이상 빠르게 성장하며 평균 토큰 비용을 거의 20% 상승시켰습니다.
전체적인 시장 지출은 늘어났지만, 토큰당 지출이 늘어난 것은 아닙니다. 4월 이후, 오픈 웨이트 (open-weight) 모델은 전체 토큰 볼륨의 9분의 1에서 거의 3분의 1 수준까지 상승했으며, 게이트웨이의 평균 토큰 가격의 약 10분의 1 수준을 차지했습니다. 이것만으로도 토큰당 가격은 하락했어야 합니다. 하지만 6월에 저가형 볼륨이 증가함에 따라, 폐쇄형 웨이트 (closed-weight) 프런티어(frontier) 모델의 가격 또한 토큰당 약 12% 상승했습니다. 이들이 서로 상쇄되어 평균 토큰당 가격은 정체되었습니다.
이는 6월 보고서에서 기록된 라우팅 규율(routing discipline)이 이제 총계에서도 가시화되고 있다는 증거입니다. 즉, 볼륨이 큰 작업은 저비용 모델로 가고, 위험도가 높은 작업은 프런티어 모델에 머무릅니다. AI에 대한 투자는 여전히 빠르게 성장하고 있으며, 기업들은 모델 간의 지출 균형을 맞추는 데 더욱 전략적으로 접근하고 있습니다.
6월에 오픈 웨이트 (open-weight) 모델은 전체 지출의 4% 미만을 사용하면서 게이트웨이 토큰의 29%를 처리했습니다. 이는 전체 토큰의 거의 3분의 1을 차지하면서도, 비용 측면에서는 25분의 1에 불과하다는 것을 의미합니다.
오픈 웨이트 (Open-weight) 토큰 점유율은 4월 이후 거의 세 배로 증가했습니다. 이러한 물량의 대부분은 DeepSeek의 지속적인 성장 덕분이며, DeepSeek는 현재 Anthropic과 Google에 이어 게이트웨이(Gateway)에서 세 번째로 큰 토큰 공급원인 22.6%를 차지하고 있습니다. Google의 토큰 물량 점유율은 4월의 급증세가 잦아들면서 24%로 하락했으며, 이로 인해 DeepSeek는 2위와 단 2%p 차이로 추격하고 있습니다.
현재 기업 고객 8명 중 약 1명은 프로덕션 (Production) 환경에서 오픈 웨이트 (Open-weight) 모델을 실행하고 있습니다. 그리고 현재의 궤적을 고려할 때, 머지않아 특정 오픈 웨이트 연구소(Lab)가 AI 게이트웨이에서 물량 기준 두 번째로 큰 비중을 차지하게 될 것입니다.
가장 최근의 진입자는 이러한 패턴이 가속화되고 있음을 보여줍니다. Z.ai는 Opus 4.8 가격의 약 5분의 1 수준으로 장기적 에이전트 작업 (Long-horizon agentic work)을 목표로 하는 MIT 라이선스 오픈 웨이트 모델인 GLM 5.2를 출시했습니다. 6월 16일 API 가용성 확보부터 월말까지, 이 모델의 일일 토큰 물량은 약 50배 성장했습니다. 이 모델은 마지막 주에 토큰 기준 AI 게이트웨이에서 11위를 기록했으며, 단일 일 기준으로는 최고 7위까지 올랐습니다. 또한 출시 후 불과 2주 만에 해당 모델 제품군(Family)의 6월 토큰 중 76%를 차지했습니다. 이전에 우리가 기록했던 가장 빠른 제품군 내 이동 사례인 Gemini 3.1 Pro가 유사한 점유율에 도달하는 데 두 달이 걸렸던 것과 대조적입니다.
미국의 상위 4개 프런티어 (Frontier) 연구소는 6월 AI 게이트웨이 지출의 95%를 차지했습니다. Anthropic은 5월의 65%에서 하락한 32%의 토큰에 대해 지출의 61%를 차지했으나, 이는 4월 수치와 일치합니다. 또한 Anthropic은 실수가 비용으로 직결되는 가장 중대한 유스케이스 (Use cases), 즉 코딩 에이전트 (Coding agents), 백오피스 에이전트 (Back-office agents), 앱 생성 (App generation) 분야에서 지출의 72% 이상을 차지했습니다.
OpenAI의 토큰 점유율은 12.5%에서 10.3%로 하락한 반면, 지출 점유율은 13.3%에서 16.1%로 상승하여, 한 달 만에 시장 대비 토큰당 비용이 약 50% 상승했습니다. DeepSeek와 대조적으로, 고객들은 OpenAI에 더 적은 물량을 보냈지만 더 비용이 많이 드는 작업을 맡겼으며, 이러한 차이는 프로덕션 (Production) 데이터에서만 나타나는 분기점입니다.
AI 게이트웨이에서의 이미지 생성은 두 연구소 간의 경쟁 구도입니다. OpenAI의 GPT Image 제품군은 6월에 이미지의 53%를 생성했으며 이미지 지출의 52%를 차지했습니다. Google의 Nano Banana는 이미지의 거의 39%를 생성했으며 지출의 43%를 차지했습니다. 그 외 다른 제품군은 두 항목 모두에서 5%를 넘기지 못했습니다.
비디오 (Video)는 현재 중국 연구소들이 프리미엄 티어 (premium tier)를 점유하고 있는 유일한 모달리티 (modality)입니다. ByteDance의 Seedance는 생성된 비디오의 3분의 1만을 차지했음에도 불구하고 지출의 49%를 차지하며 선두를 달렸습니다. xAI의 Grok Imagine은 지출의 19%로 비디오의 42%를 생성했는데, 이는 DeepSeek가 텍스트 (text)에서 차지하고 있는 것과 동일한 볼륨 할인 (volume-discount) 위치입니다. Seedance, Kling, Alibaba의 Wan을 포함한 중국 연구소들은 비디오 지출액의 약 3분의 2를 차지했습니다. 이 카테고리는 초기 단계이므로, 이러한 점유율은 변동될 것으로 예상됩니다.
Anthropic은 텍스트 (text)를 선도하고, OpenAI는 이미지 (images)를 선도하며, xAI는 비디오 볼륨 (video volume)을 선도하고, ByteDance는 비디오 지출 (video spend)을 선도합니다. 모든 모달리티 (modality)에서 선도적인 모델을 실행하려면 최소 세 곳의 연구소를 가로지르는 라우팅 (routing)이 필요합니다.
Anthropic은 6월 9일에 Claude Fable 5를 출시했으며, 이는 빠르게 채택되었습니다. 단 4일 만에 Fable의 사용량은 Opus 4.8에 전송된 요청 100건당 22건까지 상승했습니다.
6월 12일, Fable 5를 대상으로 하는 미국의 수출 통제 지침 (export-control directive)이 발효되었고, Anthropic은 이를 준수하기 위해 액세스 (access)를 중단했습니다. 해당 모델은 그 달의 나머지 기간 동안 오프라인 상태로 유지되었습니다. 통제는 6월 30일에 해제되었으며 액세스는 7월 1일에 재개되었습니다.
이 분석은 2026년 6월까지의 Vercel AI Gateway로부터 수집된 익명화된 집계 라우팅 (aggregate routing) 데이터를 기반으로 합니다.
측정에 관한 몇 가지 참고 사항:
2026년 7월 요약
6월 데이터의 다른 내용들
-
AI Gateway 토큰 볼륨(token volume)은 전월 대비 성장했으며, 지출(spend)도 증가했습니다. 토큰당 가격은 5월에 거의 20% 상승한 이후 정체되었습니다.29% 27%
-
오픈 웨이트 (Open-weight) 모델이 게이트웨이 토큰의 [비율]을 차지하며, 4월의 11%에서 상승했습니다. 지출 측면에서는 [비율] 미만입니다. DeepSeek는 토큰 볼륨의 [비율]을 달성하며 3위를 기록했고 Google과 2% 포인트 미만의 차이를 보였으며, GLM 5.2는 출시 2주 만에 게이트웨이 볼륨 상위 모델에 진입했습니다.29% 4% 22.6%
-
Anthropic은 토큰의 [비율]에 해당하는 게이트웨이 지출을 차지했으며, 모든 고위험 (high-stakes) 유스케이스에서 [비율] 이상의 지출을 확보했습니다.61% 32% 72%
-
각 모달리티 (modality)마다 리더가 다릅니다. OpenAI의 GPT Image는 [비율]의 이미지를 생성하여, [비율]을 기록한 Google의 Nano Banana를 앞질렀습니다. 중국 연구소들이 비디오 지출의 [비율]을 차지한 반면, xAI의 Grok Imagine은 [비율]의 비디오를 생성하며 모든 모델 중 가장 많은 양을 기록했습니다.53% **39%**two-thirds 42%
-
Claude Fable 5는 6월 9일에 출시되었으며, 4일 만에 Opus 4.8의 요청 볼륨(request volume)의 [비율]에 도달했습니다. 미국의 수출 통제 지침으로 인해 해당 월의 남은 기간 동안 액세스가 중단되었습니다.22%
-
[비율]의 전체 토큰을 실행하면서 전체 지출의 14%를 차지했습니다. 백오피스 에이전트 (Back-office agents)는 게이트웨이에서 토큰당 가장 비용이 많이 드는 워크로드 (workload)입니다.
-
B2C는 그 반대로, 토큰의 43%를 차지하지만 지출은 26%에 불과합니다.B2B 유스케이스는 6월 토큰의 46%를 주도했지만 지출의 60%를 차지했습니다.
-
6월에 개인 비서 (personal-assistant) 토큰의 57%, 교육 (education) 토큰의 54%를 실행했으나, 코딩 에이전트 (coding agent) 토큰의 2% 미만을 차지했습니다.Google의 볼륨은 소비자 중심의 워크로드에 집중되어 있습니다.
-
각 팀이 자체적으로 가져오는 API 키를 통해 정규화된 뷰를 제공하기 위해 시장가 책정 (published list price)을 사용합니다. 지출 (Spend)
-
AI Gateway를 통해 라우팅되는 토큰을 계산합니다. 볼륨 (Volume)
-
, , 및 분류는 집계된 데이터입니다. 개별 팀이나 워크로드는 식별되지 않습니다. B2C__B2B__use-case
-
및 수치는 생성된 미디어(성공한 요청만 해당)를 계산하며, 토큰을 계산하지 않습니다. 이미지 및 비디오 모델은 토큰당 과금되지 않으므로, 점유율은 생성된 이미지와 비디오를 반영합니다. Image__video
-
두 가지 방식으로 측정됩니다. 볼륨 및 지출 점유율 (lab-share 차트)은 게이트웨이에서 자체 모델을 서비스하는 4개의 연구소(DeepSeek, MiniMax, Moonshot, Z.ai)를 집계하여 제공업체별로 분류합니다. 이는 보수적인 수치입니다. 기업 도입 (enterprise-adoption) 수치는 모델별로 분류하며, Qwen, Gemma, GPT-OSS, Kimi와 같이 어떤 제공업체가 서비스하든 관계없이 오픈 웨이트 (open-weight) 모델을 포함합니다. Open-weight models
AI 투자는 계속 상승했으며, 평균 토큰 가격은 정체되었습니다
오픈 웨이트 (Open weight) 모델이 프로덕션 토큰의 거의 3분의 1을 차지했습니다
프런티어 연구소 (Frontier labs)가 지출의 거의 전부를 차지했습니다
각 모달리티 (modality)마다 리더가 다릅니다
미국 수출 통제로 인해 Claude Fable 5 출시 단 며칠 만에 중단되었습니다
이 보고서에 대하여
이전 보고서들
AI 자동 생성 콘텐츠
본 콘텐츠는 Vercel AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기