오픈 모델 현황: 2026년 여름 관찰 내용
요약
2026년 오픈 모델 시장은 중국 연구소들이 대규모의 고성능 모델을 주도하며 빠르게 변화하고 있습니다. 이들은 미국보다 훨씬 큰 규모의 파라미터를 가진 모델을 출시하는 추세입니다. 반면, 하드웨어 기업들(AMD, NVIDIA 등)과 기존 빅테크 기업들도 오픈 모델 공개를 통해 시장에 참여하며 경쟁 구도를 형성하고 있습니다.
핵심 포인트
- 중국 연구소들이 미국보다 훨씬 큰 규모의 최신 오픈 모델을 주도함.
- 대규모 모델 구축이 차별화 요소가 아니게 되면서, 개발자 커뮤니티가 표준화를 이끌고 있음.
- 하드웨어 기업들(NVIDIA, AMD)은 오픈 모델 공개를 통해 반도체 판매 전략을 강화하고 있음.
- 미국 빅테크와 하드웨어 공급업체들도 소규모/임베딩 모델 등 다양한 방식으로 시장에 참여하며 성장 중.
HF 허브의 모델과 데이터셋은 매일 성장하고 있습니다. 공개 모델 저장소는 기간 동안 243만 개에서 296만 개로 증가했으며, 데이터셋은 711,000개에서 1백만 개로, Spaces는 1.00백만 개에서 1.44백만 개로 늘었습니다. 그 분포는 여전히 극단적입니다. 모델의 약 85.6%가 평생 다운로드 횟수가 200회 미만이며, 저장소의 1.5%가 전체 다운로드의 99.2%를 차지합니다. 모든 것은 이 모양 안에서 발생하고 있습니다.
1. 최전선은 빠르게 움직이고 있다
예전에는 명확한 발전 경로가 있었습니다. 연구소들은 작은 모델을 먼저 출시하여 점진적으로 규모의 상위 끝단으로 나아가는 식이었습니다. 하지만 2026년, 여러 중국 연구소들이 이러한 발전 과정을 완전히 건너뛰었습니다.
거의 매월 2026년 동안, 중국 연구소에서 나온 가장 크고 성능 좋은 오픈 모델은 미국 연구소가 출시한 어떤 모델보다도 큰 규모였습니다. 중국의 월별 최고치는 754B에서 2.78조 개의 파라미터 사이를 오갔습니다. 반면, 미국 모델들은 7개월 중 5개월 동안 130B 미만에 머물렀으며, 예외는 NVIDIA의 Nemotron 3 Ultra가 지난 5월과 6월에 각각 561B로 나온 경우와 Thinking Machines Lab의 Inkling이었습니다.
차트는 연구소들을 두 그룹으로 나눕니다. Moonshot, MiniMax, Xiaomi, Z.ai는 70B 미만의 모델을 거의 출시하지 않아, 개발자가 이들을 처음 접할 때 자신들이 소유한 어떤 장치에서도 실행하기에 너무 큰 모델이 됩니다. 반면 Tencent와 Alibaba Qwen은 1B 미만부터 전체 범위를 커버합니다.
첫 번째 그룹이 가능하게 만든 두 가지 요소가 있었습니다. 대규모 모델을 구축하는 것이 더 이상 차별화 요소가 아니게 된 것입니다. Xiaomi, Ant Group, Meituan 모두 올해 1조 개의 파라미터를 돌파했는데, 이들은 12개월 전 오픈 가중치(open weights) 분야에서 유명한 이름이 아니었습니다. 또한, 연구소는 접근성을 갖기 위해 더 이상 작은 모델을 출시할 필요가 없게 되었는데, 이는 커뮤니티의 양자화 레이어(quantization layer) 덕분이며, 이 의존성은 아래에서 다시 다루겠습니다.
이는 모델의 역량보다는 의지의 표명에 가깝습니다. 최첨단(frontier) 포트폴리오는 오직 벤치마크 위치와 API 수요에 모든 것을 걸고 있습니다. 전 범위(full spectrum) 포트폴리오는 개발자 커뮤니티가 표준화할 수 있는 기준을 제시하려는 시도입니다. 둘 다 합리적이며, 서로 다른 목표를 두고 경쟁하고 있습니다.
미국이 오픈 소스 분야에서 빠져있지 않습니다.
올해 가장 많은 새로운 오픈 모델을 발표하는 두 조직은 하드웨어를 제작하는 회사들과도 같습니다: AMD와 NVIDIA입니다. 이들은 각각 200개 이상의 새로운 모델 저장소를 공개하며, 이는 다른 분야를 크게 앞서나간 수치이며, LiquidAI가 약 100개로 세 번째를 차지했습니다. 하드웨어 공급업체들은 오픈 모델이 반도체를 판매하는 방법임을 깨달았습니다. 특정 하드웨어에 최적화되어 자유롭게 사용 가능한 모델은 해당 하드웨어가 작동한다는 가장 명확한 증거이기 때문입니다.
Google, Microsoft, IBM Granite, OpenAI의 구형 비전 및 음성 모델들이 매년 수억 건의 다운로드를 생성하는 것을 포함하여 소규모 모델과 임베딩(embedding) 모델을 고려할 때, 미국의 오픈 소스 AI는 성장하고 있습니다.
NVIDIA와 같은 더 많은 하드웨어 및 인프라 조직들이 경쟁력 있는 모델들을 학습시키고 공개하고 있습니다. NVIDIA의 Nemotron 모델군은 높은 성능을 자랑합니다. Meta와 같은 오랜 선두 주자들은 Meta의 Muse Glimmer를 통해 오픈 소스 기반을 재점화하고 있습니다.
최첨단 규모에서는, 올해 100B 파라미터 이상의 일부 미국 모델 공개는 중국 모델을 기반으로 하거나 Thinking Machines의 Inkling(952B)과 같은 중국 연구소의 결과물을 활용합니다. 주요 독자적인 미국 모델로는 NVIDIA의 Nemotron 3 Ultra (561B), Nemotron 3 Super (124B), 그리고 Arcee AI의 Trinity-Large (399B)가 있습니다.
AMD는 많은 변환 작업에 기여했습니다. 이 작업은 중요합니다: 이는 수조 개의 파라미터 모델이 미국 하드웨어에서 효율적으로 실행되도록 합니다. 이는 **배포 및 최적화 계층(distribution and optimization layer)**을 의미합니다.
한편, 중국의 오픈 모델들은 점점 더 중국 국내 칩에 최적화되고 있으며, 이는 거꾸로 된 동일한 경쟁입니다. 즉, 특정 하드웨어 생태계를 중심으로 모델이 설계되고 있습니다.
올해 누적 다운로드 기준으로 상위 25개 모델 저장소와 좋아요(likes) 기준으로 상위 25개 모델 저장소를 선정했습니다. 정확히 하나의 저장소만이 두 목록에 모두 나타납니다.
저희는 전체 수명 주기(lifetime)가 아닌 특정 기간 내 다운로드 수를 계산했기 때문에, 단순히 오래 존재했다는 이유만으로는 점수가 부여되지 않으며, 연령을 통제하는 것이 구분을 더 명확하게 만듭니다. 2026년에 발표된 모델 중 어느 것도 다운로드 상위 25개에 들지 못했으며, 25개 중 13개가 2022년산입니다. all-MiniLM-L6-v2는 7개월 동안 5,156개의 좋아요 대비 15억 5천만 번 다운로드되었고; Kimi-K3은 받은 좋아요당 약 60회 다운로드되었습니다.
이 두 수치는 서로 다른 행위를 기록합니다. '좋아요'는 특정 출시가 중요하다는 것을 의미하며, 새로운 모델이 배포된 후 몇 주 동안 최첨단(frontier) 모델에 집중됩니다. 반면 '다운로드'는 정기적으로 실행되는 파이프라인에 연결되어 사용된다는 것을 의미하며, 작고 안정적인 모델들에게 수년에 걸쳐 누적됩니다. 좋아요를 다른 것의 대리 지표로 삼거나 그 반대를 하는 것은 Hub 관련 보도에서 우리가 보는 가장 흔한 실수이며, 이는 저희 자체 이전 작업에도 포함됩니다. 이러한 구분은 발행사(publisher) 수준에서도 나타납니다.
중국의 최첨단 연구소들만이 Hub에서 큰 볼륨을 차지하는 계정입니다. 효과적으로 MiniMax의 2026년 다운로드 중 거의 전부가 70B 이상의 모델이며, Moonshot도 88%, DeepSeek도 55%, Z.ai도 39%가 그러합니다. 미국의 대형 계정들은 이와 같지 않습니다: Google, Microsoft, 그리고 IBM Granite은 2026년 다운로드 중 70B 이상인 모델이 거의 없으며, NVIDIA와 Meta는 각각 14%와 9%에 불과합니다.
이러한 차이는 총 다운로드 수에서 더욱 명확해집니다. Moonshot의 최첨단(frontier) 모델 포트폴리오는 연간 37M 다운로드를 기록한 반면, Qwen은 다양한 크기의 폭넓은 출시 전략을 통해 2,045M (파라미터 수를 선언한 리포지토리를 기준으로 하며, 모든 리포지토리를 포함하면 2,061M)에 달하는 다운로드 수를 기록했습니다. 이는 약 55배 더 많은 수치입니다. Qwen 3.8 Max의 2.4T 파라미터부터 27B와 같은 소형 변종까지 가족 모델을 지속적으로 확장하는 것은 다양한 사용 사례 전반에 걸친 커버리지에 초점을 맞추고 있음을 보여줍니다.
시간 또한 중요한 역할을 합니다. 대부분의 모델은 출시 후 급격한 사용량 감소를 경험하며, 이후 꾸준한 활동이 이어지는 긴 꼬리(long tail) 현상을 보입니다. 모델의 채택률은 주로 처음 몇 달 안에 결정됩니다.
이는 오늘날의 다운로드 볼륨이 가장 새로운 출시작에 의해서가 아니라, 시간이 지나면서 확립된 인프라 역할을 하는 소수의 모델들에 의해 주도되는 경우가 많다는 점을 설명해 줍니다.
만약 최첨단 모델들이 라이선스 비즈니스였다면, 가장 큰 규모의 출시작일수록 가장 엄격한 조건을 가질 것이라고 예상할 수 있습니다. 하지만 아래 데이터는 다른 이야기를 보여줍니다.
올해 20B 파라미터 이상인 중국어 출시작 178개 중 59%가 Apache 2.0을, 22%가 MIT를 채택하고 있으며, 거의 어떤 것도 비상업적 제한(non-commercial restrictions)을 포함하지 않습니다. 하지만 최근 몇 주 동안, Kimi K3와 Qwen 3.8 2.4T 같은 정말 큰 모델들에서 라이선스에 일부 비상업적 제한 및 수익 공유 요구 사항이 포함되는 변화가 나타나기 시작했습니다.
DeepSeek과 Z.ai는 평범한 MIT 라이선스로 7천억 개에서 1조 6,500억 개의 파라미터를 가진 모델을 출시합니다. 중국 연구소들은 가장 큰 규모의 모델들을 가장 작은 모델들만큼이나 관대하게 라이선싱하며, 이는 미국 연구소들이 자신들의 모델을 라이선싱하는 것보다 더 관대한 수준입니다: 같은 크기 범위에서 미국 측은 29%가 Apache 또는 MIT이며, 41%는 커스텀 조건(custom terms) 하에 있고, 30%는 아무것도 선언하지 않은 상태입니다.
이러한 출시가 어떤 목적을 위한 것이든 간에, 라이선스 수익은 아닙니다. 가중치(weights)는 가장 관대한 조건으로 공개됩니다. 수익은 다른 곳에서 나와야 합니다: API 및 클라우드 비즈니스, 하드웨어 및 플랫폼 포지셔닝, 또는 생태계 자체의 위치입니다. 예를 들어, Z.ai와 Kimi의 기업가치는 효과적인 오픈 소스 전략을 가리키며, 커뮤니티 내에서 견인력과 성장 기회를 얻고 있습니다. 하지만 앞으로 업계는 오픈 소스 채택으로부터 더 명확한 수익화 경로로 이동할 가능성이 높습니다.
모델의 생태계적 위치는 자체적인 출시만으로 정의되는 것이 아니라, 커뮤니티가 이를 기반으로 얼마나 많이 구축하는지에 의해 정의됩니다. 위에서 언급했듯이, Qwen은 주목과 채택을 얻고 있는 예외 중 하나입니다.
Hugging Face 데이터로 볼 때,
이 지표로 볼 때, Qwen은 오픈 모델 생태계에서 가장 큰 기반(foundation) 중 하나가 되었습니다. Qwen 기반 모델들은 허브(Hub)에 **151,448개의 파생 모델(derivatives)**을 차지하며, 이는 Meta의 전체 규모보다 2.6배, Llama 레포지토리보다는 4.7배 많습니다. Google이 82,506개 개의 파생 모델로 그 뒤를 따릅니다. 세 번째로 큰 출처는 Unsloth로, 양자화(quantized) 및 미세 조정 준비가 된 빌드를 게시하는 커뮤니티 계정이며, 이 중 다수는 Qwen 생태계를 더욱 확장합니다.
Qwen 파생 모델은 2026년 상반기 7개월 동안 매일 약 180~210개의 새로운 레포지토리가 증가했으며, 이는 채택이 개별적인 출시만으로 주도되는 것이 아님을 보여줍니다. Qwen은 개발자들이 어떤 모델을 미세 조정하고 배포할지 결정하는 기본 워크플로우의 일부가 되었습니다.
이러한 위치는 여러 요인들이 결합하여 만들어졌습니다. 첫째, 일관성입니다. Qwen은 간헐적인 플래그십 출시에 의존하기보다는 모델 패밀리를 지속적으로 업데이트하며 규칙적인 출시 주기를 유지해 왔습니다. 둘째, 커버리지입니다. 다양한 크기와 사용 사례 전반에 걸쳐 모델을 발표함으로써, 개발자들이 작고 로컬 환경에서 구동되는 모델이 필요하든 더 큰 배포 모델이 필요하든 동일한 생태계 내에 머무를 수 있게 합니다. 셋째, 개방성입니다. Apache 2.0 라이선스는 수정, 재배포 및 상업적 사용의 마찰을 줄여줍니다.
이러한 요인들은 서로를 강화합니다. 광범위한 모델 패밀리는 더 많은 개발자를 끌어들이고; 더 많은 개발자는 더 많은 파생 모델을 만들며; 이 파생 모델들은 미래 사용자들에게 생태계를 더욱 매력적으로 만듭니다.
이러한 위치는 주로 커뮤니티에 의해 구축되었습니다. 151,448개의 파생 모델은 Qwen 자체가 발표한 출시가 아니라 다른 개발자들이 만든 다운스트림 작업물입니다. Hub에 올라온 Qwen 모델의 28,531개 GGUF 변환본 중에서도 Qwen이 직접 발표한 것은 54개에 불과합니다.
파라미터 수를 명시하는 모델들 중에서, 1B 미만 모델들이 전체 다운로드의 83%를 차지하며, 100B 이상의 모델은 1%를 차지합니다. 2026년에 누적된 다운로드로 제한해도 아무것도 변하지 않습니다. 볼륨의 3%만이 70B 이상의 모델에 할당됩니다. 이는 이전과 같은 이유로 가장 깔끔하게 유지되고 있는 3월의 발견점입니다. 즉, 작고 작은 모델들이 실제로 대부분의 개발자가 보유한 하드웨어에서 구동될 수 있기 때문입니다.
그렇다면 일조(trillion-parameter) 규모의 모델이 어떻게 누군가에게 도달할 수 있을까요? llama.cpp를 통해서입니다.
2월에 ggml 팀은 Hugging Face에 합류했으며, 프로젝트는 완전히 오픈 소스이며 커뮤니티 주도적이고 기술적인 방향성 또한 유지하고 있습니다. 바뀐 점은 현재 로컬 추론에서 가장 중요한 프로젝트가 이제 지속 가능한 자원을 갖게 되었다는 것입니다.
llama.cpp 덕분에 천장이 움직였습니다. 7월 스냅샷에는 DeepSeek-V4-Flash의 약 284B 파라미터와 Kimi-K3의 약 2.8조 파라미터를 가진 GGUF 빌드가 포함되어 있습니다. 로컬 추론은 한때 노트북에서 구동되는 8B 모델을 의미했습니다. 이제는 몇 대의 일반 소비자용 기기에 분산된 일조(MoE) 방식의 수조 개 파라미터 모델을 의미하며, 이는 프런티어 모델이 작년에는 갖지 못했던 대체 경로이자 아예 프런티어 우선 출시 전략이 가능한 이유입니다.
그리고 그 경로는 Qwen에서 구동됩니다. 월 3960만 건의 GGUF 다운로드는 Gemma의 2080만 건보다 거의 두 배에 달하며, Llama의 750만 건보다도 다섯 배 이상 많습니다. Llama의 격차는 공급 문제가 아닙니다. Llama 기반의 GGUF 리포지토리가 Qwen보다 약간 더 많을 뿐입니다. 같은 선반 공간에서 5분의 1의 트래픽을 차지합니다.
모델 리포지토리는 지난 7개월 동안 21.5% 성장했습니다. 하지만 그 주변의 몇몇 것들은 훨씬 더 빠르게 성장했습니다.
gguf 라이브러리를 선언하는 리포지토리는 464%, lerobot은 194%, Apple의 mlx는 148% 증가하여, transformers와 peft가 각각 16%, diffusers가 21% 증가한 것과 비교됩니다. 모델링 코어는 대략 플랫폼 평균 수준으로 성장하고 있습니다. 모델이 물리적으로 로컬 추론 형식(Apple silicon, 로봇 제어 스택 등)에서 실행될 수 있는 지점을 결정하는 레이어가 그보다 세 배에서 일곱 배 더 빠르게 성장하고 있습니다.
가장 큰 10개 모델 패밀리를 통틀어, 이 모델들의 개발사들은 공식 GGUF 변환본을 매우 적게 발표합니다. 그럼에도 불구하고 GGUF 버전이 로컬에서 모델을 실행하는 개발자들에 의해 자주 사용되는 경우가 많습니다. 출시 시점에 공식 변환본을 제공하고, 양자화(quantization) 선택 사항을 문서화하며, 아티팩트에 서명하는 것은 제한적인 추가 노력만 필요합니다. 이러한 워크플로우를 내부적으로 유지하기보다는, 모델 개발사들이 Unsloth와 같은 기존 생태계 기여자들과 협력할 수 있습니다. 그렇게 함으로써 모델 제작자가 테스트한 가중치(weights)와 광범위한 커뮤니티가 채택하는 버전 간의 격차를 좁힐 수 있을 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기