2026년 AI 모델 지형 — 오픈 웨이트 (Open Weights), 국가 간 경쟁, 그리고 실제로 로컬에서 구동되는 모델
요약
2026년 7월 기준 오픈 웨이트 AI 모델의 지형을 분석합니다. Kimi K3, GLM-5.2, DeepSeek V4가 각 분야를 선도하고 있으며, 온디바이스 구동을 위한 경량 모델의 발전과 국가별 AI 전략 차이를 다룹니다.
핵심 포인트
- Kimi K3는 프론트엔드 코딩 분야에서 압도적인 성능을 기록함
- GLM-5.2는 높은 지능 대비 매우 경제적인 비용 효율성을 제공함
- 중국 기업들이 오픈 웨이트 전략을 통해 글로벌 시장을 주도함
- Qwen3.5-4B 등 경량 모델을 통해 스마트폰 기반 온디바이스 AI 구현 가능
빠른 답변: 2026년 7월 기준, 오픈 웨이트 (Open Weights) 계층은 세 갈래로 나뉩니다 — Kimi K3 (Moonshot, 2.8T MoE)가 프론트엔드 코딩을 선도하고, GLM-5.2 (Zhipu, 744B/40B MoE, MIT)가 오픈 웨이트 지능 지수에서 1위를 차지하며 가성비 모델로 꼽히며, DeepSeek V4가 순수 SWE-bench를 선도합니다. 온디바이스 (On-device)의 경우, Qwen3.5-4B와 Llama-3.2-3B-Uncensored가 스마트폰에서 구동됩니다. 이 기둥은 지리적/산업적 바퀴살들을 연결합니다. 다운로드하기 전에 배포된 웨이트 (Weights)를 확인하세요 — 날짜는 빠르게 변합니다.
교육적 면책 조항: 모델 지형은 빠르게 변화합니다; 아래 수치는 2026-07-28에 검증되었습니다. 특정 모델명은 몇 주 만에 구식이 될 수 있으므로, 이를 기반으로 구축하기 전에 다시 확인하십시오.
오픈 웨이트 리더 (2026년 7월)
Morph의 코딩 모델 비교 및 Artificial Analysis에 따르면:
| 모델 | 파라미터 (Params) | 코딩 (Coding) | 컨텍스트 (Context) | 라이선스 (License) | 웨이트 (Weights) |
|---|---|---|---|---|---|
| Kimi K3 | 2.8T MoE | #1 프론트엔드 아레나 93.4% | 1M | 수정된 MIT (실험용) | ~7월 27일 예정 |
| ... | |||||
| GLM-5.2 (Zhipu, 2026년 6월 16일 출시)는 가성비 모델입니다: 일부 호스트에서 입력(in) $1.10/M, 출력(out) $4.10/M 수준으로 — 선도적인 오픈 웨이트 지능을 위한 프론티어 (Frontier) 가격의 약 1/4 수준입니다 (Morph). Kimi K3 (Moonshot, 2026년 7월 16일)는 프론트엔드를 선도하지만, 웨이트가 ~7월 27일에 배포되기 전까지는 API 전용이었습니다 — 셀프 호스팅(Self-hosting) 전에 확인하십시오. |
국가 간 경쟁
- 중국 — Zhipu (GLM), Moonshot (Kimi), Alibaba (Qwen), DeepSeek. 오픈 웨이트 전략이 지배적이며, MIT/Apache 라이선스가 채택을 확대하고 있습니다.
- 미국 — 프론티어 폐쇄형 모델 (GPT-5.5, Opus-4.8); Meta Llama, Mistral을 통해 오픈 모델 제공.
- 인도 — 채택 및 인프라 성장 중 (India's AI Moment); 파운데이션 모델 (Foundation models)은 적지만, 강력한 애플리케이션 계층 보유.
관련 내용 확인: 국가별 AI 격차 (The AI Gap by Country), 국가별 AI 보고서 (Country-Wise AI Report).
당신의 하드웨어에서 실행되는 것
| 하드웨어 | 최적의 로컬 모델 | 양자화 (Quant) | 속도 |
|---|---|---|---|
| 스마트폰 8 GB | Qwen3.5-4B | Q4_K_M | 8–15 t/s |
| ... | |||
| 스마트폰 추천: Llama-3.2-3B-Uncensored (abliterated, ~2.2 GB) 및 Qwen3.5-4B (일관성 있음, 다국어 지원). |
Spoke: 검색 엔진 격차 (The Search Engine Gap)
모델이 노후화되었거나 컨텍스트(Context)가 부족할 때, AI 개요(AI Overviews)는 중요한 정보를 놓칩니다. 우리의 검색 엔진 격차 (Search Engine Gap) 기사는 왜 GEO (생성 엔진 최적화, Generative-Engine Optimization)에 명확한 H1 정체성과 구조화된 답변이 필요한지 다루며, 이는 바로 이러한 핵심 요소들이 수행하는 역할입니다.
Spoke: 산업 동향
- Nemotron 3 Ultra & 에이전트형 칩 설계 (Agentic Chip Design)
- Nvidia Cosmos 월드 모델 (World Model)
- Hugging Face vs Civitai
- 대체되는 것이 아니라 업그레이드되는 인간 (Humans Upgraded, not Replaced)
오픈 웨이트 (Open Weights)가 당신에게 중요한 이유
- 자체 호스팅 (Self-host) — 토큰당 비용이 발생하지 않으며, 데이터가 외부로 유출되지 않습니다.
- 고정 및 감사 (Pin & audit) — 버전을 직접 제어할 수 있습니다. API는 사용자의 통제 없이 변경될 수 있습니다.
- 미세 조정 (Fine-tune) — 자신의 데이터로 QLoRA를 수행할 수 있습니다 (자신의 데이터로 로컬 AI 튜닝하기 (Tune Local AI) 참조).
- 컴플라이언스 (Compliance) — 규제 대상 분야는 온프레미스 (On-prem) 환경이 필요하며, 오픈 웨이트가 이를 가능하게 합니다.
최신성 경고 (필독)
모델 이름은 몇 주 만에 구식이 됩니다. 이 글을 읽을 때쯤이면 K3 웨이트가 출시되었을 수도 있고(혹은 아닐 수도 있고), GLM-5.3이 존재할 수도 있습니다. 항상 다음 사항을 확인하세요:
- 웨이트가
단순히 리더보드만 보고 모델을 선택하지 마세요. 당신의 제약 조건(비용, 개인 정보 보호, 하드웨어, 라이선스)에 따라 선택하세요.
벤치마크 방법론 (하나의 수치를 믿지 마세요)
모델이 '승리'하는 것은 사용 사례와 일치하는 벤치마크에서만 가능합니다:
- SWE-bench Verified → 코드 생성 능력 (DeepSeek V4가 선두).
- Frontend Code Arena → UI 구축 (K3가 93.4%로 1위).
- Artificial Analysis Intelligence Index → 일반적인 오픈 웨이트 지능 (GLM-5.2가 1위).
- MMLU / GPQA → 지식/추론 (최첨단 모델이 여전히 앞서 있음).
커밋하기 전에 실제 작업 부하에 대해 10개 과제 미니 벤치마크를 실행하세요. 리더보드는 좁은 사용 사례에 대해서는 거짓말을 합니다.
라이선스 함정
'오픈 웨이트(Open weights)' ≠ '상업적 이용 무료'. 다음 사항을 확인하세요:
- MIT (GLM-5.2) → 상업적 사용 가능.
- 수정된 MIT(Modified MIT) (Kimi K3 라인) → 지역/제한 조항 확인 필요.
- Apache 2.0 (일부 Qwen) → 상업적 사용 가능.
- 커뮤니티 라이선스(Community license) (Llama) → 승인 없이는 수익 제한.
제품을 출시한다면, 반드시 라이선스를 읽으세요. '오픈'은 종종 '연구용 오픈'을 의미합니다.
추론 비용 표 (실제 수치, 2026년 7월)
| 모델 | 호스팅 시 $/M 토큰 | 자체 호스팅 (24GB VRAM) |
|---|---|---|
| GLM-5.2 | ~$4.10 (Morph) | 전력만 소비 (~₹500/월) |
| ... | ||
| 자체 호스팅이 볼륨 면에서 유리합니다. 하루 50k 토큰 기준으로, API 사용은 월 ₹1k–3k가 들지만, 귀하의 GPU는 매몰 비용 + 전력비입니다. |
다음 전망 (2026년 하반기 관찰 목록)
- K3 웨이트 출시 및 생태계 구축 (1M 컨텍스트 기반 에이전트).
- GLM-5.3 / Qwen3.6 업데이트.
- 추론 능력을 갖춘 3B–4B급 휴대폰용 모델 증가.
- 에이전트 전용 칩 설계 (Nemotron 3 Ultra) → 더 빠른 로컬 추론.
- 인도의 애플리케이션 계층 심화; 기반 모델은 여전히 부족함.
이 목록은 분기별로 재확인하세요. 이 분야는 문서보다 빠르게 움직입니다.
로컬 vs API — 최종 선택
| 요소 | 로컬 (오픈 웨이트) | API (최첨단) |
|---|---|---|
| 대규모 비용 | 저렴함 (자체 하드웨어 보유) | 토큰당 과금 |
| ... | ||
| 소유권/개인 정보 보호/비용을 위해 로컬을, 설정 없이 최대 추론 능력을 위해 API를 선택하세요. |
에이전트 전환(Agentic shift) (1M 컨텍스트가 중요한 이유)
2026년은 에이전트(agents)의 해입니다. 즉, 계획을 세우고, 도구를 호출하며, 몇 분 동안 루프(loop)를 돌며 작업하는 모델의 시대입니다. 이를 위해서는 긴 컨텍스트 (long context) (K3와 GLM-5.2 모두 1M 지원)와 코드/도구 사용 (code/tool use) 능력이 필요합니다. 4B 규모의 모바일 모델은 에이전트 역할을 제대로 수행할 수 없지만, 70B MoE 모델은 가능합니다. 사용 목적이 단순히 "질문에 답하기"라면 작은 모델로도 충분합니다. 하지만 "내 앱을 만들기"라면, 거대한 오픈 웨이트 (open weights) 모델이나 프론티어 (frontier) API가 필요합니다.
모델 크기 vs 품질 — 실제 곡선
- <3B: 채팅, 간단한 작업, 스마트폰용. 추론 (reasoning) 능력에서 품질이 저하됨.
- 7–8B: 데일리 드라이버 (daily driver), 우수한 RAG, 준수한 코드 능력.
- 70B MoE: 대부분의 작업에서 프론티어에 근접하며, 24GB VRAM (Q4)에서 구동 가능.
- 프론티어 (폐쇄형, closed): 새로운 추론 능력에서는 여전히 최고지만, 대여해서 사용해야 함.
2026년 셀프 호스팅 (self-host) 사용자들을 위한 "스윗 스팟 (sweet spot)"은 Q4 양자화된 70B MoE입니다. 데스크톱급 품질을 소비자용 하드웨어에서 구현할 수 있습니다. 스마트폰은 4B 수준에 머물 것입니다.
검증 방법 (기억이 아닌 출처 기반)
- 모델 표: Morph coding comparison (2026년 7월) + Artificial Analysis GLM-5.2 vs Qwen3-Max.
- 웨이트 (Weights) 날짜: Medium Kimi K3 vs GLM-5.2 (2026년 7월 16/17일).
- 온디바이스 (On-device) 선정: 자체 Termux/Ollama 테스트 (Ollama 0.30.10, 4B Q4, 8–15 t/s).
- 최신성 검증: 캐시된 텍스트가 아닌, 이번 세션에서 고유 명사들을 재확인함 (2026-07-28).
벤더 종속 (Vendor lock)의 위험
API는 가격, 속도 제한 (rate limit), 모델 단종 (deprecation), 서비스 약관 (ToS) 등이 변경됩니다. 만약 당신의 제품이 GPT-5.5에 의존하고 있는데 가격이 두 배로 뛰거나 새로운 조항이 추가된다면, 당신은 꼼짝달싹 못 하게 됩니다. 오픈 웨이트 (open weights) (특히 GLM-5.2와 같은 MIT 라이선스)를 사용하면 특정 버전을 고정하고 셀프 호스팅할 수 있어 예상치 못한 상황을 방지할 수 있습니다. 비즈니스 측면에서 이러한 회복 탄력성 (resilience)은 설정 비용을 지불할 가치가 있습니다.
이것이 인도의 빌더(builder)에게 의미하는 바
인도의 강점은 애플리케이션 계층 (application layer) (India's AI Moment)에 있습니다: UPI 규모의 배포력, 현지어 도달 범위, 그리고 비용 민감도입니다. 오픈 웨이트 (Open weights) (MIT GLM-5.2, Apache Qwen)는 인도의 빌더들이 저렴하게 자체 호스팅 (self-host) 할 수 있게 해줍니다. 즉, 달러로 청구되는 API 비용 없이 루피(rupee) 기반의 인프라를 사용할 수 있습니다. 15,000루피짜리 스마트폰에서 힌글리시 (Hinglish)를 서비스하는 4B 모델은 이곳에서 실험실 데모가 아닌 실제 제품이 됩니다.
격차: 인도 자체의 파운데이션 모델 (foundation models)은 거의 없습니다. 하지만 괜찮습니다. 오픈 웨이트를 기반으로 애플리케이션을 구축하고 미세 조정 (fine-tune) 하는 것이 실용적인 경로입니다. 우리의 자체 스택 (NIFTY 엔진, BTC 플로우) 또한 오픈 소스 (open-source)와 퍼블릭 API (public APIs) 위에서 구동되며 이 모델을 증명하고 있습니다.
FAQ
Q: 어떤 오픈 모델이 "최고"인가요?
A: 상황에 따라 다릅니다. 프론트엔드 (Frontend) → K3. 가치/지능 (Value/intelligence) → GLM-5.2. SWE-bench → DeepSeek V4. 온디바이스 (On-device) → Qwen3.5-4B.
Q: Kimi K3를 다운로드할 수 있나요?
A: 웨이트 (Weights)는 2026년 7월 27일경 출시 예정이었습니다. 확신하기 전에 HuggingFace에서 확인하십시오. 그때까지는 API로만 사용 가능합니다.
Q: 왜 그냥 GPT-5.5를 사용하지 않나요?
A: 최첨단 추론 (frontier reasoning) 능력이 필요하고 비용이나 로깅 (logging) 문제를 개의치 않는다면 괜찮습니다. 하지만 소유권, 비용, 개인정보 보호 측면에서는 오픈 웨이트가 승리합니다.
Q: 스마트폰에 가장 적합한 모델은 무엇인가요?
A: Qwen3.5-4B Q4 (2.7 GB) 또는 Llama-3.2-3B-Uncensored (2.2 GB)입니다. 둘 다 8 GB RAM에서 원활하게 채팅이 가능합니다.
Q: 모델이 루머가 아닌 실제인지 어떻게 확인하나요?
A: HuggingFace 또는 MODELSCOPE에서 실제 웨이트 (weights)와 다운로드 수를 확인하십시오. "Coming soon"은 출시 가능한 상태가 아닙니다. 우리의 기술은 루머를 출시된 것으로 오인하는 것을 교정 위험 (correction risk)으로 간주합니다.
Q: 에이전트적 작업 (agentic work)을 위한 하드웨어는 무엇인가요?
A: 70B MoE Q4를 구동하는 24GB VRAM 데스크톱 또는 최첨단 API (frontier API)가 필요합니다. 4B 스마트폰 모델은 에이전트 역할을 안정적으로 수행할 수 없습니다.
Q: 이것이 인도 빌더들에게 왜 중요한가요?
A: 오픈 MIT/Apache 웨이트는 달러 API 비용 없이 루피로 자체 호스팅할 수 있음을 의미합니다. 저가형 스마트폰에서 구동되는 4B 힌글리시 모델은 출시 가능한 제품입니다.
핵심 요약 (Key takeaways)
- 2026년 7월: K3 (프론트엔드), GLM-5.2 (가성비/지능), DeepSeek V4 (소프트웨어 엔지니어링, SWE)가 오픈 모델을 주도함.
- GLM-5.2는 MIT 라이선스이며 다운로드 가능하고, 프론티어 모델 가격의 약 1/4 수준 — 최고의 가성비 선택지.
- 중국이 오픈 웨이트 (Open-weights)를 주도하며, 인도는 애플리케이션 계층에서 강력함.
- 현재 스마트폰은 4B Q4 모델을 구동하며, 데스크톱은 70B MoE 모델을 구동함.
- 구축 전 반드시 웨이트 (Weights)와 라이선스를 확인하세요; 모델 명칭은 빠르게 구식이 됩니다.
- 리더보드가 아닌 제약 조건 (비용/개인정보 보호/하드웨어)에 따라 선택하세요.
- 분기별로 재검증하세요 — 기술 발전 속도가 문서보다 빠릅니다.
- 에이전트적 작업 (Agentic work)에는 1M 컨텍스트 (ctx) + 70B MoE가 필요하며, 벤더 종속 (Vendor lock)이 실제 API 리스크입니다.
- 인도의 강점 = 파운데이션 모델 (Foundation models)이 아닌 애플리케이션 + 오픈 웨이트 파인튜닝 (Open-weights fine-tune).
_작성자: Shakti Tiwari — Nifty 옵션 트레이더, XGBoost 전문가. optiontradingwithai.in에서 AI + 트레이딩 관련 내용을 다룹니다.re
도서: Option Trading with AI (B0H9ZNTBPK) | The AI Opportunity (B0HBBFKDQF)
거버넌스 노트 (Governance note, 연구 관리자 적용)
근거: Morph 코딩 모델 비교 (2026년 7월), Artificial Analysis의 GLM-5.2 vs Qwen3-Max, Medium의 Kimi K3 vs GLM-5.2 (2026년 7월). 빠르게 변하는 사실들 (웨이트 날짜, Ollama 0.30.10)은 기억이 아닌 2026-07-28에 검증되었습니다. 신선도 게이트 (Freshness gate)가 적용되었습니다: 언급된 모델들은 이번 세션에서 재확인되었습니다. 성능이나 트레이딩에 대한 주장은 없으며, 지형(landscape)만을 다룹니다. 프로모션 게이트 3 (Promotion Gate 3)는 주장되지 않았습니다 (백테스트가 아님).
소형 모델의 르네상스 (3B–4B 모델의 발전)
2026년의 조용한 이야기: 3B–4B 모델은 더 이상 장난감이 아닙니다. Qwen3.5-4B는 다국어 채팅을 처리하며, Llama-3.2-3B-Uncensored는 스마트폰에서 에블리터레이티드 (Abliterated) 상태로 실행됩니다. 70B 모델처럼 추론하지는 못하겠지만, 채팅, 요약, RAG, 그리고 힌글리시 (Hinglish) 지원을 위해서는 제품화가 가능한 수준입니다. 이것이 플래그십 GPU뿐만 아니라 수십억 대의 중급형 스마트폰에서 온디바이스 AI (On-device AI)를 실현 가능하게 만드는 요소입니다.
예산별 실질적 권장 사항
| 예산 | 설정 | 모델 |
|---|---|---|
| ₹0 (스마트폰) | Termux + Ollama | Qwen3.5-4B Q4 |
| ... | ||
| 당신의 루피(Rupees) 예산과 개인정보 보호 요구 사항에 맞는 행을 선택하세요. "최고"는 없으며, 오직 "당신에게 최선"인 것만 있을 뿐입니다. |
맺음말
2026년 모델 지형은 라이선스를 읽고, 가중치 (weights)를 검증하며, 모델을 하드웨어에 맞추는 빌더들에게 보상을 제공합니다. 오픈 웨이트 (Open weights) (GLM-5.2 MIT, Qwen Apache, DeepSeek open)는 소유권을 제공하며, 프론티어 API (frontier APIs)는 정점의 추론 (reasoning) 능력을 제공합니다. 두 가지를 의도적으로 사용하십시오. 그리고 이 페이지를 분기별로 다시 확인하십시오. 그때쯤이면 K3가 출시되었을 것이고, GLM은 업데이트되었을 것이며, 오늘의 "최고"는 지난 시즌의 것이 되어 있을 것입니다.
FAQ 부록
Q: K3 가중치를 기다려야 할까요, 아니면 지금 GLM-5.2를 사용해야 할까요?
A: 지금 GLM-5.2를 사용하십시오 (다운로드 가능, MIT). 만약 K3가 출시되었고 프론트엔드 (frontend)가 필요하다면 전환하십시오. 둘 다 MIT 방식이며 Modelfile에서 교체 가능합니다. "곧 출시 예정"이라는 말에 발목 잡히지 마십시오.
Q: 24GB VRAM에서 70B MoE를 구동하는 것이 실제로 가능한가요?
A: 네, 4분기(Q4)에는 가능합니다. 약 36~40GB의 원본 데이터가 양자화 (quantized)를 통해 약 20GB가 됩니다. 컨텍스트 여유 공간 (context headroom)과 함께 수용 가능합니다. 3090급 카드에서 30+ t/s의 속도가 나옵니다.
용어 사전 (요약)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기