
Kimi K3가 1.56TB의 오픈 웨이트 (Open Weights)를 출시했습니다. 행운을 빕니다.
요약
Moonshot AI가 2.8조 개의 파라미터를 가진 초대형 오픈 웨이트 모델 Kimi K3를 HuggingFace에 공개했습니다. 1.56TB에 달하는 압도적인 크기로 인해 일반적인 로컬 환경에서의 구동은 사실상 불가능하다는 기술적 분석을 담고 있습니다.
핵심 포인트
- Kimi K3는 2.8조 파라미터 규모의 역대 최대 오픈 웨이트 모델임
- MoE 구조 특성상 모든 전문가(896개)를 VRAM에 로드해야 하는 메모리 한계 존재
- MXFP4 양자화 인식 훈련(QAT)을 통해 효율성을 도모함
- 현실적으로 개인 수준의 로컬 인프라에서는 구동이 매우 어려움
7월 27일, Moonshot AI가 약속을 이행했습니다. 전체 Kimi K3 가중치 (weights)가 HuggingFace에 공개되었습니다. 2.8조 개의 파라미터 (parameters), 96개의 샤드 (shards), 1.56 테라바이트 (terabytes). 이는 역대 출시된 가장 큰 오픈 웨이트 (open-weight) 모델로, 1.6조 개의 파라미터를 가진 DeepSeek V4-Pro보다 75% 더 큽니다.
30분 이내에 해당 모델 페이지는 HuggingFace의 트렌딩 리스트 1위에 올랐습니다. 한 시간 이내에 r/LocalLLaMA에는 모두가 생각하고 있는 질문을 던지는 3,000포인트 규모의 스레드가 생성되었습니다: 이걸 실제로 돌릴 수 있을까?
짧은 답변을 드리자면: 거의 확실히 불가능합니다. 그리고 이 사실은 아무도 말하고 싶어 하지 않는 오픈 웨이트 (open-weights) 운동의 핵심에 있는 긴장감을 드러냅니다.
우리가 7월 16일에 K3 발표를 다루었을 때, 가중치 (weights)는 여전히 약속 단계였습니다. 두 개의 연구소가 단 하루 만에 프론티어급 (frontier-class) 오픈 모델을 출시했고, 예측 시장은 하룻밤 사이에 중국의 AI 경쟁에 대한 가격을 재조정했습니다. 이제 가중치 (weights)는 실체가 되었고, 현실 점검이 시작됩니다.
아무도 듣고 싶어 하지 않는 VRAM 계산법
여기에 불편한 산술적 계산이 있습니다.
Kimi K3는 전문가 혼합 (Mixture-of-Experts, MoE) 모델입니다: 총 2.8조 개의 파라미터 (parameters), 896개의 전문가 (experts), 토큰당 16개의 활성 전문가, 추론 (inference) 중 1,040억 개의 파라미터 활성화. 이러한 MoE 희소성 (sparsity)은 효율적으로 들립니다 — 각 토큰에 대해 모델의 3.7%만 작동하기 때문입니다. 하지만 MoE에는 마케팅 자료에서 절대 언급하지 않는 추악한 비밀이 있습니다: 896개의 전문가 모두가 동시에 VRAM에 로드되어야 한다는 것입니다.
추론 (inference) 시점에 16개의 전문가만 페이지 인 (page in) 하고 나머지 880개는 디스크에 남겨둘 수는 없습니다. 라우팅 (routing) 결정은 연산 (compute) 시점에 발생합니다. 모든 전문가는 메모리에 상주하며 대기하고 있어야 합니다.
Moonshot은 MXFP4 가중치 (weights)와 MXFP8 활성화 (activations)를 사용하는 양자화 인식 훈련 (Quantization-Aware Training, QAT)을 통해 K3를 훈련했습니다. 이는 모델이 이미 파라미터당 약 4.49개의 저장 비트 (stored bits) 상태로 출시됨을 의미합니다. "그냥 4비트로 양자화하면 된다"는 일반적인 트릭은 이미 소진되었습니다. 가중치는 이미 실질적인 4비트 하한선에 도달해 있습니다.
⚠️ 양자화 배당금 (quantization dividend)은 이미 소진되었습니다. Kimi K3는 양자화 인식 훈련 (QAT)을 통해 MXFP4 (~파라미터당 약 4.49비트)로 네이티브하게 출시됩니다. 검증된 커뮤니티 구현이 없는 가상의 2비트 양자화 모델이라 할지라도 여전히 700GB를 넘을 것입니다. 2.8T 모델에 대해 "그냥 GGUF로 만들면 된다"는 식의 탈출구는 없습니다.
vLLM을 통한 추론을 위한 최소 VRAM 점유율은 1,680 GB입니다. 이 기준을 충족하는 구성은 다음과 같습니다:
| 구성 (Configuration) | 총 VRAM (Aggregate VRAM) | 시간당 대략적 비용 (Approx. Cost/Hour) |
|---|---|---|
| 8x NVIDIA GB300 (각 288GB) | 2,304 GB | $59–$142 |
| ... |
24시간 테스트 실행 비용은 $1,419에서 $3,840입니다. 한 달간 연속으로 서비스를 제공하는 비용은 $43,158에서 $116,800에 달합니다. 이것은 취미 활동가를 위한 모델이 아닙니다.
Unsloth의 역설
커뮤니티의 대표적인 양자화 전문 업체인 Unsloth는 출시 몇 시간 만에 Kimi K3 GGUF를 제작했습니다. 그들의 Q4 변체는 1.51TB입니다. 그들의 Q8 무손실 (lossless) 버전은 1.56TB로, Q4보다 단 50GB 더 큽니다.
이 수치를 다시 읽어보십시오. 4비트와 8비트 사이의 차이는 50GB입니다. 이는 1.5TB 모델에서 본질적으로 반올림 오차 수준에 불과합니다. 이것이 바로 양자화 인식 훈련 (QAT)이 하는 일입니다. 모델을 추가 압축을 해도 거의 얻을 것이 없는 지점까지 미리 압축해 두는 것입니다.
X의 한 개발자는 이 황당함을 완벽하게 포착했습니다. Kuber는 단 15분 만에 $4.43의 클라우드 연산 비용으로 Kimi K3 GGUF를 구축했습니다. MXFP4 형식이 변환을 매우 쉽게 만듭니다. 하지만 그가 언급했듯이: "슬프게도, 모델이 너무 커서 어떤 소비자용 하드웨어에서도 아직 실행할 수 없습니다."
파일을 구축할 수는 있습니다. 파일을 소유할 수도 있습니다. 하지만 파일을 실행할 수는 없습니다.
Delta Attention이 실제로 변화시키는 것
K3를 로컬에서 실행할 수 없다면, 가중치 (weights)가 공개되었다는 사실이 왜 중요할까요? 그것은 체크포인트 (checkpoint)보다 아키텍처 (architecture)가 더 중요하기 때문입니다.
Kimi Delta Attention (KDA)가 진정한 기술적 기여이며, 이는 여러분이 실행할 수 있는 모델들로 전파될 것입니다. 이것이 어떻게 작동하는지, 그리고 왜 중요한지에 대해 설명하겠습니다.
표준 트랜스포머 어텐션 (Standard transformer attention)은 전체 컨텍스트 윈도우 (context window)에 걸쳐 모든 키-쿼리 (key-query) 쌍을 계산합니다. 100만 토큰의 컨텍스트의 경우, KV 캐시 (KV cache)만으로도 수백 기가바이트의 VRAM을 소비할 수 있으며, 디코딩 (decode) 비용은 컨텍스트 길이에 따라 선형적으로 증가합니다. 모든 새로운 토큰은 모든 이전 토큰을 참조해야 합니다.
KDA는 이를 고정된 크기의 순환 상태 (recurrent state)로 대체합니다. 계속 커지는 KV 캐시 대신, 키 공간 (key space)을 값 공간 (value space)으로 매핑하는 d-by-d 행렬을 유지합니다. 핵심적인 통찰은 **델타 규칙 (delta rule)**입니다. 새로운 키-값 (key-value) 쌍을 메모리에 쓸 때, KDA는 먼저 메모리가 현재 해당 키와 연관시키고 있는 것이 무엇인지 쿼리한 다음, 예측 오차(prediction error) — 즉, 실제 값과 이미 저장된 값 사이의 차이 — 만을 기록합니다.
이는 쓰기 작업이 누적 (accumulation)이 아닌 할당 (assignment)처럼 동작함을 의미합니다. 상태는 커지지 않으면서도 정확하게 유지됩니다.
하지만 Kimi 팀의 구체적인 기여는 여기서 더 나아갑니다. 이전의 선형 어텐션 (linear attention) 연구 (Gated DeltaNet)는 단일 스칼라 망각 게이트 (scalar forgetting gate)를 사용했습니다. 즉, 모든 차원이 동일한 비율로 감쇠(decay)합니다. KDA는 **채널별 망각 (channel-wise forgetting)**을 도입합니다. 이는 특징 공간 (feature space)의 각 차원이 고유하고 독립적인 유지율 (retention rate)을 갖는 벡터 값 게이트 (vector-valued gate)입니다. 구문 단서 (Syntax cues)는 더 오래 지속될 수 있고, 노이즈가 있는 채널은 빠르게 감쇠됩니다.
실질적인 결과: 백만 토큰 (million-token) 컨텍스트에서 최대 6.3배 빠른 디코딩 (decoding). 최대 75%의 KV 캐시 (KV cache) 감소. 그리고 순환 상태 (recurrent state)가 고정된 크기이기 때문에, 컨텍스트 길이에 관계없이 디코딩 비용이 일정합니다. 즉, 1,000번째 토큰의 비용은 1,000,000번째 토큰의 비용과 동일합니다.
ℹ️ Kimi Delta Attention의 일정한 디코딩 비용은 백만 토큰 추론을 경제적으로 실행 가능하게 만드는 아키텍처적 원형 (architectural primitive)입니다. 이것이 없다면, 백만 토큰당 3달러/15달러의 API 가격으로 1M 컨텍스트 모델을 서비스하는 것은 재정적으로 불가능할 것입니다. 이 아키텍처가 가격을 보조합니다.
이 분야에서 가장 존경받는 ML 교육자 중 한 명인 Sebastian Raschka는 아키텍처를 분석하며 핵심적인 관찰을 내놓았습니다: K3는 본질적으로 2025년 Kimi Linear 모델을 480억(48 billion)에서 2.8조(2.8 trillion) 파라미터로 확장한 프로덕션 버전이라는 점입니다. 새로운 추가 사항은 LatentMoE로, 멀티 헤드 잠재 어텐션 (multi-head latent attention)과 유사하게 거대한 선형 레이어 (linear layers)를 압축하는 방식이지만, 아키텍처의 DNA는 이미 발표되고 재현 가능한 연구들로 거슬러 올라갑니다.
이것이 바로 여러분이 모델을 직접 다운로드하지 않더라도 오픈 웨이트 (open weights)가 가치 있는 이유입니다: 모든 아키텍처 세부 사항을 이제 조사할 수 있기 때문입니다. 연구자들은 KDA가 어떻게 확장되는지, 어텐션 잔차 (attention residuals, AttnRes)가 깊이 정보를 어떻게 연결하는지, 그리고 LatentMoE 전문가 (experts)들이 어떻게 초기화되는지를 정확히 추적할 수 있습니다. 차세대 7B 및 14B 모델들은 이러한 기술들을 물려받게 될 것입니다.
"아무도 이를 금지할 수 없다"는 주장이 무너지는 이유
오픈 웨이트 (Open Weights)를 옹호하는 가장 강력한 논거는 언제나 주권 (Sovereignty)이었습니다. 즉, 당신이 웨이트 (Weights)를 소유하고 있다면, 어떤 API 제공업체도 당신을 차단할 수 없고, 어떤 정부도 당신의 추론 파이프라인 (Inference Pipeline)을 금수 조치할 수 없으며, 어떤 서비스 약관 (Terms-of-Service)의 업데이트도 하룻밤 사이에 당신의 제품을 망가뜨릴 수 없다는 것입니다. Sayash Kapoor는 이를 정확하게 표현했습니다: "회복탄력성을 위한 우리의 개입은 첨단 AI가 희소하기보다는 풍부한 세상에 초점을 맞춰야 합니다."
하지만 주권은 단순히 파일을 저장하는 것이 아니라, 모델을 '실행'할 수 있는 능력을 요구합니다. 콜드 스토리지 (Cold Storage)에 놓인 1.56TB의 체크포인트 (Checkpoint)는 정치적 선언일 뿐, 배포 전략 (Deployment Strategy)이 아닙니다.
실질적인 계산을 고려해 보십시오:
- 단일 NVIDIA A100 (80GB)을 보유한 스타트업은 자신이 소유한 웨이트를 실행할 수 있습니다: K3의 0%를 실행하는 셈입니다.
- 8개의 H100을 보유한 자금력이 풍부한 팀은 K3를 서비스할 수 있습니다 — 단, 추론 (Inference) 비용으로만 시간당 160달러 이상을 지출하는 데 거부감이 없어야 합니다.
- 하이퍼스케일러 (Hyperscaler)는 K3를 범용 가격 (Commodity Prices)으로 서비스할 수 있습니다 — 이는 결국 "주권" 논거가 다시 클라우드 제공업체에 의존하는 결과로 돌아온다는 것을 의미합니다.
아이러니는 매우 짙습니다. Moonshot은 매출이 2,000만 달러 이상인 모델 서비스 (Model-as-a-Service) 기업이 별도의 계약을 협상하도록 요구하는 맞춤형 "Kimi K3 라이선스" 하에 K3를 출시했습니다. 웨이트는 공개되어 있지만, 상업적 조건에는 문지기가 있습니다. Artificial Analysis는 이를 "상업적 이용 제한 (Commercial Use Restricted)"이라고 지적했습니다 — 이는 MIT 또는 Apache 2.0 라이선스와는 의미 있는 차이가 있습니다.
⚠️ 반대 의견 (Contrarian take): "오픈 웨이트 (Open weights)"는 기술적 보증이 아닌 마케팅 카테고리가 되었습니다. 만약 이 웨이트를 서비스하기 위해 GPU 대여에 시간당 $60~$160가 필요하고, 라이선스 조건으로 매출 $2,000만 달러 이상 시 별도의 상업적 계약을 요구한다면, 폐쇄형 API (closed API)와의 실질적인 차이는 커뮤니티가 인정하고 싶어 하는 것보다 더 작습니다. 진정한 수혜자는 독립 개발자가 아니라 클라우드 추론 (cloud inference) 제공업체와 자금력이 풍부한 연구소들입니다.
커뮤니티의 실제 반응
3,090개의 추천과 593개의 댓글을 기록한 r/LocalLLaMA 스레드는 K3의 오픈 웨이트에 대한 가장 솔직한 평가를 담고 있습니다. 상위 댓글들은 주권 (sovereignty)을 축하하고 있지 않습니다. 그들은 산수를 하고 있습니다.
합의된 의견은 다음과 같습니다: K3는 연구용 결과물 (research artifact)이자 인프라 중심의 전략 (infrastructure play)이지, 로컬 추론 (local-inference) 모델이 아닙니다. 소비자용 하드웨어에서 모델을 구동하는 것을 중심으로 정체성을 형성해 온 커뮤니티는 소규모 데이터 센터를 요구하는 모델에 직면해 있습니다.
하지만 반응이 순수하게 부정적인 것만은 아닙니다. 여러 스레드에서는 API 경제성이 진정으로 파괴적이라는 점을 강조하고 있습니다:
- Together AI는 HuggingFace 추론 제공업체 (Inference Providers)를 통해 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15, 54 TPS로 K3를 서비스합니다.
- OpenRouter, Fireworks AI, Modal — 모두 48시간 이내에 K3 엔드포인트 (endpoints)를 발표했습니다.
- 90%의 캐시 히트 (cache hits)를 가정할 때, 혼합 비용 (blended cost)은 100만 토큰당 약 $3.46로 떨어집니다.
비교를 위해, Anthropic의 API를 통한 Claude Fable 5는 100만 토큰당 $15/$75로 구동됩니다. OpenAI를 통한 GPT-5.6은 $12.50/$50입니다. $3/$15인 K3는 극적으로 저렴하며, Artificial Analysis Intelligence Index에서 Opus 4.8과 유사한 57점을 기록했습니다.
감정적 반응
K3의 웨이트 출시(weight release)에 대한 가장 바이럴된 반응은 기술적인 것이 아니었습니다. 그것은 감정적이었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기




