Kimi K3에 대한 수학적 분석: 15달러의 출력 가격이 비용의 전부가 아닌 이유
요약
Moonshot AI의 Kimi K3 모델 출시와 관련한 기술적 사실과 비용 구조를 분석합니다. 2.8조 파라미터 MoE 아키텍처의 실제 작동 방식과 오픈 웨이트 여부, 그리고 출력 토큰의 장황함이 실제 비용에 미치는 영향을 다룹니다.
핵심 포인트
- Kimi K3는 2.8T 파라미터 MoE 모델이나 오픈 웨이트는 아직 미출시 상태임
- 896개 전문가 중 16개를 활성화하는 구조로 실제 활성 파라미터는 공개되지 않음
- API 가격은 입력 3달러/출력 15달러(1M 토큰당)이나 캐시 히트 시 비용 절감 가능
- 모델의 높은 장황함(Verbosity)이 실제 사용 비용을 높이는 변수가 될 수 있음
Kimi K3는 7월 16일에 출시되었으며, 세 가지 주장이 즉시 함께 퍼지기 시작했습니다:
- "모든 토큰에 대해 2.8조 개의 파라미터(Parameters)를 전부 사용한다."
- "오픈 웨이트(Open weights)를 이미 사용할 수 있다."
- "백만 토큰당 3달러/15달러의 가격으로, 작업당 비용이 자동으로 더 저렴하다."
두 가지는 틀렸습니다. 세 번째는 불완전합니다.
저는 출시 당일에 Moonshot AI의 릴리스 노트(Release notes), API 가이드, 가격 페이지, 그리고 첫 번째 독립적인 측정값들을 읽으며 시간을 보냈습니다. 이 모델은 진정으로 흥미롭습니다. 하지만 마이그레이션(Migration) 결정은 출시 수치가 보여주는 것만큼 명확하지 않습니다.
요약 (TL;DR)
- 아니요, Kimi K3의 웨이트(Weights)는 현재 다운로드할 수 없습니다. Moonshot은 2026년 7월 27일까지 이를 출시할 계획이라고 밝혔습니다. 체크포인트(Checkpoint)와 라이선스가 실제로 나타나기 전까지, 그것은 약속일 뿐 완료된 오픈 웨이트 출시가 아닙니다.
- 2.8T 수치는 전체 용량이며, 토큰당 활성화된 파라미터 수가 확인된 것은 아닙니다. Moonshot은 자사의 MoE(Mixture-of-Experts)가 896개의 전문가 중 16개를 통해 각 토큰을 라우팅한다고 밝혔지만, 활성 파라미터(Active parameter) 수는 공개하지 않았습니다.
- 공식 API 비용은 캐시되지 않은 입력 토큰(Uncached input tokens) 100만 개당 3달러, 출력 토큰(Output tokens) 100만 개당 15달러입니다. 캐시 히트(Cache-hit) 입력은 100만 개당 0.30달러입니다.
- 숨겨진 변수는 장황함(Verbosity)입니다. Artificial Analysis는 평가 과정에서 약 1억 3천만 개의 출력 토큰을 측정했는데, 이는 유사한 모델들의 중앙값인 6천 3백만 개와 대조됩니다. 더 많은 출력은 매력적인 토큰 가격을 상쇄할 수 있습니다.
- 저는 긴 컨텍스트 코딩(Long-context coding), 연구, 멀티모달(Multimodal) 작업에 K3를 테스트해 보겠지만, 출력 제한(Output caps)과 작업 수준의 평가 없이는 이를 기본 경로로 설정하지는 않을 것입니다.
실제로 출시된 것
Moonshot AI의 공식 Kimi K3 발표는 2.8조 파라미터의 MoE(Mixture-of-Experts) 모델, 100만 토큰의 컨텍스트 윈도우(Context window), 네이티브 비전(Native vision), 도구 사용(Tool use), 그리고 kimi-k3라는 이름의 API 모델을 확인해 줍니다.
그것이 확인된 레이어입니다. 출시 당일의 몇몇 헤드라인들은 Moonshot이 하지 않은 주장들을 조용히 덧붙였습니다.
| 주장 | 내가 확인할 수 있었던 것 | 상태 |
|---|---|---|
| Kimi K3가 2026년 7월 16일에 출시됨 | 공식 발표 | 확인됨 |
| ... |
나는 그 차이점을 중요하게 생각하는데, 왜냐하면 "2.8T 오픈 모델"이라는 표현은 두 가지를 동시에 시사하기 때문입니다: 엄청난 활성 연산량 (active compute)과 즉각적인 셀프 호스팅 (self-hosting)입니다. 현재 가용한 정보로는 둘 다 도출할 수 없습니다.
2.8T 파라미터가 2.8T 활성 파라미터를 의미하지는 않는다
K3는 전문가 혼합 (Mixture-of-Experts, MoE) 아키텍처를 사용합니다. Moonshot은 각 토큰이 896개의 풀에서 16개의 전문가 (experts)를 활성화한다고 밝히고 있습니다. 또한 Kimi Delta Attention, Attention Residuals, 그리고 Stable LatentMoE 설계를 설명합니다.
Moonshot이 공개하지 않은 것은 토큰당 활성 파라미터 수 (active parameter count)입니다.
추론 비용 (inference cost), 메모리 트래픽 (memory traffic), 또는 로컬 서빙 (local serving) 요구 사항을 추정하고 있다면, 그 누락된 숫자가 헤드라인에 나온 총 파라미터 수보다 더 중요합니다. 공유 레이어 (shared layers), 전문가 크기 (expert sizes), 라우팅 세부 사항 (routing details), 그리고 아키텍처 오버헤드 (architectural overhead)가 아직 완전히 문서화되지 않았기 때문에, 전문가 비율 (expert ratio)만으로 그 숫자를 임의로 만들어내지는 않겠습니다.
여전히 유용한 하한선 계산법은 있습니다. 만약 2.8T 파라미터 전체가 정확히 4비트로 저장된다면:
2.8조 파라미터 x 4비트 / 8
= 1.4조 바이트
= 약 1.4 TB의 가중치 저장 공간 (raw weight storage)
이는 메타데이터 (metadata), 스케일 (scales), 런타임 버퍼 (runtime buffers), KV 캐시 (KV cache), 그리고 복제 (replication)를 고려하기 전의 수치입니다. Moonshot은 배포를 위해 64개 이상의 가속기 (accelerators)를 권장합니다. 체크포인트 (checkpoint), 양자화 (quantizations), 그리고 실제 서빙 보고서가 존재하기 전까지는 데스크톱급 로컬 추론 주장을 검증되지 않은 것으로 간주하겠습니다.
공식 가격은 단순하지만, 작업 비용은 단순하지 않다
공식 국제 API 가격은 세 줄로 구성됩니다:
| 토큰 카테고리 | Kimi K3의 100만 토큰당 가격 |
|---|---|
| 캐시 히트 입력 (Cache-hit input) | $0.30 |
| ... |
해당 요율을 적용하면 캐시되지 않은 입력 (uncached input)은 많은 프리미엄 프런티어 (frontier) API보다 낮고, 출력 (output)은 GPT-5.6 Terra와 동일한 리스트 가격을 형성합니다. 하지만 토큰당 가격은 청구서의 한 면일 뿐입니다.
나는 세 가지 기본적인 워크로드 (workloads)를 실행했습니다.
| 월간 워크로드 (Monthly workload) | 캐시 미사용 K3 비용 (No-cache K3 cost) | 명시된 캐시 혼합 사용 시 (With stated cache mix) |
|---|---|---|
| 10M 입력 + 2M 출력 | $60 | 캐시 히트(cache hits)에 따라 다름 |
| ... |
첫 번째 행은 명확합니다:
10M 입력 x $3/M = $30
2M 출력 x $15/M = $30
총계 (Total) = $60/월
매달 100M 입력과 20M 출력 토큰을 처리하는 팀의 경우, 자동 접두사 캐싱 (automatic prefix caching)이 결과를 변화시킵니다:
20M 캐시 미사용 입력 x $3/M = $60
80M 캐시 사용 입력 x $0.30/M = $24
20M 출력 x $15/M = $300
...
이것은 매우 유용합니다. 저는 이를 활용하기 위해 안정적인 프롬프트 접두사 (prompt prefixes)를 반드시 설계할 것입니다.
하지만 이제 출력 동작 (output behavior)을 추가해 보겠습니다. Artificial Analysis의 보고에 따르면, K3는 평가 과정 전반에 걸쳐 약 130M의 출력 토큰을 생성한 반면, 유사한 모델들의 중앙값(median)은 63M였습니다. 이것이 귀하의 워크로드에서도 동일한 비율이 나타날 것이라는 증거는 아닙니다. 다만 출력량(output volume)을 측정할 가치가 있다는 점은 증명합니다.
K3의 $15/M 출력 요율을 기준으로 할 때:
63M 출력 토큰 x $15/M = $945
130M 출력 토큰 x $15/M = $1,950
차이 (Difference) = 동일한 평가 규모 비교 시 $1,005
이것이 제가 완료된 작업당 비용 (cost per completed task)을 확인하기 전까지는 모델을 저렴하다고 부르지 않는 이유입니다. 토큰 생성량이 두 배인 모델은 토큰 요율이 경쟁력 있어 보일 때조차 더 많은 비용이 들 수 있습니다.
벤치마크 결과는 훌륭하지만, 불균형합니다
Moonshot의 출시 표(launch table)는 코딩, 터미널 사용, 웹 브라우징, 과학, 그리고 멀티모달 문서 이해 (multimodal document understanding) 분야에서 강력한 결과를 보고하고 있습니다. 이는 벤더(vendor)가 보고한 점수이며, 하나의 깔끔하고 독립적인 리더보드(leaderboard)가 아닙니다.
| 벤치마크 (Benchmark) | Kimi K3 | Moonshot이 보여준 최선의 비교 대상 | 출시 표 해석 (Launch-table reading) |
|---|---|---|---|
| DeepSWE | 67.5 | 73.0 | K3가 선두를 차지하지 못함 |
| ... |
저는 이것을 보편적인 순위로 변환하지 않을 것입니다. Moonshot의 자체 각주(footnotes)를 보면 모델들이 서로 다른 추론 모드 (reasoning modes)와 도구 구성 (tool configurations)으로 테스트되었음을 알 수 있습니다. 하나의 하네스 (harness)로 생성된 점수가 다른 하네스로 생성된 점수와 자동으로 비교될 수는 없습니다.
독립적인 관점에서의 수치는 더 제한적입니다. Artificial Analysis는 현재 K3에 대해 57의 지능 지수 (Intelligence Index)를 부여하고 있으며, 초당 약 62개의 출력 토큰 (output tokens)을 생성한다고 보고하고 있으며, 첫 번째 토큰까지의 시간 (time to first token)은 1.99초로 측정했습니다. 이러한 수치들은 제공업체가 서빙 (serving)을 최적화함에 따라 변할 수 있으므로, 저는 이를 영구적인 판결이 아닌 초기 기준점 (baseline)으로 보고 있습니다.
API 마이그레이션에는 몇 가지 까다로운 지점들이 있습니다
K3는 OpenAI 호환 API를 통해 사용할 수 있지만, 호환된다는 것이 "모델 문자열 하나만 바꾸고 끝내면 된다"는 의미는 아닙니다.
공식 퀵스타트 (official quickstart) 문서에는 다음과 같은 출시 제약 사항들이 명시되어 있습니다:
| 마이그레이션 이슈 | Kimi K3 동작 | 내가 변경할 사항 |
|---|---|---|
| 추론 제어 (Reasoning control) | 최상위 reasoning_effort; 현재 max만 작동함 | K2 스타일의 thinking 파라미터 제거 |
| ... |
다음은 제가 처음 2주 동안 사용할 라우팅 (routing) 결정 로직입니다:
def choose_kimi_k3(workload):
if workload["needs_downloadable_weights_today"]:
return "대기하십시오. 먼저 7월 27일 체크포인트와 라이선스를 확인하십시오."
...
또한 저는 max_completion_tokens를 고정하고, 성공적인 작업당 출력 토큰을 기록하며, 자동 캐싱 (automatic caching)이 작동할 수 있도록 안정적인 시스템/도구 접두사 (system/tool prefixes)를 유지할 것입니다.
만약 내가 오늘 AI 제품을 운영한다면
에이전트 (agent) 또는 코딩 제품의 경우: 대표적인 트래픽의 5%를 K3로 보내 작업 성공률과 재시도 (retries) 횟수를 비교하고, 총 입력 및 출력 토큰을 기록하겠습니다. 벤더 벤치마크 (vendor benchmark)의 승리만으로는 마이그레이션을 정당화하기에 충분하지 않습니다.
긴 문서 워크플로우 (long-document workflow)의 경우: 100만 토큰 전체 경로를 테스트하되, 검색 기준점 (retrieval baselines)을 포함하겠습니다. 거대한 컨텍스트 윈도우 (context window)는 모델이 적절한 근거를 신뢰할 수 있고 경제적으로 검색할 수 있을 때에만 유용합니다.
셀프 호스팅 스택 (self-hosted stack)의 경우: 7월 27일을 기다린 후, 실제 라이선스, 체크포인트 형식, 양자화 (quantizations) 및 서빙 요구 사항을 검토하겠습니다. 약속된 가중치 (weight) 공개는 곧바로 배포 가능한 결과물 (artifact)을 의미하지는 않습니다.
예산에 민감한 API 워크로드 (workload)의 경우: 저는 안정적인 프롬프트 접두사 (prompt prefixes)를 사용하고, 출력을 제한하며, 수락된 답변당 비용을 비교할 것입니다. 0.30달러의 캐시 히트 (cache-hit) 가격은 매력적이지만, 15달러의 출력 요금은 장황한 답변 (verbosity)을 비싸게 만듭니다.
기존 K2.6 배포 환경의 경우: 비용 연속성을 가정해서는 안 됩니다. Moonshot의 중국어 가격 페이지에 따르면, K3의 가격은 캐시 히트 입력 (cache-hit input), 비캐시 입력 (uncached input), 출력 토큰 (output tokens) 100만 개당 각각 RMB 2/20/100로 기재되어 있으며, 이는 K2.6의 RMB 1.10/6.50/27과 대조됩니다. 이는 해당 카테고리별로 대략 1.82배, 3.08배, 3.70배에 달합니다.
더 큰 그림
Kimi K3는 규모 (scale), 긴 컨텍스트 (long context), 멀티모달리티 (multimodality), 그리고 오픈 웨이트 (open-weight) 약속을 통해 프런티어 (frontier)에서 경쟁하려는 진지한 시도입니다. 또한 이는 모델 출시가 이제 여러 가지 서로 다른 질문들을 하나의 헤드라인으로 압축하고 있다는 점을 상기시켜 주는 유용한 사례이기도 합니다:
- 모델이 API를 통해 사용 가능한가?
- 가중치 (weights)를 실제로 다운로드할 수 있는가?
- 라이선스 (license)를 내 배포 환경에서 사용할 수 있는가?
- 모델이 내 워크로드 (workload)에서 승리하는가?
- 성공적인 작업당 비용이 더 저렴한가?
K3는 현재 첫 번째 질문에 답하고 있습니다. 향후 10일 동안 두 번째와 세 번째 질문에 대한 더 많은 답이 나올 것입니다. 네 번째와 다섯 번째 질문에 답할 수 있는 것은 오직 여러분의 평가 (eval)뿐입니다.
OpenAI와 호환되는 하나의 엔드포인트 (endpoint)를 통해 Kimi를 OpenAI, Anthropic, Google과 비교하고 싶다면, 그것이 바로 TokenMix가 하는 일입니다. 공개 사항: 저는 연구 측면에서 일하고 있습니다. 데이터가 인용된 전체 분석 내용은 원문 Kimi K3 리뷰에 있습니다.
결론
Kimi K3는 실재하며, 총 2.8T 파라미터 (parameter) 수는 공식적이고, 3달러/15달러 API는 활성화되었습니다. 활성 파라미터 (active parameter) 수는 공개되지 않았으며, 가중치는 사용 가능한 상태라기보다 약속된 상태이고, 초기 독립 테스트에 따르면 출력량 (output volume)이 이례적으로 높을 수 있다고 합니다.
저는 지금 바로 테스트해 보겠습니다. 하지만 헤드라인만 보고 운영 환경 (production)을 전환하지는 않을 것입니다.
여러분의 워크로드 (workload)에서 무엇이 더 중요합니까: 100만 토큰의 컨텍스트 윈도우 (context window), 0.30달러의 캐시 히트 (cache-hit) 요율, 아니면 출력의 장황함 (verbosity)을 제어하는 것입니까?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기