Kimi K3: 중국의 2.8조 파라미터 오픈 모델이 기준을 높이다
요약
Moonshot AI가 2.8조 파라미터 규모의 오픈 웨이트 모델인 Kimi K3를 출시했습니다. 이 모델은 극단적인 MoE 구조와 KDA, AttnRes 등 혁신적인 아키텍처를 통해 높은 효율성과 성능을 제공합니다.
핵심 포인트
- 2.8조 파라미터 규모의 MoE 모델로 896개 중 16개 전문가 활성화
- 100만 토큰의 컨텍스트 윈도우와 네이티브 비전 기능 탑재
- KDA 및 Attention Residuals를 통한 메모리 효율 및 생성 속도 향상
- Artificial Analysis 리더보드에서 GPT-5.6 Sol 등에 이어 3위 기록
- 2026년 7월 27일 오픈 웨이트로 공개 예정
2026년 7월 16일, 베이징에 본사를 둔 Moonshot AI가 Kimi K3를 출시했습니다. 이는 네이티브 비전 (native vision), 100만 토큰의 컨텍스트 윈도우 (context window), 그리고 대부분의 경쟁사보다 저렴한 가격 구조를 갖춘 2.8조 파라미터 오픈 웨이트 (open-weight) 모델입니다.
또한 이 모델은 Anthropic의 Claude Fable 5와 OpenAI의 GPT-5.6 Sol에 이어 Artificial Analysis 리더보드에서 3위를 기록했습니다 (Wikipedia 보도에 따르면).
이것은 단순히 "경쟁력에 근접한" 또 다른 오픈 모델이 아닙니다. 이것은 Moonshot이 2026년 7월 27일에 오픈 웨이트 (open weights)로 공개할 계획인 프런티어급 (frontier-class) 시스템입니다.
수치 (The Numbers)
Kimi K3는 전문가 혼합 (Mixture of Experts, MoE) 모델입니다. 896개의 전문가 중 토큰당 16개만 활성화됩니다. 이러한 희소성 비율 (sparsity ratio)은 MoE 기준에서도 매우 극단적입니다. 참고로, DeepSeek-R1은 256개의 라우팅된 전문가 중 8개(플러스 공유 전문가 1개)를 활성화합니다. Kimi K3는 896개 중 16개를 사용하는 구성을 통해 희소성을 더욱 극대화했습니다.
주요 사양:
- 총 파라미터 (Total parameters): 2.8조
- 활성 파라미터 (Active parameters): 약 16개 전문가 (896개 중)
- 컨텍스트 윈도우 (Context window): 1,000,000 토큰
- 비전 (Vision): 네이티브 멀티모달 (Native multimodal)
- 오픈 웨이트 (Open weights): 2026년 7월 27일까지
- API 가격 (입력, 캐시 히트 [cache hit]): $0.30 / 100만 토큰
- API 가격 (입력, 캐시 미스 [cache miss]): $3.00 / 100만 토큰
- API 가격 (출력): $15.00 / 100만 토큰
Kimi K3의 코딩 워크로드에서의 캐시 히트율 (cache hit rate)은 90%를 초과하며, 이는 대부분의 입력 토큰 비용이 $0.30/MTok임을 의미합니다.
Moonshot은 Kimi K2와 비교하여 스케일링 효율성 (scaling efficiency)이 약 2.5배 향상되었다고 주장하며, 이는 컴퓨팅 단위당 더 많은 지능을 얻을 수 있음을 의미합니다.
새로운 아키텍처: KDA 및 어텐션 잔차 (Attention Residuals)
Kimi K3는 이해할 가치가 있는 두 가지 아키텍처 변화를 도입했습니다.
**Kimi Delta Attention (KDA)**는 메모리 사용량을 줄이고 긴 컨텍스트 길이에서 생성 속도를 향상시키는 더 효율적인 어텐션 (attention) 메커니즘입니다. 이는 Kimi Linear (2025년 10월)에서 처음 도입되었으며 여기서 더욱 확장되었습니다. Moonshot은 인기 있는 추론 엔진인 vLLM에 KDA 호환 프리픽스 캐싱 (prefix caching) 구현을 기여했습니다.
**Attention Residuals (AttnRes)**는 표현(representations)을 균일하게 축적하는 대신 모델의 깊이 전반에 걸쳐 선택적으로 검색합니다. 모든 레이어가 선형 체인(linear chain) 형태로 이전 레이어 위에 구축되는 대신, AttnRes는 후기 레이어가 초기 레이어의 유용한 중간 표현(intermediate representations)에 직접 접근할 수 있도록 합니다.
또한 이 모델은 전문가 라우팅(expert routing)을 위해 분위수 균형(Quantile Balancing)을 적용한 Stable LatentMoE 프레임워크를 사용합니다. 896개의 전문가(experts)가 있는 환경에서는 라우팅 안정성이 최우선 과제가 됩니다. 분위수 균형(Quantile Balancing)은 라우터 점수(router-score)의 분위수로부터 전문가 할당을 직접 도출하여, 휴리스틱 업데이트(heuristic updates)와 민감한 하이퍼파라미터(hyperparameters)를 제거합니다. 이는 대규모 MoE 모델을 망가뜨리는 "일부 전문가는 과부하되고 다른 전문가는 유휴 상태로 남는" 문제를 해결합니다.
실제로 무엇을 할 수 있는가
공식 블로그 포스트에는 표준 벤치마크를 넘어서는 사례 연구가 포함되어 있습니다. 다음은 눈에 띄는 성과들입니다.
바닥부터 GPU 컴파일러 구축
Kimi K3는 MLIR 상의 자체 타일 수준 IR(tile-level IR) 레이어, 최적화 패스(optimization passes), 그리고 PTX 코드 생성 파이프라인을 갖춘 소형 Triton 유사 GPU 컴파일러인 MiniTriton을 구축했습니다. 루프라인 벤치마크(roofline benchmarks) 전반에서 MiniTriton은 특정 워크로드에서 Triton 및 torch.compile과 대등하거나 이를 능가합니다. 심지어 안정적인 수렴(convergence)과 함께 엔드투엔드(end-to-end) nanoGPT 학습을 지속할 수 있습니다.
GPU를 위한 작동 가능한 컴파일러를 바닥부터 작성하는 모델은 결코 사소한 일이 아닙니다. 이는 하드웨어 제약 조건, 메모리 계층 구조(memory hierarchies), 그리고 코드 생성 파이프라인을 동시에 이해해야 함을 의미합니다.
자체 아키텍처를 위한 칩 설계
단 한 번의 48시간 자율 실행 동안, Kimi K3는 자신의 아키텍처로 구축된 나노(nano) 모델을 구동하기 위한 칩을 설계했습니다. Nangate 45nm 라이브러리에서 오픈 소스 EDA 도구를 사용하여, 이 칩은 100 MHz에서 타이밍을 맞추고(closes timing), 1.46M 개의 표준 셀(standard cells)을 배치하며, 시뮬레이션에서 8,700 tokens/s 이상의 디코드 처리량(decode throughput)을 유지합니다. 이는 K3 자체를 실행하는 칩이 아니라 나노 크기 모델을 위한 아주 작은 추론(inference) 칩이지만, 자율적인 하드웨어 설계 능력을 입증합니다.
2시간 만에 물리 연구 재현
Kimi K3는 계산 천체물리학 (computational astrophysics)의 I-Love-Q 보편적 관계 (universal relations)를 재현했습니다. Kimi K3는 20개 이상의 논문을 검토하고, 전체 수치 파이프라인 (numerical pipeline)을 구현했으며, 300개 이상의 상태 방정식 (equations of state)을 평가하고, 출판된 공식의 불일치를 식별하였으며, 3,000줄 이상의 Python 코드를 생성했습니다. 인간 연구자라면 보통 이 작업에 1~2주가 소요되었을 것입니다.
자체 티저 영상 편집
Kimi K3는 56개의 소스 클립을 사용하여 자신의 출시 티저 영상을 직접 편집했습니다. 클립 선택, 모션 매칭 컷 (motion-matched cuts), 프레임 단위의 비트 동기화 (frame-accurate beat synchronization), 그리고 오디오 처리를 수행했습니다. Moonshot은 숙련된 편집자가 이 작업을 수행하는 데 1~2일이 걸릴 것으로 추정합니다.
벤치마크 성능
Moonshot은 K3의 위치에 대해 솔직합니다. 그들의 자체 블로그는 다음과 같이 명시합니다:
"전반적인 성능은 여전히 가장 강력한 폐쇄형 모델(proprietary models)인 Claude Fable 5 및 GPT 5.6 Sol에 뒤처지지만, Kimi K3는 우리의 평가 스위트 (evaluation suite) 전반에 걸쳐 프런티어 수준 (frontier-level)의 성능을 입증했으며, 테스트된 다른 모델들을 지속적으로 능가했습니다."
주요 벤치마크 결과 (모두 추론 노력 (reasoning effort)을 최대값으로 설정):
- DeepSWE (실제 소프트웨어 엔지니어링): mini-SWE-agent 하네스 (harness) 사용 시 67.3
- Terminal-Bench 2.1 (터미널 기반 에이전트 작업): Claude Fable 5와 경쟁 가능한 수준
- BrowseComp (웹 브라우징 정확도): 1M 컨텍스트 (context), 압축 없음 (no compaction) 기준 90.4
- Arena.ai Frontend Web Dev (프런트엔드 코딩): 모든 경쟁 모델을 능가
- GPU 커널 최적화 (GPU Kernel Optimization): Fable 5와 경쟁 가능한 수준이며, Opus 4.8, GPT-5.6 Sol, GPT-5.5를 능가
솔직한 한계점
Moonshot은 세 가지 한계점을 공개했는데, 이는 대부분의 연구소(labs)가 제공하는 것보다 더 높은 투명성을 보여줍니다:
-
사고 이력에 대한 민감도 (Sensitivity to thinking history). K3는 보존된 사고 이력 (thinking history)과 함께 학습되었습니다. 만약 에이전트 하네스 (agent harness)가 모든 과거 사고 내용을 다시 전달하는 데 실패하거나, 세션 중간에 다른 모델로 전환할 경우 생성 품질이 불안정해집니다. Kimi Code와 같이 검증된 하네스를 사용하십시오.
-
과도한 주도성 (Excessive proactiveness). K3는 모호한 상황을 마주했을 때 사용자를 대신하여 결정을 내립니다. 만약 귀하의 애플리케이션에 엄격한 경계가 필요하다면, Moonshot은 시스템 프롬프트 (system prompt)나 AGENTS.md에 명시적인 제약 조건을 설정할 것을 권장합니다.
-
눈에 띄는 UX 격차 (Noticeable UX gap). 벤치마크 상으로는 경쟁력이 있음에도 불구하고, Moonshot은 "Claude Fable 5 및 GPT-5.6 Sol과 비교했을 때 사용자 경험 (UX) 측면에서 눈에 띄는 격차가 있음"을 인정합니다.
이것이 의미하는 바
오픈 소스 AI의 격차는 계속해서 좁혀지고 있습니다. 2023년에는 오픈 모델이 폐쇄형 (proprietary) 모델보다 몇 달 뒤처져 있었습니다. 2025년에는 그 격차가 몇 주로 줄어들었습니다. 일부 관찰자들은 Kimi K3가 그 격차를 며칠 단위로 줄였다고 주장하지만, 이 평가는 어떤 벤치마크와 사용 사례를 가장 중요하게 여기느냐에 따라 달라집니다.
7월 27일에 가중치 (weights)가 공개되면, 충분한 하드웨어를 갖춘 사람이라면 (Moonshot은 슈퍼노드 구성에서 64개 이상의 가속기를 권장합니다) 프런티어급 (frontier-class) 모델을 로컬에서 실행할 수 있습니다. 그 외의 사용자들에게는 API 가격이 접근성을 높여줍니다. 캐시된 입력 (cached input)에 대해 MTok당 $0.30라는 가격은 매우 공격적입니다.
더 큰 이야기는 Moonshot이 스케일링 (scaling)에 대해 증명한 것입니다. 그들은 MoE 희소성 (sparsity)을 극한까지 밀어붙였고 (896개의 전문가 중 16개), 라우팅 안정성 (routing stability) 문제를 해결했으며, 아키텍처 효율성 (architectural efficiency)이 원시 파라미터 수 (raw parameter count)를 보완할 수 있음을 입증했습니다. K2 대비 K3의 2.5배 스케일링 효율성은 다음 반복 모델이 더 나아지기 위해 반드시 5조 개의 파라미터가 필요하지는 않음을 의미합니다. 더 나은 아키텍처가 필요할 뿐입니다.
이는 무한한 컴퓨팅 예산을 가지고 있지 않은 모든 이들에게 좋은 소식입니다.
출처:
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기