
Moonshot AI, Kimi-K3 가중치 공개하며 OpenAI 및 Anthropic에 도전장 — 오픈 웨이트 (Open-weight)
요약
중국 Moonshot AI가 2.8조 개의 파라미터를 가진 Kimi-K3 모델의 가중치를 오픈 웨이트로 공개했습니다. 이 모델은 OpenAI와 Anthropic의 최신 모델에 필적하는 성능을 보이면서도 운영 비용은 훨씬 저렴한 것이 특징입니다.
핵심 포인트
- Moonshot AI, Kimi-K3 모델의 가중치 무료 공개
- OpenAI 및 Anthropic의 최신 모델과 경쟁 가능한 성능
- 기존 모델 대비 2~3배 저렴한 실행 비용 및 높은 캐시 효율성
- 오픈 웨이트 모델로서의 강력한 시장 도전장
드디어 비밀이 밝혀졌습니다. minty-fresh Kimi K3에 대한 블로그 포스트와 API 문서를 게시한 후, 중국 기업 Moonshot AI는 모델의 가중치(weights)를 무료로 공개하겠다는 약속을 이행했습니다. 이는 최신 AI GPU 랙을 보유한 사람이라면 누구나 몇 가지 제한 사항 내에서 이 모델을 실행하고 유료로 서비스할 수 있음을 의미합니다.
TH Premium으로 더 깊이 알아보기: AI 및 데이터 센터

(이미지 출처: Microsoft)
- 광학(Photonics) 및 고속 데이터 이동은 차세대 AI 병목 현상입니다
- 데이터 센터 냉각 현황
- 대규모 AI 데이터 센터 구축이 에너지 공급을 압박하고 있습니다
- Ultra Ethernet: 미래의 데이터 센터 상호 연결 기술
이는 Anthropic과 OpenAI를 포함한 거대 AI 기업들을 향한 매우 강력한 도전장입니다. 이들 기업의 최신 모델은 각각 Claude Fable과 GPT-5.6 Sol이며, Kimi K3의 성능은 Moonshot의 벤치마크(benchmarks)에서 이전 세대의 Claude 및 GPT를 직접적으로 능가하고 Fable 및 Sol을 바짝 추격하는 것으로 나타났습니다. 그러면서도 실행 비용은 약 2~3배 저렴해 보이며, 특정 쿼리가 캐시(cache)에 적중할 경우 최대 10배까지 저렴합니다. Moonshot은 회사가 테스트에 사용된 정확한 소프트웨어를 공개함에 따라, 지난주 발표된 벤치마크를 뒷받침하는 기술 보고서(technical write-up)를 제시했습니다.
추론 비용(inference cost) 비교와 관련하여, Moonshot은 자사의 비용이
결과적으로, 이는 Kimi K3의 최적화 덕분에 저사양 하드웨어에서도 실행하기가 특히 용이하다는 것을 의미할 수 있습니다. 하지만 Nvidia Blackwell이나 다른 MXFP 네이티브 실리콘(silicon)과 같은 장치에서 실행한다면, 제시된 벤치마크보다 훨씬 더 비용 효율적일 것이라는 추측 또한 충분히 합리적입니다. 이 추측을 확인하기 위해서는 더 공식적인 수치가 나올 때까지 기다려야 할 것입니다.
또한, Kimi K3는 기존의 계속 확장되는 키-값 (KV) 저장소 (KV store)를 사용하지 않고, 대신 Kimi Delta Attention이라고 불리는 고정 크기 상태 핸들러 (state handler)에 의존하며, 이 역시 이론적으로 VRAM과 실행 시간 모두를 절약합니다. 이 모델의 전문가 혼합 (MoE, Mixture-of-Experts) 구조는 896개 중 매 순간 16개만 활성화될 정도로 매우 희소(sparse)하며, 이는 추론 비용 절감에 더욱 기여합니다. 넓게 보면, Moonshot은 불필요한 오버헤드를 피하고 추론 비용을 낮추기 위해 추론의 모든 계층에서 최적화를 추구했습니다.
제대로 된 AI GPU를 갖춘 사람이라면 누구나 이제 직접적인 경쟁자가 될 수 있다는 점과, Kimi K3가 오픈 웨이트 (open-weight) 모델이라는 사실은 OpenAI와 Anthropic에 나쁜 소식이 될 수 있습니다. 이는
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기