
Moonshot AI, 1.56T 파라미터 규모의 Kimi K3 출시, 2x B200 노드 필요
요약
Moonshot AI가 1.56조 파라미터 규모의 MoE 모델인 Kimi K3를 출시했습니다. 이 모델은 1561 GB의 거대한 크기를 가지며, 추론을 위해 최소 2개의 NVIDIA B200 노드가 필요합니다.
핵심 포인트
- 1.56조 파라미터 규모의 초대형 MoE 모델 출시
- 추론 시 최소 2x NVIDIA B200 노드 요구
- 학습 데이터 및 성능 벤치마크 미공개
- 중국 AI 모델 중 파라미터 수 기준 최대 규모
Moonshot AI가 1561 GB 규모의 1.56T 파라미터 MoE (Mixture-of-Experts) 모델인 Kimi K3를 출시했습니다. 공개된 벤치마크는 없습니다.
Moonshot AI는 1.56조(trillion) 파라미터 규모의 1561 GB 모델인 Kimi K3를 출시했습니다. 이 MoE (Mixture-of-Experts) 아키텍처는 추론 (inference)을 위해 최소 2x NVIDIA B200 노드를 필요로 합니다.
주요 사실
- 총 1.56조 파라미터.
- 1561 GB 모델 가중치 (weight).
- 최소 2x NVIDIA B200 노드 필요.
- Moonshot AI는 학습 데이터나 벤치마크를 공개하지 않았습니다.
- 파라미터 수 기준 가장 크게 공개된 중국 AI 모델입니다.
Moonshot AI가 1561 GB 무게의 1.56조 파라미터 MoE (Mixture-of-Experts) 모델인 Kimi K3를 출시했습니다. @_akhaliq에 따르면, 이 모델은 추론 (inference)을 실행하는 데 최소 2x NVIDIA B200 노드가 필요하며, 이는 현재까지 공개된 아키텍처 중 가장 큰 규모 중 하나입니다.
1.56조 파라미터 규모인 Kimi K3는 공개된 밀집 (dense) 또는 MoE (Mixture-of-Experts) 아키텍처 중 가장 큰 축에 속합니다. 1561 GB의 점유 공간은 8-bit 양자화 (quantization)를 적용하더라도 모델 크기가 780 GB를 초과함을 의미하며, 이는 이 모델을 확실한 멀티 노드 추론 (multi-node inference) 계층에 위치시킵니다. 비교를 위해, OpenAI의 GPT-4는 약 1.7조 파라미터로 추정되는 반면, Meta의 Llama 3.1 405B는 FP16에서 800 GB만 필요하며 이는 Kimi K3 무게의 대략 절반 수준입니다. 또 다른 MoE 모델인 DeepSeek의 V3는 총 6710억 파라미터이며 토큰당 370억 개의 파라미터가 활성화됩니다.
Moonshot AI는 학습 연산량 (compute), 데이터 혼합 (data mix), 또는 벤치마크 점수를 공개하지 않았습니다. 모델의 아키텍처 — 전문가(experts) 수, 토큰당 활성 파라미터 (active parameters), 컨텍스트 윈도우 (context window) — 는 명시되지 않은 상태입니다. 이러한 기술적 세부 정보의 부족은 파라미터 수가 실제 성능을 반영하는지, 아니면 총 파라미터가 활성 파라미터를 훨씬 초과하는 MoE 오버헤드 (overhead)를 반영하는지 평가하기 어렵게 만듭니다.
하드웨어 영향
2x B200 요구 사항은 야심과 비용을 동시에 시사합니다. 각 B200은 4.5 TB/s의 HBM3e 대역폭과 2.8 petaFLOPS의 FP8 연산 성능을 제공합니다. NVLink로 연결된 구성의 두 노드는 약 1.4 TB의 총 HBM을 제공하는데, 이는 1.5 TB의 모델 가중치(model weight)와 KV 캐시 오버헤드(KV cache overhead)를 감당하기에 간신히 충분한 수준입니다. 추론 지연 시간(inference latency) 및 처리량(throughput) 수치는 공개되지 않았으나, 초기 도입 사용자들은 사용 가능한 성능을 확보하기 위해 상당한 엔지니어링 노력이 필요할 것으로 예상해야 합니다.
이번 출시는 중국 AI 연구소들이 프런티어 규모(frontier-scale)의 모델을 밀어붙이는 광범위한 추세 속에서 이루어졌습니다. DeepSeek의 V3 및 R1 시리즈, ByteDance의 Doubao, 그리고 Alibaba의 Qwen 2.5는 모두 더 적은 파라미터로 경쟁력 있는 성능을 입증했습니다. Kimi K3의 거대한 규모는 원시 용량(raw capacity)을 극대화하려는 의도적인 전략을 반영할 수 있으나, 벤치마크 투명성이 없다면 비용과 능력 사이의 트레이드오프(trade-off)는 불투명한 상태로 남습니다.
핵심 요약 (Key Takeaways)
- Moonshot AI가 1,561 GB 규모의 1.56T 파라미터 MoE 모델인 Kimi K3를 출시했으며, 이는 2x B200 노드를 필요로 합니다.
- 공개된 벤치마크는 없습니다.
관전 포인트 (What to watch)

Moonshot AI가 MMLU, HumanEval, SWE-Bench와 같은 표준 평가(evals)에서 벤치마크 점수를 공개하는지 지켜봐야 합니다. 만약 Kimi K3가 MoE 오버헤드에도 불구하고 GPT-4급 모델과 대등하거나 이를 능가한다면, '비용을 불문한 규모 확장(scale-at-all-costs)' 접근 방식이 유효함을 입증하게 됩니다. 그렇지 않다면, 2x B200 요구 사항은 그에 상응하는 정확도 향상 없이 하드웨어 비용(hardware tax)만 발생시키는 결과가 될 것입니다.
_[28 Jul via the_decoder 업데이트]
Kimi K3의 아키텍처가 이제 확인되었습니다: 총 2.8조 개의 MoE (Mixture of Experts) 파라미터, 토큰당 16개의 활성 전문가를 포함한 896개의 라우팅된 전문가(routed experts), 그리고 100만 토큰의 컨텍스트 윈도우(context window)를 갖추고 있습니다 [The Decoder 인용]. Moonshot AI는 또한 모델 가중치(model weights)와 MoonEP, FlashKDA, AgentEnv를 포함한 인프라 도구들을 오픈 소스로 공개했습니다. 이 모델은 대중적인 벤치마크에서 GPT-5.6 Sol 및 Fable 5와 거의 대등한 성능을 보이지만, 독립적인 테스트 결과 사이버 및 수학 성능에서 상당한 격차가 발견되어 잠재적인 증류 (distillation) 우려를 불러일으키고 있습니다.
_ [28 Jul via the_decoder 업데이트]_
새로 출시된 Kimi K3 라이선스는 Moonshot의 이전 수정된 MIT 방식에서 벗어나, 이제 연간 매출이 2,000만 달러를 초과하는 모든
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기