
중국의 2.8조 파라미터 Kimi K3, Frontend Code Arena에서 Claude Fable 5를 능가 — 미국의 컴퓨팅 제한 속
요약
Moonshot AI가 2.8조 파라미터 규모의 오픈 웨이트 모델인 Kimi K3를 출시했습니다. K3는 Frontend Code Arena 벤치마크에서 Claude Fable 5를 능가하는 성능을 보였으며, 100만 토큰 컨텍스트와 네이티브 비전 기능을 갖추고 있습니다.
핵심 포인트
- 2.8조 파라미터 규모의 세계 최대 오픈 웨이트 모델 출시
- Frontend Code Arena 벤치마크에서 Claude Fable 5를 제치고 1위 기록
- 100만 토큰 컨텍스트 윈도우 및 네이티브 비전 기능 지원
- MoE 구조를 통해 토큰당 16개의 전문가 모델만 활성화하여 효율성 확보
베이징에 본사를 둔 Moonshot AI가 Kimi K3를 출시했습니다. 이 회사는 자사의 기술 블로그를 통해 이 2.8조 파라미터 (parameter) 모델을 세계 최초의 오픈 3T급 시스템이자 현재까지 가장 큰 규모의 오픈 웨이트 (open-weight) AI 모델이라고 설명했습니다. Moonshot은 K3가 전반적인 성능 면에서는 여전히 Anthropic의 Claude Fable 5와 OpenAI의 GPT 5.6 Sol에 뒤처져 있지만, 코딩 및 에이전트 (agentic) 벤치마크 전반에 걸쳐 Claude Opus 4.8 및 GPT 5.5를 포함한 회사의 평가 스위트 내 다른 모든 모델을 능가했다고 밝혔습니다. 이 모델은 100만 토큰 (token) 컨텍스트 윈도우 (context window), 네이티브 비전 (native vision) 기능을 갖추고 있으며, 토큰당 896개의 전문가 (experts) 중 단 16개(전체의 약 1.8%)만을 활성화합니다. 전체 가중치 (Full weights)는 7월 27일까지 공개될 예정입니다.
TH Premium으로 더 깊이 알아보기: AI 및 데이터 센터

(이미지 출처: Microsoft)
- 광학 (Photonics) 및 고속 데이터 이동은 차세대 AI 병목 현상입니다
- 데이터 센터 냉각 현황
- 대규모 AI 데이터 센터 구축이 에너지 공급을 압박하고 있습니다
- Ultra Ethernet: 미래의 데이터 센터 상호 연결 기술
Arena는 블라인드 개발자 테스트(blind developer testing)의 Frontend Code 평가에서 K3가 1,679점을 기록하며 Fable 5를 제치고 1위를 차지했다고 발표했습니다. API 가격은 캐시 히트(cache-hit) 입력 토큰 100만 개당 $0.30, 캐시 미스(cache miss) 시 100만 개당 $3, 그리고 출력 토큰 100만 개당 $15입니다. Kimi K2가 1년 전 입력 토큰 100만 개당 $0.60로 출시되었던 것과 비교하면, 캐시되지 않은 K3의 입력 비용은 5배 더 높습니다.
주요 뉴스: @Kimi_Moonshot의 Kimi-K3가 1679점을 기록하며 Frontend Code Arena에서 Claude Fable 5를 제치고 1위에 올랐습니다. 이는 Kimi-k2.6 대비 17계단 상승한 결과입니다 (#18 -> #1). Frontend 분야에서 Kimi-K3는 브랜드 및 마케팅(Brand & Marketing), 참조 기반 디자인(Reference-Based Design), 데이터 및 분석(Data & Analytics) 등 7개 도메인 중 6개에서 1위를 차지했습니다: https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp 2026년 7월 16일
Moonshot은 두 가지 구조적 변화 덕분에 Kimi K2 대비 스케일링 효율성(scaling efficiency)이 약 2.5배 향상되었다고 주장합니다. 그 변화는 하이브리드 선형 어텐션(hybrid linear attention) 방식인 Kimi Delta Attention과 레이어 간 정보 이동 방식을 변경하는 Attention Residuals입니다. 양자화 인식 학습(Quantization-aware training)은 지도 미세 조정(supervised fine-tuning) 단계부터 시작되며, MXFP4 가중치(weights)와 MXFP8 활성화 함수(activations)를 사용합니다. Moonshot은 광범위한 하드웨어 호환성을 위해 이 조합을 선택했다고 밝혔습니다. CNBC가 인용한 보고서에 따르면, Alex Liu가 이끄는 Bank of America 분석가들은 K3가 컴퓨팅 제한(compute constraints)에도 불구하고 대규모 사전 학습(pre-training)과 구조적 개선을 통해 중국의 플래그십 모델들이 여전히 비약적인 발전을 이룰 수 있음을 보여준다고 평가했습니다.
Moonshot의 커널 최적화(kernel optimization) 벤치마크는 Nvidia의 H200과, 블로그에서 회사명을 밝히지 않은 채 단지 "대안 벤더의 GPGPU"라고만 지칭한 하드웨어에서 실행되었습니다. K3가 처음부터 구축한 Triton 유사 컴파일러인 MiniTriton은 미국 수출 규정에 따라 중국에 판매되는 Ada 기반의 사양 축소 카드인 Nvidia L20에서 Triton과 비교되었습니다. Moonshot은 전문가 병렬(expert-parallel) 트래픽을 하나의 고대역폭 도메인 내에 유지할 수 있도록 64개 이상의 가속기로 구성된 슈퍼노드(supernodes)에서 K3를 서빙할 것을 권장합니다. 블로그는 H200 하드웨어가 어디에 있는지 밝히지 않았습니다. 미 의회는 지난 1월, 중국 기업들이 해외 클라우드 대여 허점을 통해 제한된 가속기에 원격 접속할 수 있었던 통로를 차단하는 법안을 통과시킨 바 있습니다.
한 사례 연구에서, K3는 단 한 번의 48시간 자율 실행(autonomous run) 동안 오픈 소스 EDA 도구와 Nangate 45nm 라이브러리를 사용하여 자체 아키텍처 기반의 나노 모델을 위한 시뮬레이션 추론 칩을 설계했습니다. 이 설계는 4mm² 이내에서 100MHz의 타이밍을 달성했으며, 146만 개의 표준 셀(standard cells)과 INT4 MAC 어레이를 포함했고, 시뮬레이션 디코드(decode)에서 초당 8,700개 이상의 토큰을 유지했습니다.
현재 발표된 모든 K3 수치는 Moonshot이 보고했거나 API 액세스를 통해 도출된 주장일 뿐이며, 7월 27일에 가중치(weights)가 공개되기 전까지는 검증될 수 없습니다. Anthropic은 지난 2월 Moonshot이 지식 증류 (distillation)를 통해 모델을 학습시키기 위해 340만 건의 Claude 교환 데이터를 사용했다고 비난했으며, 현재 K3의 벤치마크 결과는 해당 고소장에서 언급된 모델들과 불과 몇 포인트 차이 내에 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기