Kimi K3 공식 출시: Moonshot의 2.8조 파라미터 MoE 아키텍처와 전략적 변화
요약
Moonshot이 2.8조 파라미터 MoE 아키텍처를 기반으로 한 Kimi K3를 출시했습니다. K3는 장기 컨텍스트 에이전트 코딩에 특화된 성능과 혁신적인 어텐션 기술을 통해 기존의 저가 전략에서 벗어나 고부가가치 시나리오 중심의 가격 전략으로 전환했습니다.
핵심 포인트
- 2.8T 파라미터 MoE 아키텍처 및 백만 단위 컨텍스트 윈도우 지원
- KDA 및 AttnRes 기술을 통한 추론 속도와 훈련 효율성 혁신
- 가성비 중심에서 특정 시나리오 가치 중심의 가격 전략으로 전환
- 장기 컨텍스트 에이전트 코딩 분야에서의 기술적 우위 확보
Kimi K3가 오늘 공식 출시되었습니다. Moonshot이 공식 발표한 이 모델은 2.8조(2.8T) 파라미터의 MoE (Mixture of Experts) 아키텍처, 백만 단위의 컨텍스트 윈도우 (Context Window), 그리고 네이티브 멀티모달 (Native Multimodal) 능력을 갖추고 있으며, 7월 27일에 모델 가중치 (Model Weights)를 공개할 예정입니다.
온라인상에는 이 모델이 여러 벤치마크 테스트에서 Fable을 능가했다는 목소리가 있으나, 공식 벤치마크 데이터 그래프를 살펴보면 이는 선택적인 해석에 근거한 결론임을 알 수 있습니다.
실제 상황은 이렇습니다. K3는 Terminal Bench 2.1에서 88.3점을 기록해 84.6점과 비교되었고, Automation Bench에서는 30.8점으로 29.1점과 비교되었으며, BrowseComp에서는 91.2점으로 88.0점과 비교되었습니다. 이러한 특정 에이전트 (Agent) 시나리오에서는 확실히 앞서 있습니다.
하지만 DeepSWE, FrontierSWE, GDPval-AA v2 Elo, AA-Briefcase Elo, CharXiv와 같이 더 종합적인 에이전트 지표에서는 Fable 5의 전반적인 성능이 여전히 더 안정적입니다.
K3는 전면적인 초월을 달성한 것이 아니라, 스스로 정의한 '장기 컨텍스트 에이전트 코딩 (Long-context Agent Coding)' 트랙에서 존재감을 드러낸 것입니다.
그러나 벤치마크 성능은 이 뉴스에서 가장 주목해야 할 부분이 아닙니다.
가장 가치 있는 정보는 가격 전략에 숨겨져 있습니다.
K3의 API 가격은 입력 100만 토큰 (Tokens)당 15달러로 책정되었습니다. 이 가격대는 GPT-5.5 및 Claude Opus 시리즈의 가격 구간에 해당하며, 이는 오픈 소스 모델의 저가 전략이 아닌, 최첨단 폐쇄형 (Closed-source) 모델의 가격 표준입니다.
하나의 중국 오픈 웨이트 (Open Weights) 모델이 전통적인 카드인 '저가 정책'을 스스로 포기한 것입니다.
Moonshot이 가격을 최첨단 모델 구간으로 끌어올린 것은, 우리가 가성비를 겨루는 것이 아니라 장기 주기 에이전트 코딩 시나리오에서의 가치 부합도를 겨루겠다는 신호를 공개적으로 전달한 것과 같습니다.
이러한 전환은 처음 있는 일입니다. 이전까지 중국 모델의 주류 노선은 강력한 성능, 낮은 가격, 그리고 오픈 소스를 더한 가성비 전략이었으며, K2 시리즈가 바로 그 경로를 따랐습니다.
K3는 완전히 다른 경로로 전환했습니다.
이 길은 더 이상 가성비 경로가 아니라 '시나리오 기반 가격 책정 (Scenario-based Pricing)' 경로입니다. 근본적인 논리가 완전히 바뀌었습니다. '내가 Fable보다 저렴하니 나를 선택하라'가 아니라, '장기 컨텍스트 에이전트 코딩이라는 특정 시나리오에서 나의 가치는 최첨단 모델의 가격을 지불할 가치가 있다'는 것입니다.
이 변화는 마케팅 용어의 업데이트가 아니라, 제품에 대한 자신감을 좁지만 가치가 높은 수직적 트랙 (Vertical Track)에 걸고 있는 것입니다.
그들이 이 트랙을 위해 준비한 기초 설계를 보면 알 수 있습니다.
두 가지 아키텍처급 혁신이 이 포지셔닝을 뒷받침합니다. KDA 혼합 선형 어텐션 (KDA Hybrid Linear Attention)은 백만 토큰 컨텍스트 환경에서 디코딩 속도를 최대 6.3배 향상시켰고, AttnRes 어텐션 잔차 (AttnRes Attention Residual)는 훈련 효율을 약 25% 향상시키면서 추가 비용은 2% 미만으로 억제했습니다.
이 두 가지 혁신은 단순히 기술을 과시하기 위한 서류상의 돌파구가 아닙니다. 각각 장기 컨텍스트 에이전트의 핵심 페인 포인트 (Pain Point)를 정확히 타격했습니다. Transformer 아키텍처는 백만 토큰 환경에서 추론 (Inference) 속도가 너무 느리고 훈련 비용이 너무 높습니다. KDA는 추론 속도 문제를 해결하고, AttnRes는 훈련 효율 문제를 해결합니다. 이 둘이 결합하여 해결하는 핵심 문제는 2.8T 파라미터 모델이 장시간의 기억과 다단계 반복이 필요한 에이전트 워크플로우 (Agent Workflow) 내에서 안정적으로, 빠르게, 그리고 통제 가능한 비용으로 작동할 수 있게 만드는 것입니다.
이것이 바로 그들이 가격을 최첨단 구간으로 올릴 수 있는 핵심적인 자신감의 근거입니다.
단순히 파라미터 규모가 커서 더 비싼 것이 아니라, 곧 주전장이 될 장기 컨텍스트 에이전트 코딩 트랙에서 그들의 아키텍처가 해당 시나리오에 맞춤 설계되었기 때문이며, 범용 아키텍처로는 동일한 효율을 낼 수 없기 때문입니다.
물론 이 도박에는 리스크가 존재합니다.
Fable 5는 여전히 많은 범용 에이전트 작업에서 더 안정적인 모습을 보이며, K3의 우위는 스스로 정의한 트랙 범위 내에 집중되어 있습니다. 만약 시장이 에이전트 코딩에 특화된 모델 카테고리에 비용을 지불하지 않는다면, 100만 토큰 출력당 15달러라는 가격은 장기적으로 유지되기 어려울 것입니다.
하지만 이 방향에 대한 판단은 옳습니다.
중국 AI는 지난 몇 년간 동일한 경로를 걸어왔습니다. 하드웨어의 제약이 아키텍처 혁신을 강제했고, 빠른 오픈 소스화를 통해 개방형 생태계로 반복 학습을 뒷받침했습니다. K2 시리즈가 이 경로의 작동 가능성을 검증했다면, K3는 이 모델을 업그레이드했습니다. 단순히 제한된 하드웨어에서 좋은 모델을 만드는 것을 넘어, 좋은 모델을 만든 후에는 가격 면에서도 최첨단 폐쇄형 모델과 동일한 출발선에 설 용기를 보여준 것입니다.
이는 에이전트 시스템을 구축 중인 개발자들에게 매우 실질적인 신호입니다.
7월 27일 가중치 공개 후, 당신은 진정한 최첨단 규모이자 장기 에이전트 시나리오를 위해 맞춤 설계된 베이스 모델 (Base Model)을 얻을 수 있습니다. 백만 컨텍스트와 KDA 가속의 지원을 받으며, SWE Marathon 42.0 우위, Automation Bench 30.8 우위를 점한 이 모델을 자신의 에이전트 기술 스택에 연결하여 자가 진화 워크플로우를 실행하거나, 장기 컨텍스트 증류 (Long-context Distillation)를 수행하고, 복잡한 인지 작업의 구조화된 출력을 완성할 수 있습니다. 이전에는 이런 일들을 하려면 폐쇄형 API의 비용이 너무 높거나, 오픈 소스 모델의 컨텍스트 길이와 속도가 따라오지 못했습니다.
K3는 최첨단 에이전트 코딩 능력, 백만 컨텍스트, 오픈 웨이트, 그리고 상업적 이용 가능성을 동시에 제공하는 첫 번째 선택지입니다.
마지막으로 요약하겠습니다.
Moonshot이 K3의 가격을 최첨단 구간으로 올린 것은 단순한 가격 결정이 아니라 명확한 포지셔닝 선언입니다. 중국의 오픈 웨이트 모델은 더 이상 단순한 가성비 대체품이 아닙니다. 그들은 자신들이 잘하는 분야에서 폐쇄형 최첨단 모델과 대등하게 경쟁하기 시작했습니다.
이 요구가 시장에서 받아들여질지는 7월 27일 가중치 공개 이후의 실제 적용 성과에 달려 있습니다.
하지만 한 가지는 매우 명확합니다. 장기 주기 에이전트 코딩이라는 트랙에서, 한 중국 기업은 자신의 제품이 더 이상 저가에 의존하여 시장을 확보할 필요가 없다고 믿고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @ayi_ainotes (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기