
너의 이름은. - 2.8조 파라미터의 Open Frontier 모델 「Kimi K3」 혜성처럼 등장
요약
Moonshot AI가 2.8조 파라미터 규모의 MoE 아키텍처를 채택한 차세대 LLM 'Kimi K3'를 발표했습니다. 이 모델은 오픈 웨이트 모델임에도 불구하고 프론트엔드 코딩 및 SWE Marathon 벤치마크에서 Claude와 GPT를 능가하는 성능을 보여주며 주목받고 있습니다.
핵심 포인트
- 2.8T 파라미터 규모의 초거대 MoE 아키텍처 채택
- Frontend Code Arena에서 세계 1위 기록 (승률 76%)
- SWE Marathon 벤치마크에서 상용 최첨단 모델 상회
- 2026년 7월 27일까지 오픈 웨이트로 공개 예정
Fable 5, Kimi K3가 뒤바뀌고 있다!?
어디선가 들어본 듯한 코멘트입니다만, 2026년 7월 16일(현지 시간), 중국의 AI 스타트업인 Moonshot AI(月之暗面)는 자사의 차세대 플래그십 대규모 언어 모델(LLM)이 될 「Kimi K3」를 정식 발표했습니다.
본 모델의 캐치프레이즈는 "Open Frontier"입니다.
총 파라미터 수 2.8조(2.8T) 에 달하는 초거대 Mixture of Experts (MoE: 혼합 전문가) 아키텍처를 채택하고 있으며, 오픈 웨이트 모델(Open Weights Model, 2026년 7월 27일까지 웨이트 공개 예정)로서는 세계 최초의 「3T급」 프론티어 모델입니다.
본 기사에서는 Arena.ai의 Frontend Code Arena나 SWE Marathon을 비롯한 벤치마크 결과의 분석과, 이를 뒷받침하는 신기축 기술 아키텍처에 대해 기술적인 관점에서 해설합니다.
🚨 「유예 기간은 6개월에서 1년」―― 미국 AI 거물이 두려워한 패러다임 시프트의 도래
이 기사의 본론에 들어가기에 앞서, 현재 AI 업계의 파워 밸런스 격변에 대해 언급하지 않을 수 없습니다.
미국 Anthropic의 CEO인 Dario Amodei 씨는 2026년 봄에
중국의 AI 연구소가 미국의 최첨단 모델 성능에 따라잡기까지의 유예 기간은 불과 6개월에서 12개월에 불과하다
라고 강한 경계심을 나타냈었습니다. 서방 국가들이 수출 규제나 폐쇄적인 방벽을 쌓는 가운데, 그 타임리미트는 Amodei 씨의 예측을 상회하는 속도로 지금 「현실」이 되어 눈앞에 닥쳐왔습니다.
그 경계선을 완전히 파괴하러 온 것이 바로 이번 Kimi K3입니다.
📊 Kimi K3의 실력
Kimi K3 등장의 최대 토픽은 Claude Fable 5나 GPT-5.6 Sol에 필적하는 벤치마크입니다.
1. Frontend Arena에서 1위(1,679pt) 탈취
웹 프론트엔드 개발 블라인드 테스트(모델명을 숨긴 사용자 투표)에서 Kimi K3는 1,679pt를 기록하며, 지금까지 선두를 지키던 상용 폐쇄형 모델(Closed Model) 그룹을 제치고 세계 1위로 뛰어올랐습니다. Arena.ai의 Frontend Code Arena에서는 대전 상대 모델과의 페어와이즈 비교(Pairwise Comparison)에서 76%의 승률을 기록하며, Claude Fable 5(63%)나 GPT-5.6 Sol(58%)을 크게 따돌렸습니다.

출처: Arena.ai 「Frontend Code Arena」 (arena.ai/leaderboard/code)
2. SWE Marathon에서 상용 최첨단 모델을 능가
장시간에 걸친 자율적인 디버깅 및 코딩 태스크를 평가하는 「SWE Marathon」에서 Kimi K3는 스코어 42.0을 기록했습니다. 이는 미국 Anthropic의 「Claude Fable 5」나 미국 OpenAI의 「GPT-5.6 Sol」와 같은 현재의 폐쇄형 탑 러너(Top Runner)들을 상회하는 결과입니다.

출처: Moonshot AI 공식 기술 블로그 「Kimi K3: Open Frontier Intelligence」 (kimi.com/blog/kimi-k3). SWE Marathon은 vals.ai/benchmarks/programbench 준거.
Moonshot AI의 공식 발표에 따르면, 일반적인 종합 능력(General Capabilities)에 있어서는 여전히 GPT-5.6 Sol이나 Claude Fable 5에 한 발 뒤처지는 부분이 있다고 합니다. 하지만 위에서 언급한 바와 같이 상용 최첨단 모델을 넘어서는 성능을 보여주는 영역이 있다는 점은 특기할 만합니다.
🛠 기술 아키텍처: 2.8조 파라미터의 초효율 제어
총 파라미터 수가 2.8조에 달하는 한편, 추론을 실용적인 속도와 비용으로 유지하기 위해 Kimi K3에서는 아키텍처가 몇 가지 혁신되었습니다. 그 결과, 계산 자원당 스케일링 효율(Scaling Efficiency, 동일한 계산량에서 얼마나 많은 성능을 끌어낼 수 있는가)은 전 세대인 Kimi K2와 비교하여 약 2.5배 향상되었습니다.
🧬 1. Stable LatentMoE: 희소성(Sparsity)을 높인 MoE
Kimi K3는 MoE (Mixture of Experts / 혼합 전문가)를 채택하고 있으며, 896개의 엑스퍼트(Expert / 전문가 서브 네트워크)를 보유합니다. 다만, 1개의 토큰을 처리할 때 실제로 사용되는 것은 그중 16개뿐입니다.
즉, 모델 전체로는 2.8조 파라미터 분량의 지식을 축적하면서도, 1회 추론 시 계산에 관여하는 파라미터(Active Parameters / 활성 파라미터)는 극히 일부로 제한됩니다. 이를 통해 대규모 모델의 표현력과 현실적인 추론 비용(FLOPs)을 양립시키고 있습니다. Moonshot AI는 이 메커니즘을 「Stable LatentMoE」라고 부르며, K2보다 더욱 높은 희소성(Sparsity / 사용하는 엑스퍼트의 비율이 작은 정도)을 구현했습니다.
🧠 2. Kimi Delta Attention (KDA) 및 Attention Residuals
Kimi K3는 100만 토큰(1M)의 긴 컨텍스트(Context)를 네이티브하게 처리할 수 있습니다. 하지만 일반적인 Transformer의 어텐션(Attention)은 입력이 길어질수록 계산량이 급증하고, KV 캐시(KV Cache / 과거 토큰의 Key·Value를 유지하는 메모리)도 비대해진다는 약점이 있습니다.
이에 Kimi K3는 이 처리를 두 가지 기법으로 대체했습니다.
Kimi Delta Attention (KDA): 입력 길이에 대해 계산량이 완만하게 증가하는 「선형 어텐션 (Linear Attention)」을 기반으로 한 하이브리드 방식. 장문에서도 계산량과 메모리 증가를 억제합니다. -
Attention Residuals: 어텐션에 잔차 연결(Residual Connection)을 결합하여, 긴 시퀀스(Sequence)나 깊은 층을 가로질러도 정보가 손실되지 않도록 하는 메커니즘.
이 두 가지를 통해 100만 토큰 규모의 장문에서도 문맥의 연결성을 유지하며 효율적으로 처리할 수 있습니다.
👁 3. Vision in the loop: 시각을 이용한 자율 디버깅
Kimi K3는 이미지를 직접 이해할 수 있는 네이티브 멀티모달(Multimodal) 모델입니다. 「Kimi Code」와 같은 에이전트 환경에서는 생성한 Web UI의 스크린샷이나 터미널(Terminal) 표시를 모델 스스로가 확인하고, 그 결과를 바탕으로 코드를 수정하는 시각적 피드백 루프(Visual Feedback Loop)를 돌릴 수 있습니다. 인간이 화면을 확인하며 수정하는 방식과 유사한 과정을 모델이 자율적으로 수행할 수 있다는 점이 특징입니다.
🚀 Kimi K3 이용 방법
Kimi K3의 압도적인 성능은 아래의 웹사이트, 코딩 에이전트, 또는 API를 통해 즉시 체험할 수 있습니다.
1. 웹사이트 이용
가장 간편하게 체험할 수 있는 방법은 공식 웹 채팅 인터페이스입니다. 현재는 기본적으로 Kimi K3의 「최대 추론 (Max Thinking Effort) 모드」가 활성화되어 있습니다.
2. AI Coding Agent 이용
Kimi K3가 진가를 발휘하는 자율형 개발 에이전트 환경에서의 이용 방법과 필요 플랜 목록입니다. 발표 직후, 각 에이전트 도구들이 급속도로 대응을 진행하고 있습니다.
구독 플랜 내 이용 (K3 네이티브 지원)
| 에이전트 도구 | 이용 방법 및 특징 | 필요 플랜 / 조건 |
|---|---|---|
| Kimi Code | Moonshot 공식 개발 에이전트. Vision in the loop를 통한 화면 확인과 터미널 조작을 결합한 자율 디버깅이 가능. | Kimi Pro 플랜(유료 구독)이 필요함. 상위 티어일수록 이용 가능한 모델과 컨텍스트 길이(최대 1M)가 확장됨. |
| OpenCode | 오픈 소스 자율형 AI 코딩 에이전트 (터미널 / 데스크톱 / IDE 확장). 발표 직후 Kimi K3 지원 시작. | OpenCode가 검증 및 제공하는 모델군 「OpenCode Zen」을 통해 K3 이용 (opencode.ai/auth에서 로그인 후 API 키 취득). 또는 직접 Moonshot API나 OpenRouter 등의 API 키를 설정하여 이용. |
API 엔드포인트 설정으로 이용 (BYOK 방식)
| 에이전트 도구 | 이용 방법·특징 | 접속 설정 |
|---|---|---|
| Claude Code | Anthropic에서 제공하는 CLI 기반 코딩 에이전트. 환경 변수로 Base URL과 API 키를 전환하는 것만으로 K3를 백엔드로 지정 가능. | ANTHROPIC_BASE_URL=https://api.moonshot.ai/anthropic/, ANTHROPIC_MODEL=kimi-k3를 설정. Moonshot API 키가 필요함. |
| Codex | OpenAI에서 제공하는 CLI 코딩 에이전트. Kimi 호환 엔드포인트로 Base URL을 전환함으로써 K3를 이용 가능. | Base URL을 https://api.moonshot.ai/v1로 전환하고, 모델 ID에 kimi-k3를 지정. Moonshot API 키가 필요함. |
| Roo Code | VS Code 확장 기능으로 동작하는 오픈 소스 코딩 에이전트. 프로바이더(Provider) 설정에서 Moonshot API 또는 OpenRouter를 지정. | 프로바이더에 Moonshot을 선택하고 모델 ID kimi-k3를 설정. Moonshot API 키 또는 OpenRouter API 키가 필요함. |
| Cline | VS Code용 자율형 코딩 에이전트. 터미널 조작 및 파일 편집을 자동화하며, 프로바이더 설정에서 K3를 호출. | 프로바이더에 Moonshot, 엔트리 포인트(Entry point)에 api.moonshot.ai/v1 (중국 본토는 api.moonshot.cn/v1), 모델 ID에 kimi-k3를 지정. Moonshot API 키가 필요함. |
3. API 프로바이더 (직접 API 호출·종량제)
시스템에 내장하거나, Dify 등의 외부 도구, 독자적인 에이전트와 연결하기 위한 주요 API 제공처입니다.
| API 프로바이더 | 엔드포인트 / 특징 | 인증·도입 방법 |
|---|---|---|
| Moonshot API | api.moonshot.ai/v1 공식 네이티브 API. 가장 지연 시간이 낮으며, 컨텍스트 캐싱 (Context Caching)이 자동으로 적용되어 (캐시 ID·TTL 등의 추가 파라미터 불필요), 반복이 많은 프롬프트에서는 비용을 대폭 절감할 수 있음. | 공식 개발자 콘솔(platform.moonshot.ai)에서 계정 등록, API 키 발행 및 데포짓(종량제 결제)이 필요함. 모델 ID는 kimi-k3임. |
| OpenRouter | openrouter.ai 해외(일본 포함)에서 간편하게 멀티 모델 운용을 수행하고자 할 때 최적. 프로바이더 간 라우팅이 용이함. K3 출시 직후부터 즉시 대응. | OpenRouter 계정에서 공통 API 키를 발행한 후, 모델명에 moonshotai/kimi-k3를 지정하여 이용. |
| Vercel AI Gateway | vercel.com/ai-gateway Vercel이 제공하는 통합 API 게이트웨이. 재시도(Retry), 페일오버(Failover), 성능 최적화를 내장. Next.js 등 Vercel 생태계와의 친화성이 매우 높음. | Vercel 대시보드에서 AI Gateway 설정 후, 모델 ID moonshotai/kimi-k3를 지정. 프로바이더 가격 그대로 추가 마크업 없이 이용 가능. BYOK (자사 키 가져오기)도 지원. |
| OrcaRouter | api.orcarouter.ai/v1 인텔리전트 AI 게이트웨이. 품질·비용·레이턴시(Latency)에 기반한 적응형 라우팅, 자동 폴백(Fallback), 부하 분산을 제공. OpenAI 호환 엔드포인트로 즉시 통합 가능. | OrcaRouter 계정에서 API 키를 발행한 후, 모델 ID kimi/kimi-k3를 지정. 동일한 엔드포인트에서 OpenAI·Anthropic·Google 등과 병용 가능. |
💡 요약: 엔지니어의 관점에서 본 Kimi K3의 의의
Kimi K3의 등장은 2026년 현재 LLM 생태계에서 "클로즈드(Closed) 탑 러너들에게 오픈 모델이 특정 실무 수준에서 따라잡았다(혹은 추월했다)"는 것을 명확히 보여주는 마일스톤입니다. Dario Amodei가 예언했던 "6개월에서 1년"은커녕, 단 한 달 만에 그 순간이 찾아온 셈입니다.
현재 Kimi K3는 웹이나 API를 통해 그 압도적인 추론 능력을 체험할 수 있으며, 나아가 2026년 7월 27일까지 모델 웨이트(Model Weights)의 풀 공개가 예정되어 있습니다.
「외부 API에 기밀 소스 코드를 보낼 수는 없지만, 1M 컨텍스트 (1M Context)의 초장문 에이전트 (Agent) 환경을 자사 인프라에 구축하고 싶다」는 엔터프라이즈 영역이나 연구 개발 분야에서, Kimi K3는 향후 가장 유력한 베이스 모델 (Base Model)이 될 것입니다. 오픈 웨이트 (Open Weights) 프론티어가 어디까지 진보할지, 향후 전개에서 눈을 뗄 수 없습니다.
참고 문헌
- Kimi K3 공식 퀵스타트 (Quickstart) / 기술 블로그 ( https://platform.kimi.ai/docs/guide/kimi-k3-quickstart )
- Arena.ai 「Frontend Code Arena」 발표 데이터 ( https://x.com/arena/status/2077893862778183737 )
- Dario Amodei 발언 (2026년 봄 「중국은 최첨단 모델보다 6~12개월 뒤처져 있다」) / New York Times DealBook 「Is China Closing the A.I. Gap Faster Than Expected?」 (2026년 6월 22일) ( https://www.nytimes.com/2026/06/22/business/dealbook/china-closing-ai-gap.html )
- Fortune 「Markets experience new DeepSeek shock after MoonShot AI releases Kimi K3」 (2026년 7월 17일) ( https://fortune.com/2026/07/17/china-moonshot-kimi-k3-markets-china-ai/ )
- AI Magazine 「Moonshot: Can China's 2.8tn-Parameter AI Rival the US?」 (2026년 7월 17일) ( https://aimagazine.com/news/china-moonshot-release-2-8tn-parameter-ai-rivalling-the-us )
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기