
Kimi K3 Max의 새로운 아키텍처 내부 분석: 2026년 7월의 새로운 최고 AI
요약
Moonshot AI의 새로운 오픈 웨이트 모델인 Kimi K3 Max의 아키텍처를 분석합니다. 2.8조 파라미터 규모와 100만 토큰 컨텍스트 윈도우를 특징으로 하며, 에이전트 자율성과 추론 능력을 혁신적으로 개선했습니다.
핵심 포인트
- 2.8조 파라미터 규모의 3T 클래스 오픈 모델 등장
- 100만 토큰 컨텍스트 윈도우 및 네이티브 멀티모달 지원
- 에이전트의 지속적 자율 작업 및 상시 추론 모드 도입
- 2026년 7월 27일 모델 웨이트 공개 예정
Kimi K3 Max의 새로운 아키텍처 내부 분석: 2026년 7월의 새로운 최고 AI
서문
이 글은 일반적인 Kimi V3 Max에 관한 기사가 아닙니다. 이 글은 Kimi의 무료 서버가 과부하되기 직전인 2026년 7월 16일에 작성된 Claude의 내부 메커니즘에 관한 이전 기사를 바탕으로, Kimi V3 Max를 사용하여 작성되었습니다. 또한, 이 놀라운 새로운 LLM (Large Language Model)을 최대한 활용하는 방법을 이해하는 데 도움이 되도록 설계된 설명용 시각 자료를 포함하고 있습니다.
저는 거의 20년 동안 데이터 과학 (Data Science) 분야에서 일해 왔으며, 오늘날의 직업 시장에서 매우 중요한 점을 발견했습니다. 기계의 언어를 진정으로 마스터하는 사람들이 지속적으로 두각을 나타낸다는 사실입니다.
LLM을 사용하는 법을 배우는 방법은 많지만, 우리 모두는 각자의 인지적 편향 (Cognitive Biases)과 이해력의 한계에 부딪힙니다. 우리의 멘탈 모델 (Mental Model)이 정확한지, 혹은 기술이 진화함에 따라 그 모델이 여전히 유효할지 판단하는 것은 종종 어렵습니다. 불행히도 마법 같은 공식은 없습니다. AI에 대해 피상적인 이해만을 가진 많은 사람이 놀라운 성공을 거둘 수 있는 반면, 훨씬 더 깊은 이해를 가진 다른 이들은 훨씬 적은 인정을 받을 수도 있습니다.
그럼에도 불구하고, 순전히 운에 의존하는 것은 전략이 아닙니다. 수학이 복잡한 문제를 해결하기 위한 최적의 방법을 제공하는 것처럼, LLM에 대한 엄격한 이해를 발전시키는 것은 여러분에게 체계적인 우위를 제공합니다. 성공이 때때로 무작위적이거나 불공평해 보일 수 있는 세상에서, 이러한 모델이 어떻게 작동하는지에 대한 이해를 높이는 것은 더 나은 결정을 내리고, 더 빠르게 적응하며, 더 큰 가치를 창출할 가능성을 크게 높여줍니다.
이것이 바로 Andrej Karpathy, Ilya Sutskever, Noam Shazeer와 같은 전문가들이 매우 존경받는 정확한 이유입니다. 그들의 명성은 복잡한 아이디어를 전달하는 능력뿐만 아니라, LLM에 대한 깊고 정확하며 지속적인 이해에서 비롯됩니다.
그들의 접근 방식, 즉 제1원리 (First Principles)를 탐구하고, 가정을 의심하며, 자신의 멘탈 모델 (Mental Models)을 지속적으로 개선하는 방식은 AI 시대에 장기적인 성공을 거둘 수 있는 가장 신뢰할 수 있는 경로 중 하나입니다.
Kimi K3 Max의 새로운 아키텍처는 무엇이며 왜 중요한가?
수년 동안 오픈 웨이트 (Open-weight) 모델을 사용하는 것은 익숙한 패턴을 따랐습니다. 독점적인 프런티어 (Frontier) 모델이 출시된 후 약 6개월을 기다렸다가, 그때까지 오픈 커뮤니티가 따라잡은 결과물을 다운로드하고 그에 따른 타협을 받아들이는 방식이었습니다. 가장 뛰어난 오픈 모델조차 어려운 문제에서는 프런티어 모델과 유의미한 격차를 보였습니다.
Kimi K3는 이러한 패러다임으로부터의 의미 있는 전환을 시사합니다. Moonshot AI는 단순히 더 큰 모델을 학습시키는 대신, 백만 토큰 시퀀스 (Sequence) 전체에서 정보가 흐르는 방식, 에이전트 (Agent)가 일관된 자율 작업을 지속할 수 있는 시간, 그리고 모델이 자신의 행동 결과를 인지하는 방식을 변화시키는 메커니즘을 도입했습니다. 그 결과, 100만 토큰의 컨텍스트 윈도우 (Context Window), 네이티브 이미지 및 비디오 이해 능력, 그리고 상시 가동되는 추론 모드를 갖춘 2.8조 파라미터 (Parameter) 시스템이 탄생했습니다. 이는 3T 클래스에 도달한 최초의 오픈 모델이며, 전체 모델 웨이트 (Model Weights)는 2026년 7월 27일까지 공개될 예정입니다.
명칭에 관한 참고 사항: 출시 시점에 Kimi K3는 기본적으로 최대 사고 노력 (Max Thinking Effort) 모드로 실행되며, 저강도 및 고강도 모드는 향후 업데이트를 통해 제공될 예정입니다. 따라서 벤치마크 표와 리더보드(Leaderboard)에는
Kimi Delta Attention 및 Attention Residuals: 지능을 확보하기 위한 효율성
언어 모델(Language Model)의 규모를 확장하는 데 있어 지속적인 과제 중 하나는 어텐션(Attention) 자체의 비용이었습니다. 표준 어텐션은 시퀀스(Sequence)가 길어질수록 비용이 비싸지며, 100만 토큰의 컨텍스트(Context)에서는 단순한 아키텍처(Architecture)가 실용적으로 사용할 수 있을 만큼 충분히 빠르게 디코딩(Decoding)되지 못합니다. 두 번째로 조용히 존재하는 과제는 모델의 깊이(Depth)에 있습니다. 클래식한 잔차 연결(Residual Connections)은 모든 레이어(Layer)의 출력을 균일하게 누적하므로, 수십 개의 레이어를 거치면서 신호(Signal)와 노이즈(Noise)가 함께 쌓이게 됩니다.
Kimi K3는 이 두 가지 문제를 직접적으로 해결합니다.
Kimi Delta Attention은 매우 긴 시퀀스 전반에 걸쳐 정보를 효율적으로 이동시키도록 설계된 하이브리드 선형 어텐션(Hybrid Linear Attention) 메커니즘입니다. Moonshot AI에 따르면, 이는 100만 토큰 컨텍스트에서 최대 6.3배 빠른 디코딩을 가능하게 하며, 이는 이론적으로만 인상적인 롱 컨텍스트(Long-context) 모델과 실제로 사용 가능한 모델 사이의 차이를 만들어냅니다. Attention Residuals는 보완적인 축을 담당합니다. AttnRes는 모든 레이어의 출력을 잔차 스트림(Residual Stream)에 균일하게 더하는 대신, 깊이에 따라 표현(Representation)을 선택적으로 추출하는 잔차 연결의 교체 가능한(Drop-in replacement) 대안으로 작동합니다. Moonshot은 추가 연산량(Compute)을 2% 미만으로 유지하면서도 훈련 효율성(Training Efficiency)이 약 25% 더 높다고 보고했습니다.
이 두 메커니즘 주변에는 고도로 희소화된(Sparsified) 전문가 혼합(Mixture-of-Experts, MoE) 구조가 자리 잡고 있습니다. Stable LatentMoE 프레임워크는 토큰당 896개의 전문가 중 16개만을 효과적으로 활성화하며, 이 지점에서 라우팅(Routing)과 최적화(Optimization)는 1차적인 엔지니어링 문제가 됩니다. Moonshot의 지원 기술들은 마치 축소판 시스템 논문(Systems Paper)처럼 읽힙니다. Quantile Balancing은 라우터 점수 분위수(Router-score Quantiles)에서 전문가 할당을 직접 도출하여(민감한 밸런싱 하이퍼파라미터를 제거함), Per-Head Muon은 어텐션 헤드(Attention Heads)를 독립적으로 최적화하며, Sigmoid Tanh Unit (SiTU)과 Gated MLA는 활성화 제어(Activation Control) 및 어텐션 선택성(Attention Selectivity)을 강화합니다.
수정된 학습 및 데이터 레시피 (Data Recipes)와 결합하여, 이러한 구조적 변화는 Kimi K2와 비교했을 때 전체적인 스케일링 효율성 (Scaling Efficiency)을 약 2.5배 향상시킵니다. 이 모델은 단순히 더 많은 연산을 소비하는 것이 아니라, 연산을 지능으로 더 효과적으로 전환합니다.
이러한 엔지니어링 규율은 배포 (Deployment) 단계까지 확장됩니다. SFT (Supervised Fine-Tuning) 단계부터 K3는 광범위한 하드웨어 호환성을 위해 MXFP4 가중치 (Weights) 및 MXFP8 활성화 (Activations)를 사용하는 양자화 인식 (Quantization-aware) 방식으로 학습되었습니다. 또한 Moonshot은 KDA를 위한 프리픽스 캐싱 (Prefix-caching) 구현을 vLLM 커뮤니티에 기여했습니다. 이 메커니즘을 통해 공식 API는 코딩 워크로드에서 90% 이상의 캐시 히트율 (Cache hit rate)을 기록하며, 캐시 히트된 입력을 100만 토큰당 $0.30에 제공할 수 있습니다.
이점:
- 극단적인 컨텍스트 길이 (Context lengths)에서의 더 빠른 디코딩 (Decoding).
- 이전 세대보다 연산 단위당 약 2.5배 더 높은 지능.
- 무시할 수 있는 수준의 오버헤드로 훨씬 저렴해진 학습 비용.
- 양자화 인식 학습 (Quantization-aware training)을 통한 광범위한 하드웨어 호환성.
- 100만 토큰 규모의 에이전트 세션을 데모 수준이 아닌 실제 환경에서도 감당 가능한 수준으로 만드는 서빙 경제성 (Serving economics).
Max Thinking과 Long-Horizon Agent: 채팅 턴에서 다일(Multi-Day) 실행으로
아마도 가장 중대한 혁신은 철학적인 측면일 것입니다. 대부분의 모델은 추론(Reasoning)을 사용자의 메시지와 모델의 답변 사이의 간극에서 발생하는 무언가로 취급합니다. 반면 Kimi K3 Max는 추론을 기본 상태로 취급합니다. 즉, 사고 모드(Thinking mode)는 항상 켜져 있고, 노력의 다이얼은 최대로 고정되어 있으며, 모델은 인간의 감독을 최소화한 채 장기적(Long-horizon)이고 도전적인 작업들을 대상으로 특화되어 학습되었습니다.
가장 명확한 증거는 Moonshot사가 사례 연구(Case studies)에서 제시하는 자율 실행 시간입니다. 이는 초 단위가 아닌 시간 및 일 단위로 측정됩니다:
• GPU 커널 최적화 (15시간, 중단 없음). AttnRes의 프로덕션 Triton 구현을 기반으로, K3는 수치적 정밀도를 유지하면서 커널을 융합(Fused kernels)하는 새로운 2단계 커널 알고리즘을 설계하여 순전파(Forward) 및 역전파(Backward) 시간을 283.6ms에서 114.4ms로 단축했습니다. 관련 분야에서는 DSA(Deep Spiking Architecture) 학습 커널의 엔드 투 엔드(End-to-end) 시간을 55.1% 단축했으며, NVIDIA H200의 이론적 BF16 피크 성능의 절반 이상인 517.8 TFLOPS에 도달하는 MLA-512 커널을 처음부터 작성했습니다. 또한 CUDA 튜닝 경험이 전이되지 않는 타사 GPGPU 환경에서 KDA 커널의 시간을 73.6% 단축했습니다.
• 컴파일러 자체 개발. K3는 MLIR 상에서 자체적인 타일 수준 IR(Tile-level IR), 최적화 패스(Optimization passes), 그리고 PTX 코드 생성 파이프라인을 갖춘 소형 Triton 유사 GPU 컴파일러인 MiniTriton을 개발했습니다. 이는 특정 루프라인(Roofline) 벤치마크에서 Triton과 대등하거나 이를 능가하며, 안정적인 수렴과 함께 엔드 투 엔드 nanoGPT 학습을 지속할 수 있습니다.
• 칩 설계 (48시간, 자율적). Nangate 45nm 라이브러리 상에서 오픈 소스 EDA 도구를 사용하여, K3는 자체 아키텍처를 기반으로 한 나노 모델용 칩을 구축, 최적화 및 검증했습니다. 4mm² 이내의 면적에서 100MHz의 타이밍을 달성하며, 시뮬레이션 상에서 8,700 tokens/second 이상의 INT4 디코딩 처리량(Decode throughput)을 유지합니다. 모델이 모델을 위해 만든 칩입니다.
• 계산 연구 (약 2시간).
천체 물리학의 I–Love–Q 보편적 관계(universal relations)를 재현하기 위해, K3는 20개 이상의 논문을 검토 및 교차 검증하였고, 전체 수치 파이프라인(numerical pipeline)을 구현하였으며, 300개 이상의 상태 방정식(equations of state)을 평가하고, 발표된 공식들 사이의 불일치를 식별하였으며, 3,000줄 이상의 Python 코드와 대화형 대시보드를 생성했습니다. 이는 숙련된 연구자가 통상적으로 1~2주를 소요하는 작업량입니다.
여기에 전략적인 베팅도 내재되어 있습니다. 업계의 많은 이들이 까다로운 에이전트적(agentic) 문제에 대해 멀티 에이전트 오케스트레이션(multi-agent orchestration)과 공격적인 컨텍스트 압축(context compression)으로 대응해 온 반면, Moonshot은 하나의 에이전트에 100만 토큰의 윈도우(window)와 강력한 검색(retrieval) 능력을 결합했습니다. 장기적이고 난이도가 높은 정보 탐색 벤치마크인 BrowseComp에서 K3는 91.2라는 최첨단(state-of-the-art) 점수를 기록했으며, 컨텍스트 관리(context management)를 전혀 사용하지 않고 전체 윈도우를 사용했을 때조차 90.4를 기록했습니다. 결과적으로 가공되지 않은 원시 컨텍스트(Raw context)는 정교한 컨텍스트 배관(context plumbing) 작업에 대한 강력한 대안이 될 수 있음을 보여줍니다.
공통적인 패턴:
거대 저장소(repository)를 가로지르는 장기적 코딩 세션. 자율적인 성능 엔지니어링(프로파일링, 재작성, 벤치마킹, 반복). 바닥부터 시작하는 시스템 구축, 컴파일러, 에뮬레이터, 하드웨어 설계. 문헌 기반의 코드 연구 재현. 수백 개의 소스를 대상으로 하는 단일 에이전트 심층 연구(deep research), 그리고 391개의 GWTC-5 이벤트를 20개 이상의 서브 에이전트로 분석하는 중력파 분석과 같은 팬아웃(fan-out) 작업에 할당되는 서브 에이전트 활용. 데스크톱 에이전트가 작업이 완료될 때까지 실행되도록 하는 Kimi Work의 목표 모드(Goal Mode).
이러한 모든 자율성에는 한 가지 솔직한 주의 사항이 따릅니다. Moonshot은 K3가 어렵고 긴 작업에 중점을 두어 학습되었기 때문에 지나치게 주도적(proactive)일 수 있다고 명시적으로 경고합니다. 즉, 사용자의 의도가 모호할 때 사용자를 대신하여 예상치 못한 결정을 내릴 수 있으며, 모델이 자신의 사고 이력(thinking history)에 민감하므로 에이전트 하네스(agent harnesses)는 이전의 사고 내용을 충실히 다시 전달해야 합니다. 이토록 강력한 자율성에는 경계가 필요하며, 이에 대한 자세한 내용은 아래의 실무 지침에서 다룹니다.
Vision in the Loop: 자신의 작업에 대한 네이티브 시각 (A Native Eye on Its Own Work)
대부분의 "멀티모달 (multimodal)" 파이프라인은 텍스트 모델에 시각 액세서리를 볼트로 고정해 붙여놓은 것처럼 작동합니다. Kimi K3는 텍스트, 이미지, 비디오를 동일한 모델 내에서 네이티브하게 처리하며, 그 실질적인 결과는 단순히 더 나은 이미지 캡셔닝 (image captioning)에 그치지 않고, 행동 (action)과 지각 (perception) 사이의 폐쇄형 피드백 루프 (closed feedback loop)를 형성한다는 점입니다.
Moonshot은 이를 'Vision in the loop'라고 부릅니다. 모델이 코드를 작성하고, 결과물의 라이브 스크린샷을 캡처하며, 이를 의도와 비교한 뒤, 자신의 작업을 실시간으로 보고 수정하며 개선해 나가는 방식입니다. 주요 데모는 Three.js, WebGPU, 그리고 GPU 연산 (GPU compute)을 사용하여 구축된, 숲과 통나무집 마을, 설산, 그리고 역동적인 날씨를 갖춘 완전히 절차적으로 생성된 브라우저 기반 3D 오픈 월드 게임입니다. 동일한 루프가 프론트엔드 (frontend) 작업(K3는 Frontend Code Arena에서 1,679점을 기록하며 K2.6 대비 17계단 상승하여 1위를 차지했습니다), CAD, 그리고 자신의 아키텍처를 3Blue1Brown 스타일의 애니메이션 설명 영상으로 제작하는 것을 포함한 모션 디자인 (motion design)을 구동합니다.
“Kimi K3는 코드와 라이브 스크린샷 사이를 매끄럽게 반복하며, 출력을 즉각적으로 확인하고 개선함으로써 진정한 'Vision in the loop'를 달성합니다.”
Moonshot AI, Kimi K3 기술 블로그, 2026
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기