Kimi K3 아키텍처: 긴 컨텍스트 멀티모달 MoE를 위한 2.8T 파라미터 스케일링
요약
Moonshot AI가 발표한 Kimi K3는 2.8조 개의 파라미터를 가진 네이티브 멀티모달 MoE 모델입니다. 100만 토큰의 긴 컨텍스트를 효율적으로 처리하기 위해 KDA와 Gated MLA를 결합한 하이브리드 아키텍처를 도입했습니다.
핵심 포인트
- 2.8T 파라미터 규모의 대형 MoE 모델
- 100만 토큰의 긴 컨텍스트 창 지원
- KDA와 Gated MLA를 활용한 시퀀스 병목 해결
- Kimi K2 대비 2.5배의 효율성 향상 달성
서론: 길이, 깊이, 너비에 따른 스케일링 (Scaling Along Length, Depth, and Width)
프런티어 언어 모델을 스케일링(Scaling)하려면 훈련 및 추론 과정에서 파라미터 용량, 컨텍스트 창(Context window) 길이, 그리고 계산 효율성 사이의 균형을 맞춰야 합니다 \u201d1\u201d. Moonshot AI의 Kimi K3는 총 2.8조(trillion) 개의 파라미터, 토큰당 1,040억(billion) 개의 활성화된 파라미터, 그리고 100만 토큰의 컨텍스트 창(Context window)을 가진 네이티브 멀티모달 전문가 혼합(Mixture-of-Experts, MoE) 모델입니다 \u201d2\u201d \u201d1\u201d. arXiv 기술 보고서 \u201d2\u201d에 상세히 기술된 바와 같이, 토큰, 레이어(Layer), 채널(Channel) 차원에 걸친 구조적 업데이트를 통해 Kimi K2 대비 2.5배의 효율성 향상을 달성했습니다 \u201d2\u201d \u201d1\u201d.
모델 가중치는 Hugging Face Papers \u201d3\u201d를 통해 접근할 수 있습니다. Kimi K3는 연간 매출이 2,000만 달러를 초과하는 상업용 MaaS 플랫폼의 경우 별도의 계약을 체결해야 하는 커스텀 라이선스를 사용하며, 활성 사용자가 1억 명을 초과하는 제품은 Kimi K3 브랜딩을 표시해야 합니다 \u201d4\u201d \u201d5\u201d.
시퀀스 병목 현상: 하이브리드 KDA 및 Gated MLA
표준 소프트맥스 어텐션(Softmax attention)은 시퀀스 길이 $N$이 확장됨에 따라 $O(N^2)$의 계산 복잡도와 선형적인 KV-캐시(KV-cache) 증가를 보입니다 \u201d1\u201d \u201d6\u201d. 100만 토큰의 컨텍스트를 효율적으로 관리하기 위해, Kimi K3는 3:1의 레이어별 하이브리드 비율을 사용합니다. 즉, 블록당 3개의 Kimi Delta Attention (KDA) 레이어 뒤에 1개의 Gated Multi-Head Latent Attention (MLA) 레이어가 배치되며, 마지막에는 최상단의 MLA 레이어로 마무리됩니다 \u201d1\u201d.
KDA는 채널별 망각 게이트 (channel-wise forget gate)를 통해 선형 어텐션 (linear attention) 및 델타 규칙 순환 (delta-rule recurrence)을 확장합니다 [1] [7]. 은닉 상태 (hidden states) $x_t \in \mathbb{R}^d$에 대해, KDA는 유지 계수 (retention factors) $\alpha_t \in (0,1)^{d_k}$와 델타 강도 (delta strengths) $\beta_t \in (0,1)$를 사용하여 순환 상태 (recurrent state) $S_t \in \mathbb{R}^{d_k \times d_v}$를 업데이트합니다 [1].
청크 단위 병렬 실행 (chunkwise parallel execution) 시 수치적 안정성 (numerical stability)을 유지하기 위해, Kimi K3는 경계가 없는 음수 Softplus 감쇠 (unbounded negative Softplus decay)를 하한이 설정된 로그 감쇠 매개변수화 (lower-bounded log-decay parameterization)로 대체합니다 [1]:
$$g_t^h = g_{\text{min}} \text{Sigmoid}(e^{A^h} z_t^h) \in (g_{\text{min}}, 0)^{d_k}, \quad \alpha_t^h = \exp(g_t^h) \in (e^{g_{\text{min}}}, 1)^{d_k}$$
$g_{\text{min}} = -5$로 설정하면 유지 계수가 $\alpha_{t,j}^h > e^{-5} \approx 6.7 \times 10^{-3}$를 만족하도록 보장합니다 [1]. 16-토큰 타일 (16-token tiles) 전체에서 누적 로그 감쇠 (cumulative log-decay)는 $(-80, 0)$ 범위 내에 머물며, 재스케일링 계수 (rescaling factors)를 $e^{80}$ 미만으로 유지하여 BF16 동적 범위 (dynamic range) 내에 들어오게 합니다 [1]. 이를 통해 대각 및 비대각 타일 (diagonal and off-diagonal tiles)이 밀집 텐서 코어 행렬 곱셈 (dense Tensor Core matrix multiplications)을 통해 실행될 수 있습니다 [1].
주기적 게이트 MLA (Periodic Gated MLA) 레이어는 키-값 표현 (key-value representations)을 잠재 벡터 (latent vectors) $c_t = W_c x_t$로 압축합니다 [1] [8]. 모든 MLA 레이어는 명시적 위치 인코딩 (explicit positional encodings)을 생략하며 (NoPE), 시퀀스 순서(sequence order)를 KDA 레이어에 의존함으로써 RoPE 주파수를 변경하지 않고도 1M 컨텍스트 확장을 가능하게 합니다 [1].
깊이 병목 현상: 어텐션 잔차 (Attention Residuals, AttnRes)
표준 잔차 연결 (Standard residual connections)은 레이어 출력들을 순차적으로 합산하지만 ($h_l = h_{l-1} + f_l(h_{l-1})$), 이는 깊은 네트워크에서 신호 희석 (signal dilution)의 위험을 초래합니다 1 9 10. Kimi K3는 레이어들이 이전 깊이의 표현 (depth representations)에 동적으로 어텐션 (attend)할 수 있도록 어텐션 잔차 (Attention Residuals, AttnRes)를 구현합니다 1 10.
전체 AttnRes에서 레이어 $l$은 의사 쿼리 (pseudo-query) $q_l = w_l \in \mathbb{R}^d$를 사용하여 $\phi(q, k) = \exp(q^\top \text{RMSNorm}(k))$를 통해 이전 레이어 $0 \le i \le l-1$의 정규화된 출력들에 대한 어텐션을 계산합니다 1. $L=93$개의 레이어에 걸친 $O(Ld)$ 메모리 오버헤드를 피하기 위해, Kimi K3는 레이어를 각각 12개의 레이어로 구성된 8개의 메인 블록으로 분할합니다 1. 출력은 블록 내에서 로컬하게 누적되는 반면, 어텐션 검색 (attention retrieval)은 블록 표현 (block representations) 간에 작동하여 깊이 메모리 오버헤드를 $O(Ld)$에서 $O(Nd)$로 줄입니다 1.
너비의 병목 현상: Stable LatentMoE 및 분위수 균형 (Quantile Balancing)
Kimi K3는 896개의 라우팅된 전문가 (routed experts, 토큰당 16개 활성화; 희소성 비율 56)와 레이어당 2개의 전체 너비 공유 전문가 (full-width shared experts)를 통해 채널 너비를 확장합니다 1. 라우팅된 전문가들은 통신 트래픽을 제한하기 위해 너비 $\ell = 3584$ (은닉 너비 $d=7168$의 0.5배)인 잠재 공간 (latent space)에서 작동합니다 1.
라우팅을 안정화하기 위해, Kimi K3는 두 가지 수정 사항을 도입합니다 1:
안정화하기 위해, Kimi K3는 두 가지 수정 사항을 도입합니다 1:
- Normalized LatentMoE: 집계된 라우팅 출력에 RMSNorm을 적용하여 업-프로젝션(up-projection) 전에 정규화합니다: $y = \sum E_{\text{shared}}(x) + W_\uparrow \text{RMSNorm}(u)$ []1[].
- SiTU-GLU: SwiGLU를 소프트 캡(soft caps) $\beta_1 = 4$ (게이트, gate) 및 $\beta_2 = 25$ (업 브랜치, up branch)로 대체합니다 []1[]:
$$\text{SiTU-GLU}(x) = \left[ \beta_1 \tanh\left(\frac{W_g x}{\beta_1}\right) \odot \text{Sigmoid}(W_g x) \right] \odot \left[ \beta_2 \tanh\left(\frac{W_u x}{\beta_2}\right) \right]$$
이를 통해 좌표 크기를 $| \text{SiTU-GLU}(x) |_\infty \le 100$으로 제한합니다 []1[].
전문가 분배(expert dispatch)를 위해, Quantile Balancing (QB)은 보조 손실이 없는 라우터 편향 $b_j$를 목표 부하($q = mk/n$)와 일치하는 점수 분위수(score quantiles)에서 직접 조정합니다 []1[] []11[]. 분산된 랭크(Distributed ranks)는 마진 값 $r_{i,j} = \alpha_i - s_{i,j}$의 로컬 1000-빈 히스토그램을 채우고, 모든-축소(all-reduce) 연산을 통해 전체 배치 분위수(whole-batch quantiles)를 복구합니다 []1[].
인프라 및 훈련/추론 메커니즘
Kimi K3의 스케일링은 하드웨어-소프트웨어 공동 설계(hardware-software co-design)에 의존합니다 []1[].
- MoonEP: 균형 잡힌 할당을 보장하기 위해 랭크(rank)당 최대 $E/R$의 중복 슬롯을 예약하는 전문가 병렬성 (Expert Parallelism) 라이브러리로, 동기화 지연 (sync stalls)을 제거하고 복사 없는 연산 (copy-free operations)을 가능하게 합니다 \u20111\u2011 \u20114\u2011.
- KDA 컨텍스트 병렬성 (KDA Context Parallelism): 랭크 간 로컬 상태 업데이트를 계산하고, 고정 크기 올-개더 (all-gather) 단계를 사용하는 접두사 스캔 (prefix scans)을 통해 이를 병합합니다 \u20111\u2011.
- 양자화 인식 훈련 (Quantization-Aware Training): MoE 전문가 가중치는 MXFP4로 양자화되고 활성화 함수 (activations)는 MXFP8로 처리되어, 약 1.4 TB의 가중치 페이로드 (weight payload)를 생성합니다 \u20111\u2011 \u201112\u2011 \u201113\u2011.
- 서빙 엔진 (Serving Engine): 하이브리드 KDA-MLA 캐시는 고정 크기의 KDA 상태와 가변적인 MLA KV 블록을 페이지 메모리 (paged memory)에 패킹하며, 6144-토큰 물리 블록 내에서 512-토큰 해시 블록을 디커플링 (decoupling)합니다 \u20111\u2011.
- AgentENV: Firecracker를 사용하는 마이크로VM (MicroVM) 샌드박스를 통해 1초 미만의 실행 시간으로 다회차 궤적 (multi-turn trajectories) 전반에 걸친 에이전트 기반 강화학습 (agentic RL)을 가능하게 합니다 \u20111\u2011 \u201114\u2011.
성능, 벤치마크 및 제3자 평가
Kimi K3는 강력한 벤치마크 결과를 달성하였으며, 전반적으로 독점 플래그십 모델인 Claude Fable 5 및 GPT-5.6 Sol에 뒤처지지만 다른 모델들보다는 뛰어난 성능을 보여줍니다 \u20112\u2011 \u20111\u2011:
- 코딩 및 에이전트 (Coding & Agents): ProgramBench에서 77.8%, Terminal-Bench 2.1에서 88.3%, SWE-Marathon에서 42.0%, BrowseComp에서 91.2%, AutomationBench에서 30.8%, 그리고 Harvey Lab-AA에서 94.6%를 기록했습니다 [‑1‑].
- 추론 및 비전 (Reasoning & Vision): GPQA Diamond에서 93.5%, ZeroBench-main에서 23.0% (도구 사용 시 41.0%), OmniDocBench에서 91.1%, 그리고 HLE-Full에서 43.5% (도구 사용 시 56.0%)에 도달했습니다 [‑1‑].
제3자 평가에 따르면 Artificial Analysis Intelligence Index v4.1 점수 57.1점 (전체 4위) [‑1‑] [―], Vals AI Index 점수 74.7% (2위) [‑1‑], 그리고 LMArena WebDev Arena에서 1위 (1678 Elo)를 기록했습니다 [‑1‑]. 영국 AISI와 NIST CAISI의 보안 테스트에서는 취약점 공격 개발(exploit development)의 진전과 함께 강화된 타겟(hardened targets)에 대한 한계점도 언급되었습니다 [‑1‑]. Hacker News에서의 기술적 논의 [‖] [‗]에서는 19개의 Redis 제로데이(zero-days) [‘] 및 증류 시그니처(distillation signatures) [‖] [‗]와 같은 공개 사항들이 언급되었습니다. 업데이트 사항은 Kimi Blog [’]에 기록되어 있습니다.
개발자 시사점 및 한계점
Kimi K3는 하한 선형 어텐션 (lower-bounded linear attention), 블록 깊이 잔차 (block depth residuals), 그리고 분위수 MoE 균형 (quantile MoE balancing)을 결합함으로써 수조 단위 파라미터 체제에서 2.5배의 효율성 이득을 제공함을 입증했습니다 [‑1‑].
주요 배포 제약 사항은 다음과 같습니다:
- 하드웨어 점유율 (Hardware Footprint): 1.4 TB의 MXFP4/MXFP8 가중치 페이로드 (weight payload)를 서빙하려면 멀티 노드 GPU 클러스터 (통상 64개 이상의 가속기)가 필요합니다 \u201112\u2011 \u201120\u2011 \u201121\u2011.
- 라이선스 (Licensing): MaaS (Model-as-a-Service) 수익이 2,000만 달러를 초과하는 경우 별도의 상업적 계약이 필요합니다 \u20114\u2011 \u20115\u2011.
- 역량 격차 (Capability Gaps): CritPt와 같은 복잡한 연구 작업에서 성능이 최상위 폐쇄형 모델 (proprietary models)에 뒤처집니다 (23.4% 대 32.3%) \u20111\u2011.
참고 문헌 (References)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기