뇌의 3%만 깨어난다: 9월 최대 모델들을 만든 Mixture-of-Experts 플레이북
요약
최근 DeepSeek V4.1 Flash와 Xiaomi MiMo-V2.6 Pro 등 주요 open-weight 모델들이 Mixture-of-Experts (MoE) 아키텍처를 채택하며 주목받고 있습니다. MoE는 전체 매개변수는 크지만, 실제 추론 시에는 일부 전문가(Expert)만 활성화하여 컴퓨팅 비용을 획기적으로 줄이는 기술입니다. 이는 거대한 지식 용량과 낮은 운영 비용이라는 이점을 제공합니다.
핵심 포인트
- MoE는 희소 게이팅 기법으로, 전체 매개변수 대비 활성화되는 부분이 적습니다.
- DeepSeek V4.1 Flash 등 최신 모델들은 MoE를 통해 효율성을 극대화하고 있습니다.
- 전체 파라미터(지식 용량)와 추론 시 비용(활성화된 매개변수)을 분리하는 것이 핵심입니다.
두 개의 open-weight 출시가 12일 간격으로 이루어졌습니다. DeepSeek V4.1 Flash (9월 10일): 5,520억 개 매개변수 — 이 중 각 입력 토큰당 약 80억 개, 출력 토큰당 160억 개가 활성화됩니다. Xiaomi MiMo-V2.6 Pro (9월 22일): 1조 20억 개 매개변수로, 토큰당 단 420억 개만 활성화됩니다. 둘 다 MIT 라이선스입니다. 크기가 1/10에 불과한 모델보다 토큰당 비용이 더 저렴합니다.
이 트릭은 새로운 것이 아닙니다. 이는 2017년의 아이디어(Shazeer et al.의 희소 게이팅 MoE, 137B 매개변수)이며 조용히 최전선을 정복했습니다: 2026년에 실제로 배포되는 7개의 최신 open-weight 모델 중 6개가 Mixture-of-Experts입니다. 이것이 스케일링 곡선을 먹어치우는 아키텍처입니다 — 작동 방식, 문제점, 그리고 9월 연구가 이 문제를 해결하는 방법에 대해 알려드리겠습니다.
초등학생도 이해할 수 있도록 설명: 전문의들이 대기하는 병원
밀집 트랜스포머(dense transformer)는 모든 의사가 모든 환자를 검진하는 병원과 같습니다. 가슴 통증? 200명의 의사 모두가 들어옵니다. 파편? 200명의 의사 모두가 들어옵니다. 매번 그들 모두에게 비용을 지불합니다.
Mixture-of-Experts 모델은 트리아지(triage) 간호사가 있는 병원과 같습니다. 각 환자(토큰)는 자신의 사례와 관련된 2~8명의 전문의에게만 라우팅됩니다. 병원은 여전히 200명의 전문의를 _고용_하고 있습니다 — 이것이 모델의 지식 용량입니다 — 하지만 각 환자는 소수의 의사에게만 비용을 지불합니다. 전체 매개변수는 직원 명부입니다. 활성화된 매개변수가 청구서입니다.
이것이 바로 거래의 핵심입니다: 거대한 두뇌, 적은 컴퓨팅 비용. DeepSeek-V3는 6,710억 개 매개변수를 가지고 있지만 37B 모델처럼 계산됩니다 — 이것은 그것이 아는 것과 지출하는 것 사이의 18배 차이입니다. 9월 출시들은 이를 더욱 발전시켰습니다: V4.1 Flash는 약 160억 개의 컴퓨팅으로 5,520억 개의 지식을 구동하며, 이는 34배의 격차를 보입니다. 뇌의 약 3%만 깨어납니다.
작동 방식: 라우터, k개의 전문가, 그리고 가중치 투표
표준 트랜스포머 블록에서 피드-포워드 네트워크(FFN)가 대부분의 파라미터와 컴퓨팅을 담당합니다. MoE는 이 단일 FFN을 더 작은 전문가 네트워크 N개와 라우터 (게이팅 네트워크)로 대체합니다:
- 점수 계산 (Score). 라우터가 토큰을 읽고 모든 전문가에 대한 점수를 매깁니다:
scores = softmax(x · W_router). - 선택 (Select). 상위-k개(일반적으로 2~8개)만 유지합니다. 나머지는 해당 토큰에 대해서는 유휴 상태로 남아 있습니다.
- 결합 (Combine). 선택된 각 전문가가 토큰을 처리하고, 출력은 라우터의 점수를 사용하여 **가중 합(weighted sum)**으로 병합됩니다:
y = Σ gᵢ · Expertᵢ(x).
최신 변형 모델들은 모든 토큰이 통과하는 **공유 전문가(shared expert)**를 추가합니다 (DeepSeek의 설계: 256개의 라우팅된 전문가 + 1개의 공유 전문가). 이는 일반적인 지식을 흡수하여 라우팅된 전문가들이 전문화할 수 있도록 합니다.
훈련에는 악명 높은 실패 모드가 하나 있습니다: 라우터 붕괴(router collapse). 방치될 경우, 라우터는 자신이 좋아하는 3개의 전문가를 발견하고 나머지를 기아 상태에 빠뜨립니다—61개 전문가는 아무것도 배우지 못합니다. 표준 해결책은 보조 부하 균형 손실(auxiliary load-balancing loss) (Switch Transformer에서 유래)입니다: 트래픽이 집중될 때 라우터에게 페널티를 부여하여, L_aux = α · N · Σ fᵢ · Pᵢ이며, 여기서 fᵢ는 전문가 _i_로 전송된 토큰의 비율이고 Pᵢ는 평균 라우터 확률입니다. 이는 편애에 대한 세금과 같습니다.
그리고 마케팅에서 건너뛰는 함정: 절약되는 것은 메모리가 아니라 컴퓨팅 능력입니다. 모든 전문가는 특정 토큰이 사용하든 안 하든 VRAM에 상주해야 합니다. DeepSeek-V3의 671B 파라미터(FP8 기준)는 약 671 GB의 가중치를 필요로 합니다—이는 다중 GPU 서버가 필요한 수준입니다—비록 각 토큰이 마치 37B 모델처럼 계산되더라도 말입니다. MoE는 동일한 FLOP 비용으로 더 큰 두뇌를 사주지만, 메모리 비용은 사용자에게 떠넘깁니다.
수치 (SOTA 섹션)
9월의 리더보드. 이제 최첨단 모델은 MoE 단일 문화가 되었고, 라이선스도 더 우호적으로 변하고 있습니다:
| Model | 출시일 | 총량 / 활성량 | 전문가(top-k) | 라이선스 |
|---|---|---|---|---|
| MiMo-V2.6 Pro | 2026년 9월 22일 | 1.02T / 42B | 384 (8) | MIT |
| ... | ||||
| *AMD의 Instella는 '완전 개방형(fully open)' 아웃라이어입니다: 오픈 Primus/Miles 프레임워크와 MI300X/MI325X GPU에서 end-to-end로 훈련되었으며, Gated MLA + FarSkip-Collective 설계를 통해 트레이닝 속도가 12.7% 빠르고 첫 토큰까지의 시간이 39.2% 짧습니다. (가중치에는 ResearchRAIL 비상업적 제한이 적용되며, 훈련 코드는 MIT입니다.) |
가격 책정이 이야기를 전합니다: V4.1 Flash는 비피크 시간대에 백만 토큰당 $0.15/$0.60이고 MiMo-V2.6 Pro는 $0.435/$0.87입니다. 이는 제공업체의 컴퓨팅 비용이 활성(active) 개수에 의해 결정되기 때문에, 최첨단 수준의 지능을 밀집 모델 가격으로 이용할 수 있음을 의미합니다.
연구 전선은 MoE의 세 가지 만성 질환에 도전하고 있습니다:
- 깊은 레이어는 자체 전문가가 필요할까요? UniPool (arXiv:2605.06665, 2026년 5월)은 깊은 레이어의 학습된 top-k 라우터를 _균일 무작위 라우팅(uniform random routing)_으로 대체해도 정확도가 단지 1.0–1.6 포인트 하락할 뿐임을 발견했습니다. 즉, 깊은 라우터는 대부분 불필요합니다. 해결책은 레이어별 전문가 세트 대신 모든 레이어에 걸쳐 **전역적으로 공유되는 단일 전문가 풀(globally shared expert pool)**을 사용하는 것입니다. 결과: 41.6–66.7%의 전문가 파라미터 예산이 바닐라 MoE와 같거나 능가하며, 검증 손실은 최대 0.0386까지 개선됩니다. 전문가 용량은 깊이에 따라 선형적으로 증가하지 않습니다.
- 부하 불균형은 해결 가능합니다. **잠재 프로토타입 라우팅(Latent Prototype Routing)**은 라우팅을 클러스터링으로 재구성하고 DeepSeek-V3, Qwen3-MoE, Mixtral 전반에 걸쳐 전문가 부하의 지니 계수(Gini coefficient)를 0.70에서 0.035로 낮췄습니다. 이는 품질 손실 없이 20배 더 균형 잡힌 시스템입니다.
- '상임위원회'. 2026년 감사(COMMITTEEAUDIT, arXiv:2601.03425)에 따르면, 약 6개의 전문가가 도메인과 관계없이 압도적 다수의 토큰—코드, 시, 수학—에서 top-k에 나타나며 전체 라우팅 가중치의 60–67%를 차지합니다. 전문화는 실제로 존재하지만, 소규모의 일반적인 위원회가 대부분의 작업을 수행합니다.
서빙 비용(The serving tax). 단일 GPU가 모든 전문가(experts)를 보유하지 않기 때문에, MoE는 전문가들을 여러 GPU에 분산합니다 — 이것이 **전문가 병렬화(expert parallelism)**입니다 — 그리고 각 토큰은 자신의 전문가들이 있는 GPU로 이동하고, 가중치가 적용된 출력값들이 다시 돌아옵니다. 이 모든 곳으로 보내고 받는 셔플(all-to-all shuffle) 과정 자체가 순수한 오버헤드입니다: 대역폭과 지연 노드(stragglers)가 처리량(throughput)을 제한합니다. 더욱 심각한 문제는 검증의 사각지대를 만든다는 것입니다. 2026년 6월에 발표된 분석("The Expert Shuffle")에 따르면, 분산형 제공업체는 상위 k개(top-k)를 8개에서 4개로 조용히 줄이는("k-shunting") 행위를 할 수 있으며 거의 감지되지 않습니다 — 왜냐하면 운영 위원회(Standing Committee)가 두 실행 모두에 지배적이고, 출력값이 중복되기 때문입니다. 샘플링 기반 검사는 이를 포착할 수 없으며, 오직 중간 계산량의 측정을 통해서만 가능합니다.
명확하게 제시하는 한계점들
- 메모리는 희소화되지 않습니다. 활성화된 소수의 파라미터에 대해서만 FLOPs를 지불할 뿐, 모든 파라미터에 대해 VRAM을 지불해야 합니다. 552B–1T 파라미터를 가진 "오픈 가중치(Open weights)" 모델은 다중 GPU 서버가 필요합니다 (V4.1 Flash의 체크포인트는 약 510 GB).
- 라우팅이 취약한 부분입니다. 붕괴, 불균형, 그리고 운영 위원회 효과 때문에 전문가 개수 중 상당 부분은 장식적인 역할을 합니다. UniPool의 무작위 라우팅 결과는 겸손하게 만듭니다: 깊은 라우터들은 거의 중요하지 않습니다.
- 서빙은 분산 시스템 문제입니다. 모든 곳으로 보내고 받는 디스패치/결합(All-to-all dispatch/combine), 용량 스케줄링, 지연 노드 처리 등 — MoE 추론 엔지니어링은 일반적인 밀집 모델을 실행하는 것보다는 HPC(High Performance Computing)에 가깝게 보입니다.
- 검증에는 구멍이 있습니다. 분산형 서빙에서의 k-shunting은 현재 출력값만으로는 탐지하기 어렵습니다. 만약 제3자로부터 MoE 추론 서비스를 구매한다면, 그들이 무엇을 측정하는지 물어보십시오.
핵심 요약
- MoE는 지식과 연산(compute)을 분리합니다. 전체 파라미터 수(Total params)는 용량(capacity, 메모리 비용); 활성화된 파라미터 수(active params)는 토큰당 비용(cost per token, 연산 비용)입니다. 9월에 공개된 모델들은 이 격차를 24~34배까지 확장했습니다.
- 라우터가 핵심입니다. Top-k 소프트맥스 게이팅(softmax gating)과 가중치 합(weighted sum)은 간단하지만, 로드 밸런싱 손실(load-balancing losses)을 통해 모든 전문가(experts)를 활성화 상태로 유지하는 것이 어렵습니다. 이 부분에서 2026년 연구들(LPR, UniPool)이 강점을 보이고 있습니다.
- 깊은 레이어의 전문가는 중복됩니다. UniPool은 깊은 레이어에서 무작위 라우팅을 하는 것이 약 1포인트의 비용이 든다는 것을 보여주었습니다. 미래는 계층별 전문가 농장(per-layer expert farms)이 아니라 공유된 전문가 풀(shared expert pools)입니다.
- 최전선은 MIT 라이선스를 가진 MoE 단일 문화가 되었습니다. 배포된 7개의 최전선 오픈 가중치 모델 중 6개가 MoE이며, 9월의 플래그십 모델들은 MIT 가중치를 탑재하고 출시되었습니다. 해자(moat)는 가중치에서 서비스 제공(serving)으로 이동했습니다.
- 파라미터 수 대신 서비스 레이어를 주목하세요. 모든-대-모든 통신(all-to-all communication)과 k-션팅(k-shunting)은 2026년에 흥미로운 MoE 문제가 규모가 아니라 시스템 및 검증에 있다는 것을 의미합니다.
참고 노트북: moe_mixture_of_experts.ipynb — NumPy로 작은 MoE 레이어를 처음부터 구축해 보세요 (라우터, top-2 게이팅, 로드 밸런싱 보조 손실). 이를 장난감 과제(toy task)에 학습시키고, 보조 손실 없이 라우터가 어떻게 무너지는지, 그리고 보조 손실과 함께 어떻게 나타나는지를 관찰해 보세요.
참고 자료(Sources): DeepSeek V4.1 Flash 출시 상세 정보 · MiMo-V2.6 Pro 출시 · GLM-5.3-Flash 모델 카드 · 전문가 셔플: MoE 서빙의 검증 문제 · 전문가 격차: 라우팅과 검증 사각지대 · Mixture of Experts란 무엇인가? (Sep 2026) · UniPool 논문 위키 · 잠재 프로토타입 라우팅 (LPR) · GPT-OSS-20B 배포 분석 · AMD Instella-MoE**
동반 노트북(Companion notebook): 본 게시물을 위한 실행 가능한 튜토리얼 — 여기에서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


