왜 모든 주요 중국 AI 연구소가 MoE를 사용하는가 — 그리고 그것이 당신의 추론 비용에 미치는 영향
요약
중국 AI 연구소들이 DeepSeek, Qwen 등에서 MoE(Mixture-of-Experts) 아키텍처를 채택하는 이유와 그에 따른 추론 비용 효율성을 분석합니다. 총 파라미터로 지식 용량을 확보하고 활성 파라미터로 연산 비용을 낮추는 MoE의 메커니즘을 다룹니다.
핵심 포인트
- MoE는 총 파라미터와 활성 파라미터를 분리하여 지식 용량과 연산 비용을 최적화함
- 중국 모델들은 밀집 모델 대비 활성 파라미터를 10~15배 감소시켜 추론 효율성 극대화
- GPU 가용성 제한과 저렴한 API 수요가 MoE 채택의 주요 동인임
- 특정 언어나 작업에 특화된 전문가 네트워크를 통해 성능과 비용의 균형 달성
지난달 저는 수십 개의 모델을 대상으로 추론 비용 (inference costs)을 비교하던 중 눈에 띄는 점을 발견했습니다. DeepSeek V4 Flash는 _총 파라미터(total parameters)가 235B_이지만, 순전파 (forward pass) 시에는 21B만 사용합니다. Qwen3-235B-A22B도 마찬가지입니다 — 총 235B 중 22B만 활성화됩니다. GLM-5-130B는요? 총 130B이며, 짧은 프롬프트의 경우 대략 15B가 활성화됩니다.
이들은 전통적인 밀집 모델 (dense models)이 아닙니다. 이들은 전문가 혼합 (Mixture-of-Experts, MoE) 아키텍처이며, 모든 주요 중국 AI 연구소는 이 설계에 거액을 베팅했습니다. 실제 워크로드 전반에서 밀집 모델 대안들(GPT-4o, Claude 3.5)과 비교하여 2주 동안 벤치마킹을 수행한 결과, MoE가 실제로 무엇을 제공하는지, 그리고 어디에서 도움이 되지 않는지에 대해 더 명확한 그림을 그리게 되었습니다.
이 포스트에서는 아키텍처의 기초, 저의 벤치마크 결과, 비용 측면의 영향, 그리고 귀하의 프로젝트에서 언제 MoE가 중요한지 결정하기 위한 실질적인 가이드를 다룹니다.
MoE란 무엇인가? (쉬운 설명)
밀집 모델 (GPT-4o 또는 Claude와 같은)은 _모든 토큰에 대해 모든 파라미터를 활성화_합니다. 이를 모든 직원이 모든 회의에 참석하는 회사라고 생각하십시오 — 낭비적이고 비용이 많이 들지만 관리는 단순합니다.
MoE 모델은 수십 개의 더 작은 "전문가 (expert)" 서브 네트워크와 토큰당 가장 관련성이 높은 2~3개의 전문가만을 선택하는 라우터 (router)를 가지고 있습니다. 단일 순전파 과정 동안 대부분의 파라미터는 유휴 상태로 머뭅니다.
밀집 모델 (Dense Model, GPT-4o):
[모든 파라미터 활성화] → [모든 연산 수행] → 출력
비용: 총 파라미터 * 토큰에 비례
...
핵심 통찰: 총 파라미터는 지식 용량 (knowledge capacity)을 결정하며, 활성 파라미터 (active parameters)는 연산 비용 (compute cost)을 결정합니다. 중국 연구소들이 추론 효율성에 최적화한 이유는 (a) 수출 제한으로 인해 GPU 가용성이 더 엄격하기 때문이며, (b) 그들의 타겟 시장이 저렴한 API 가격을 요구하기 때문입니다.
누가 무엇을 왜 사용하는가
2026년 중반 기준 아키텍처 지형을 매핑하며 제가 발견한 내용은 다음과 같습니다:
| 모델 | 총 파라미터 (Total Params) | 활성 파라미터 (Active Params) | 아키텍처 (Architecture) | 제공업체 (Provider) |
|---|---|---|---|---|
| DeepSeek V4 Flash | 235B | ~21B | MoE (top-2) | DeepSeek |
| ... | ||||
| *GLM-5의 라우팅 (routing) 세부 정보는 완전히 공개되지 않았습니다; 활성 파라미터 수는 추론 벤치마크를 통해 추정되었습니다. |
중국 모델들은 기존의 밀집형 (dense) 모델들과 비교했을 때 활성 파라미터를 10~15배 감소시켰습니다. 가격 차이가 발생하는 지점은 바로 이곳입니다. 이는
| Metric | DeepSeek V4 Flash | Qwen3-235B-A22B | GPT-4o |
|---|---|---|---|
| BLEU score | 38.4 | 41.2 | 36.7 |
| ... | |||
| 기술 중국어 콘텐츠의 번역은 명확한 MoE 승리입니다. 전문가 서브 네트워크(expert sub-networks)는 서로 다른 언어 쌍에 특화될 수 있으며, 라우터(router)가 올바른 것을 활성화하도록 학습합니다. 밀집형(dense) 모델은 모든 것에 걸쳐 용량을 동시에 분배해야 합니다. |
구체적인 수치: MoE가 가격 책정 게임을 바꾸는 이유
MoE 모델이 매우 저렴하게 만드는 수학적 근거입니다:
DeepSeek V4 Flash (총 235B, 활성 21B):
- 입력 토큰 1M당 비용: $0.35
- 이는
$0.35 / 21B 활성 파라미터= 활성 파라미터 기가(billion)당 1M 토큰당 $0.0000167입니다.
GPT-4o (추정치 1.8T 밀집):
- 입력 토큰 1M당 비용: $10.00
- 이는
$10.00 / 1800B= 파라미터 기가(billion)당 1M 토큰당 $0.0000056입니다.
잠깐만요 — GPT-4o가 실제로 활성 파라미터당 더 효율적입니다. 하지만 DeepSeek은 토큰당 파라미터의 1.2%만 활성화하는 반면, GPT-4o는 100%를 활성화합니다. 비용 우위를 제공하는 것은 더 나은 파라미터 효율성이 아니라 MoE 희소성(sparsity)입니다.
def cost_per_token(model_params_b: float, active_params_b: float,
price_per_m: float) -> dict:
"""MoE 가격 책정이 작동하는 이유 설명"""
...
MoE가 부족한 부분 (단점)
과장하고 싶지는 않습니다. MoE 접근 방식에는 테스트 중에 제가 발견한 실제 단점이 있습니다:
1. 생소한 작업에서의 라우터 불안정성
약 3~5%의 경우, DeepSeek V4 Flash의 라우터가 특이한 프롬프트에 대해 잘못된 전문가(experts)를 선택합니다. 그 결과는
지연 시간 분포 (10K 배치 요청):
중앙값(Median) P95 P99 분산(Variance)
DeepSeek V4F 1.2s 2.8s 4.1s 0.89
...
실시간 애플리케이션의 경우, 이러한 꼬리 지연 시간 (tail latencies)을 예산에 반영해야 합니다.
3. 긴 문맥 성능 (Long-context performance)의 차별적 저하
128K 문맥 (context)에서 MoE 모델은 문맥의 핵심 (gist)은 유지하면서도 문맥 중간에 있는 특정 사실들을 잃어버리는 경향이 있습니다. 반면 밀집 모델 (Dense models)은 핵심과 사실 모두를 잃어버립니다. 하지만 MoE의 실패 모드는 출력이 틀렸음에도 불구하고 일관되게 들리기 때문에 감지하기가 더 어렵습니다.
실무적 조언: MoE를 언제 사용해야 하는가
제 벤치마크를 바탕으로 한 현재의 의사 결정 프레임워크는 다음과 같습니다:
| 사용 사례 | 권장 모델 | 이유 |
|---|---|---|
| 배치 번역 (Batch translation) | MoE (DeepSeek/Qwen) | 아시아 언어에 대해 최고의 품질/비용 비율 제공 |
| ... |
통합된 접근 방식
각 모델마다 별도의 API 키를 관리하는 것은 골칫거리가 되어가고 있었습니다. DeepSeek은 별도의 속도 제한 (rate limit)이 있고, Qwen은 또 다르고, GLM은 다른 결제 시스템을 요구합니다. 저는 tokencnn.com을 통해 모든 것을 라우팅함으로써 이 문제를 해결했습니다. 이곳은 단일 OpenAI 호환 엔드포인트를 통해 이 모든 모델을 제공합니다.
import openai
client = openai.OpenAI(
...
중국 전화번호도, WeChat도, 은행 송금도 필요하지 않습니다. 이메일로 가입하고 1달러의 무료 크레딧을 받으면, 위의 모든 모델을 단일 API 키로 사용할 수 있습니다.
결론
MoE 아키텍처에 대한 중국 AI 연구소들의 베팅은 비용 절감을 위한 편법이 아닙니다. 이는 저렴한 가격으로 고품질 추론 (inference)이 필요한 시장을 겨냥한 영리한 엔지니어링 선택입니다. 희소성 비율 (sparsity ratios, 활성 파라미터 815%)은 밀집 모델 품질의 8592%를 비용의 3~10%만으로 얻을 수 있음을 의미합니다.
제 개인 프로젝트의 경우, 하이브리드 접근 방식을 채택했습니다. MoE 모델이 일일 API 볼륨의 80%(배치 처리, 번역, 코드 리뷰)를 처리하고, 밀집 모델은 지연 시간에 민감한 고객 대면 기능용으로 남겨둡니다. 그 결과, 사용자들에게 눈에 띄는 품질 저하 없이 저의 월간 API 지출을 약 400달러에서 약 55달러로 줄였습니다.
MoE와 Dense(밀집) 구조 사이의 아키텍처 선택은 귀하의 수익(bottom line)에 직접적인 영향을 미칩니다. 이제 차이점을 식별하는 방법을 알게 되었으므로, 귀하의 워크로드(workload)에 맞춰 정보에 기반한 결정을 내릴 수 있습니다.
중국 결제 시스템을 거치지 않고 DeepSeek, Qwen 또는 GLM의 MoE 모델을 테스트해보고 싶다면: tokencnn.com — $1 무료 크레딧, 하나의 OpenAI 호환 API 키로 즉시 접속 가능합니다. 저는 각 제공업체마다 별도의 결제 방식과 씨름하는 것에 지쳐 이 서비스를 만들었습니다.
MoE 모델에 대한 귀하의 경험은 어떠신가요? 제가 설명한 라우터 실패 모드(router failure modes)를 경험하셨나요, 아니면 귀하의 사용 사례에서는 문제가 되지 않나요? 아래에 댓글을 남겨주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기