
중국계 프론티어 공개 가중치(Open-weight) LLM을 셀프 호스팅하는 것이 경제적으로 합리적인가
요약
중국계 프론티어 공개 가중치(Open-weight) LLM을 직접 구축(Self-hosting)할 때의 경제성을 분석했습니다. 분석 결과, 대량의 안정적인 수요와 높은 처리량이 보장되지 않는다면 API를 사용하는 것이 더 경제적입니다.
핵심 포인트
- 셀프 호스팅은 높은 월간 토큰 수요가 뒷받침되어야 API보다 저렴함
- 개인 및 소규모 팀은 데이터 주권 목적이 아니라면 API 이용이 합리적
- 가동률 부족 시 전기 요금 및 자본 비용이 API 비용을 상회할 수 있음
- 손익분기점 달성을 위해 모델별로 요구되는 최소 토큰량이 상이함
서론
결론부터 말하자면, 공개 가중치(Open-weight)라는 점과 셀프 호스팅(Self-host)이 저렴하다는 점은 별개의 문제입니다. 2026년 7월 10일 시점의 중국계 프론티어 모델 6종을 대상으로, 공식 레시피(Recipe)에 기재된 구동 가능한 GPU 구성을 바탕으로 전력, 초기 투자, 코로케이션(Colocation), 자본 비용, 공식 API 가격을 비교 분석했습니다.
입력 80%·출력 20%, 캐시(Cache)가 없는 고정 케이스의 경우, API보다 저렴해지기 위해 필요한 월간 수요는 Qwen3.6-27B 단일 GPU 구성 시 약 7.5억 token, 8GPU급에서는 약 81.6억~543.8억 token입니다.

그림의 막대는 수요 예측이 아니라, 내부 이용 TCO(Total Cost of Ownership)의 손익분기점입니다. 인건비, 외부 API 운영, SLA를 위한 이중화 비용은 포함되지 않았습니다. Qwen은 단일 GPU, DeepSeek·Kimi·Hy3는 8×H200, GLM·MiniMax는 8×B200의 고정 케이스입니다. DeepSeek의 8×H200은 공식 레시피상 800K context로 제한되어 있어, 1M API와 기능적으로 동일하지 않습니다. 필요한 평균 tok/s는 유지보수 및 수요 변동을 포함한 달력 시간(Calendar time) 평균이며, 순간적인 벤치마크 값이 아닙니다.
주요 판단 기준은 다음과 같습니다.
| 이용자·모델 | 이번 판단 |
|---|---|
| 개인, 연구실, 소규모 팀 | 대형 5개 모델은 가격 측면에서 API 또는 단기 클라우드가 합리적임. 데이터 주권, 오프라인 이용, API로는 얻을 수 없는 제어성에 별도의 가치가 있는 경우를 제외하고 |
| ... |
따라서 현시점의 답은, 대량이며 안정적인 기지 수요가 있고, 대상 구성의 벤치마크가 손익분기점 throughput을 상회하는 경우에만 합리적입니다. 수요를 확인하기 전에 셀프 호스팅 설비를 도입할 경우, 가동률 부족이 전기 요금의 차이를 쉽게 상회하게 됩니다.
비교 모델을 중국계 각사의 프론티어 모델로 한정함
비교 대상은 중국계 주요 개발 기업으로부터 1개 모델씩 다음 조건에 따라 선정했습니다.
- 2026년 7월 10일 시점에 기업 스스로 배포하는 가중치를 취득할 수 있음
- 범용적인 대화, 추론, 코딩, Agent 용도를 겨냥한 최신급 모델임
- 공식 또는 추론 엔진 개발사의 실행 레시피(Execution recipe)가 있음
- 동일 기업의 소형·구세대·용도 특화 모델을 중복해서 포함하지 않음
Moonshot은 더 최신인 Kimi K2.7 Code가 아니라, 범용 프론티어 모델인 Kimi K2.6을 사용합니다. Qwen 역시 폐쇄형 최상위 API 모델이 아니라, 공개 가중치인 Qwen3.6-27B를 대상으로 합니다.
| 개발사 | 모델 | 공개일 | 총/active parameters | context | 공개 checkpoint | license |
|---|---|---|---|---|---|---|
| Alibaba / Qwen | Qwen3.6-27B | 2026-04-22 | dense 27B | native 262,144 | BF16 55.6GB, FP8 30.9GB | Apache-2.0 |
| ... |
파일 사이즈는 각사의 Hugging Face 리포지토리에 있는 *.safetensors를 합산한 값이며, tokenizer나 설정 파일은 포함하지 않습니다. GLM-5.2는 자료에 따라 약 743B~753B로 계산 방식이 다릅니다. 본문에서는 backbone의 공식 설명에 가까운 약 744B/40B active를 사용하며, 공개 tensor inventory에는 MTP 등이 포함될 가능성이 있는 것으로 취급합니다.
또한, 공개 가중치라 하더라도 라이선스(License)는 동일하지 않습니다. Kimi K2.6에는 대규모 상용 제품에서의 표시 조건이 있으며, MiniMax-M3에는 표시, 통지, 일정 규모 이상에서의 사전 승인 등의 추가 조건이 있습니다. API 가격뿐만 아니라, 상정된 용도가 라이선스에 부합하는지도 도입 전에 확인해야 합니다.
「가중치가 공개됨」과 「저렴하게 제공할 수 있음」을 구분하기
공식 레시피를 통해 확인할 수 있는 대표 구성은 다음과 같습니다.
| 모델 | 공식 레시피에서 확인 가능한 구성 | 이번 비용 케이스 |
|---|---|---|
| Qwen3.6-27B | SGLang cookbook은 H100/H200/B200 × 1, vLLM은 FP8 기준 40GB급 × 1 | 96GB급 GPU를 1장 탑재한 워크스테이션 |
| ... |
DeepSeek의 비용 케이스는 공식 API의 1M context와 기능적으로 동일하지 않습니다. 1M 전체 길이를 필수적으로 요구하는 경우에는 B300 등의 구성을 별도로 견적 내야 하며, 이는 이번 8×H200 손익분기점보다 불리해집니다.
여기서 확인할 수 있는 것은 체크포인트(checkpoint)가 GPU 메모리에 들어가 추론 서버를 기동할 수 있다는 점까지입니다. 경제성을 결정하는 것은 다음 조건을 만족하는 **판매 가능한 굿풋(goodput)**입니다.
- 목표로 하는 입력 길이 및 출력 길이에서 작동할 것
- P95의 TTFT(Time To First Token)와 TPOT(Time Per Output Token)가 서비스 목표를 충족할 것
- 에러, 타임아웃, 재시도를 제외한 토큰(token)만을 계산할 것
- 돌발 부하, 유지보수, 장애를 위한 용량 여유를 남겨둘 것
- 해당 처리량에 걸맞은 실제 수요가 존재할 것
모델 카드에 "8GPU에서 작동함"이라고 적혀 있더라도, 이 조건들이 증명되는 것은 아닙니다.
초기 투자비를 현재의 완제품 서버 가격으로 설정
완제품 8GPU 서버의 가격 기준점(anchor)으로는 Exxact의 HGX 제품 목록에 게시된 시작 가격을 사용합니다. 2026년 7월 10일 스냅샷 기준으로, 8×H200 완제품 서버는 299,890.80달러, 8×B200 완제품 서버는 383,707.50달러입니다. 환율은 일본은행의 2026년 7월 보고 예정 환율인 1달러당 158엔으로 고정합니다.
국내 OEM, 유지보수, 운송, 설치, 메모리, 스토리지 구성에 따라 실제 견적은 달라집니다. 따라서 완제품 서버 가격에 설치비, PDU, 케이블, 예비비로서 10%를 가산합니다.
| 구성 | 완제품 서버 가격 | 10% 도입비 포함 초기 투자비 | 주요 대상 |
|---|---|---|---|
| 단일 GPU 워크스테이션 | 고정 시나리오 입력 | 300만 엔 | Qwen3.6-27B |
| 8×H200 | 약 4,738만 엔 | 약 5,212만 엔 | DeepSeek, Kimi, Hy3 |
| 8×B200 | 약 6,063만 엔 | 약 6,669만 엔 | GLM, MiniMax |
단일 GPU의 300만 엔은 완제품의 공개 견적이 아닙니다. RTX PRO 6000 Blackwell급 96GB GPU, CPU, RAM, SSD, 전원, 예비비를 합산한 비교용 고정값입니다. Qwen의 공식 FP8 레시피(recipe)는 40GB급에 들어오므로 용량에는 여유가 있지만, 이 워크스테이션에서 필요한 처리량(throughput)이 나올지는 별도로 확인해야 합니다.
월간 TCO는 전기료만으로 결정되지 않는다
셀프 호스팅 설비의 취득액을 상정하여 단순히 36개월로 나누는 것이 아니라, 이번에는 4년, 자본 비용 5%의 자본 회수 계수(CRF)를 사용합니다.
CRF = r(1+r)^n / ((1+r)^n - 1)
= 5% × 1.05^4 / (1.05^4 - 1)
≈ 0.2820
...
코로케이션(Colocation)은 고밀도 GPU 시설의 실제 견적이 아니라, Qualisite의 공개 가격을 전력 및 공조를 포함한 가격 프록시(proxy)로 사용합니다. 8×H200은 4회로, 8×B200은 5회로 상당으로 설정합니다. 실제로는 IDCF의 고부하 하우징 등에서 수전 용량, 중복 회로, 무게, 냉각 방식을 지정하여 견적을 의뢰해야 합니다.
| 연간 비용 | 단일 GPU | 8×H200 | 8×B200 |
|---|---|---|---|
| 자본 회수 | 84.6만 엔 | 약 1,469.9만 엔 | 약 1,880.7만 엔 |
| ... | 연간 TCO | 약 125.5만 엔 | 약 2,412.1만 엔 |
| 월 환산 | 약 10.5만 엔 | 약 201.0만 엔 |
단일 GPU의 전력·설치비 13.9만 엔/년은 시스템 전체를 idle 0.25kW, load 0.85kW, 계산 가동률 50%, PUE 1.2, 24.07엔/kWh로 설정한 고정 시나리오입니다. 실제로 도입을 검토할 때는 대상 구성의 콘센트 측 전력으로 교체해야 합니다.
이 TCO는 내부 이용을 위한 추론 기반을 비교하기 위한 값입니다. 인건비, API 게이트웨이, DDoS 방어, 과금, 24시간 온콜(on-call), 세금, 모델 업데이트 비용, 이중화는 포함되지 않습니다. 외부용 SLA를 가진 API라면 최소한 중복 노드와 운영비를 추가해야 합니다.
클라우드라면 낮은 가동률의 설비를 떠안지 않아도 된다
Nebius의 공시 가격은 H200이 4.50달러, B200이 7.15달러/GPU일 때입니다. 8×B200을 1년간 예약 없이 연속 사용하면 약 7,917만 엔이 되어, 셀프 호스팅 설비를 보유하는 상정의 연간 TCO 약 3,036만 엔보다 높게 보입니다.
하지만 필요한 시간만큼만 빌리는 경우의 분기점은 다음과 같습니다.
- 8×B200 설비 보유와 온디맨드(on-demand)의 분기점은 달력 시간 가동률 약 38%
- 최대 35%의 커밋 할인(commitment discount)을 받을 수 있다면, 설비 보유의 분기점은 약 59%
- 8×H200도 마찬가지로, 낮은 가동률이나 모델 업데이트 리스크가 큰 동안에는 클라우드가 유리
즉, PoC(Proof of Concept) 단계에서 셀프 호스팅 설비 보유를 정당화하기는 어려우며, 우선 클라우드에서 실제 부하를 재생산하고 가동률이 분기점을 넘을 것으로 예상될 때 셀프 호스팅으로 전환하는 순서가 합리적입니다.
일본의 전력 가격을 바꿔도, GPU의 가동률이 더 중요하다
도쿄 전력의 2026년 고압·간토 「시장 조정 제로 플랜」의 전력량 요금 17.21엔/kWh, 계량 기간의 시기가 매월 1일이 아닌 경우의 2026년 7월 연료비 조정 2.68엔/kWh, 2026년도 재생 에너지 부과금 4.18엔/kWh를 단순 합산하여 기준을 24.07엔/kWh로 설정합니다. 매월 1일 기산되는 7월분은 해당 시점에 미확정 상태이며, 별도의 수요 기본 요금도 부과됩니다.
설비 가격 앵커(Anchor)로 삼은 Exxact 본체에는 공개된 벽면 전력 실측값이 없습니다. 따라서 동일하게 8×B200을 탑재한 NVIDIA DGX B200의 최대 14.3kW를 고부하(High case)의 프록시(Proxy)로 사용합니다. 또한, Vultr의 실기 가이드가 나타내는 8GPU 합계 풀 로드(Full load) 5.68.0kW에 호스트 측 1.21.4kW를 시나리오 입력값으로 더하여, 시스템 약 6.8~9.4kW를 실제 부하의 기준으로 삼습니다. 도입 검토 시에는 NVIDIA의 Redfish API 또는 PDU를 통해 얻은 대상 구성의 측정값으로 대체합니다.
| 케이스 | IT 부하 | PUE | 전력 단가 | 연간 전력량 요금 |
|---|---|---|---|---|
| 저(Low) | 6.83kW | 1.3 | 20엔/kWh | 약 156만 엔 |
| ... |
이 표는 셀프 호스팅 설비에서 전기를 직접 지불하는 상황만을 가정한 민감도 분석(Sensitivity analysis)입니다. 전력비의 높고 낮음 외에도, 6,000만 엔급의 초기 투자를 낮은 가동률로 부담하게 될 영향도 별도로 평가해야 합니다.
참고로, 위 TCO(Total Cost of Ownership) 표에서는 코로케이션(Colocation) 요금에 전력·공조를 포함하고 있습니다. 여기에 PUE를 곱한 전기 요금을 다시 더하면 이중 계산이 됩니다. 자사 설비 케이스와 코로케이션 케이스는 별도로 사용합니다.
공식 API 가격을 동일한 입력·출력 비율로 변환
API 가격은 입력과 출력에 따라 다릅니다. 주요 케이스는 입력:출력=4:1, 캐시 히트(Cache hit)=0%이므로, 100만 토큰 과금당 혼합 가격을 다음과 같이 계산합니다.
혼합 가격 = 0.8 × 입력 가격 + 0.2 × 출력 가격
달러 가격은 1달러당 158엔, 중국 가격은 동일한 일본은행의 2026년 7월 보고 환율인 1위안=0.146달러를 기준으로 하여 1위안=23.1엔으로 반올림합니다. Qwen, GLM, Hy3는 중국 국내의 저렴한 공식 가격을 주요 케이스로 사용하므로, 셀프 호스팅 측면에서는 엄격한 비교가 됩니다. Singapore 또는 Global 요금을 적용하면 분기량은 낮아집니다.
| 모델 | input / 1M | output / 1M | 혼합 가격 / 1M | 가격 지역 |
|---|---|---|---|---|
| Qwen3.6-27B | 3위안 | 18위안 | 약 138.6엔 | Alibaba 중국 본토 |
| DeepSeek-V4-Pro | $0.435 | $0.87 | 약 82.5엔 | DeepSeek 표준 |
| Kimi K2.6 | $0.95 | $4.00 | 약 246.5엔 | Kimi Global |
| GLM-5.2 | 8위안 | 28위안 | 약 277.2엔 | Z.ai 중국 |
| MiniMax-M3, 512K 이하 | $0.30 | $1.20 | 약 75.8엔 | 현행 50% 할인 가격 |
| Hy3 | 1위안 | 4위안 | 약 37.0엔 | Tencent TokenHub 광저우 |
가격 출처는 Alibaba Model Studio, DeepSeek API, Kimi K2.6, Z.ai, MiniMax PAYG, Tencent TokenHub입니다.
지역, 세금, 장문 티어(Tier), 배치(Batch), 계약 할인, 무료 구간 등은 일치하지 않습니다. 이는 표준 가격을 동일한 토큰 비율로 변환한 비교이며, 각 사의 평균 실현 단가는 아닙니다.
API보다 저렴해지는 분기점 계산
월간 손익 분기량과, 이를 월 730시간 동안 처리하기 위한 평균 total tok/s는 다음과 같이 구합니다.
월간 분기 토큰 = 월간 TCO ÷ 혼합 가격 × 1,000,000
필요 평균 total tok/s = 월간 분기 토큰 ÷ (730 × 3,600)
| 모델 | 비용 구성 | 월간 TCO | 월간 손익분기점 토큰 | 필요 평균 total tok/s |
|---|---|---|---|---|
| Qwen3.6-27B | 단일 GPU | 약 10.5만 엔 | 약 7.55억 | 287 |
| DeepSeek-V4-Pro | 8×H200 | 약 201.0만 엔 | 약 243.7억 | 9,274 |
| Kimi K2.6 | 8×H200 | 약 201.0만 엔 | 약 81.6억 | 3,103 |
| GLM-5.2 | 8×B200 | 약 253.0만 엔 | 약 91.3억 | 3,473 |
| MiniMax-M3 | 8×B200 | 약 253.0만 엔 | 약 333.6억 | 12,695 |
| Hy3 | 8×H200 | 약 201.0만 엔 | 약 543.8억 | 20,694 |
이 평균값에는 가동 중지 시간(downtime)도 포함됩니다. 가용성(availability) 99%, 판매 가능 용량(sellable capacity) 60%로 가정한다면, 벤치마크 시의 생(raw) throughput은 이 값을 0.99 × 0.60으로 나눈 수준을 상회해야 합니다. 예를 들어 GLM-5.2라면, 단순한 최저선은 약 5,847 total tok/s입니다.
공개 벤치마크로 어디까지 판단할 수 있는가
6개 모델 모두에 대해 동일한 GPU, 정밀도(precision), 입력 길이, 출력 길이, 동시 실행 수, SLO의 공식 결과는 없습니다. 따라서 공개된 값은 손익분기 throughput의 타당성을 확인하는 용도로만 사용하며, 누락된 값을 active parameter 수로부터 보간(interpolation)하지 않습니다.
| 모델 | 공개값으로 알 수 있는 것 | 경제성 판단 |
|---|---|---|
| Qwen | GPU 버전의 절대 throughput 결과 없음 | 대상 구성에서 평균 287 tok/s를 확인하기 전까지 미확정 |
| ... |
GLM-5.2의 높은 throughput 측정값도 그대로 대화 API의 판매 가능량은 아닙니다. 이전 기사에서 참조한 측정 지점은 TTFT(Time To First Token)가 길어서, 저지연(low latency) 대화 SLO를 적용하면 goodput이 떨어집니다. 이번에 "GLM은 후보"라고 판단한 것도 동일한 4:1 워크로드에서 P95 TTFT·TPOT를 고정한 재측정이 조건입니다.
캐시(Cache)가 효과적일수록 API가 더욱 유리해진다
주요 케이스에서 cache hit을 0%로 설정한 이유는 Qwen3.6-27B에 비교 가능한 cache 가격이 없어 모든 기업을 동일하게 맞추기 위해서입니다. 실제로는 DeepSeek, Kimi, GLM, MiniMax, Hy3가 cache hit에 대해 큰 할인 혜택을 제공하고 있습니다.
cache hit률을 h라고 하면, 1개 요청당 API 비용은 다음과 같습니다.
API 비용
= input tokens × ((1-h) × miss 가격 + h × hit 가격)
+ output tokens × output 가격
긴 system prompt, 코드베이스, 대화 이력을 반복하는 용도에서는 API 측의 cache hit이 올라가며, 셀프 호스팅의 손익분기점 토큰량은 더욱 늘어납니다. 반면, 셀프 호스팅 추론에서도 prefix cache를 사용할 수 있지만, 절감할 수 있는 것은 계산량(computation)이지 보유 GPU의 고정비가 아닙니다. 수요가 적은 상태에서는 캐시로 확보된 시간을 다른 유료 처리로 채우지 못한다면 TCO는 낮아지지 않습니다.
셀프 호스팅이 합리적이 되는 4가지 조건
이번 비교를 통해 셀프 호스팅 설비 보유를 합리화할 수 있는 조건은 다음 4가지입니다.
- 수요가 이미 존재함: 미래의 기대치가 아니라, API 로그를 통해 월간 토큰량과 시간대 분포를 확인할 수 있음
- SLO가 적용된 goodput이 손익분기점을 넘음: 최대 throughput이 아니라 P95 지연 시간을 준수하는 accepted token으로 측정함
- 가동률이 클라우드와의 손익분기점을 넘음: B200의 경우 온디맨드(on-demand) 대비 약 38%, 할인 클라우드 대비 약 59%가 기준
- 설비를 3~5년 사용할 수 있음: 신규 모델이 다른 정밀도(precision), 다른 GPU, 더 큰 HBM을 요구하더라도 자산이 노후화(obsolescence)되지 않음
반대로, 다음 용도는 API 또는 단기 클라우드가 합리적입니다.
- 월별 수요 변동이 큰 경우
- 최신 모델로 몇 달마다 교체하는 경우
- 1M context를 가끔만 사용하는 경우
- 24시간 대응이나 GPU 고장에 대비한 예비기를 셀프 호스팅 환경으로 준비할 수 없는 경우
- API의 batch, cache, 연간 계약 할인을 이용할 수 있는 경우
데이터를 외부로 내보낼 수 없거나, 폐쇄망(air-gapped)·오프라인에서 구동해야 하거나, 모델 내부를 수정해야 하는 경우에는 가격 이외의 편익을 금액으로 환산해야 합니다. 그 편익이 연간 TCO 차이보다 크다면, 토큰 단가에서 밀리더라도 셀프 호스팅은 합리적일 수 있습니다.
셀프 호스팅 도입 결정 전 수행하는 클라우드 검증
최종 판단을 위해서는 셀프 호스팅 후보와 동일한 GPU 구성을 클라우드에서 대여하여, 최소한 다음 항목들을 측정해야 합니다.
| 검증 | 고정 조건 | 획득 값 |
|---|---|---|
| 단문 | 2K input → 256 output | P50/P95 TTFT, P95 TPOT, goodput |
| ... |
비교에 사용하는 토큰(token) 수는 클라이언트에게 정상적으로 반환된 input + output 토큰입니다. ignore_eos를 사용한 합성 부하(synthetic load)의 최대치만으로 도입 여부를 결정하지 않습니다.
실측 후에는 다음 식에 대입합니다.
셀프 호스팅 원가 (원 / 1M token)
= 연간 TCO × 1,000,000
÷ 연간 SLO를 충족하는 input + output token
이 원가가 캐시(cache), 배치(batch), 계약 할인(contract discount)이 반영된 실제 API 청구 단가보다 충분히 낮고, 수요 하락과 고장(failure) 가능성을 고려하더라도 차이가 유지될 경우에만 셀프 호스팅 설비 보유를 선택합니다.
결론
2026년 7월 시점의 중국계 프론티어 공개 가중치(Open-weight) 모델은 단일 GPU부터 8 GPU까지 공식 레시피상의 실행 구성이 존재합니다. 하지만 경제성의 핵심은 전력 단가가 아니라, GPU 초기 투자, 가동률, 코로케이션(colocation), SLO가 보장된 처리량(throughput), 그리고 실제 수요였습니다.
이번 고정 케이스에서는 Qwen3.6-27B는 월 약 7.5억 토큰, GLM-5.2는 약 91.3억 토큰 지점부터 셀프 호스팅이 공식 API 가격과 대등해집니다. GLM은 공개 벤치마크상 그 분기점을 넘을 수도 있으나, 대화 SLO와 수요는 아직 검증되지 않았습니다. DeepSeek, MiniMax, Hy3는 API가 저렴하여, 소수 노드로 대항하려면 매우 높은 이용률이 필요합니다.
따라서 실무적인 순서는 API 로그로 수요를 확인한다 → 동일한 GPU를 단기 렌탈한다 → 실제 부하의 goodput와 벽 전력(wall power)을 측정한다 → 분기점을 넘은 후에 셀프 호스팅으로 이행한다가 됩니다. 공개 가중치는 셀프 호스팅할 권리를 부여하지만, 셀프 호스팅을 해야 할 이유까지 부여하지는 않습니다.
다음 기사에서는 이 셀프 호스팅 TCO와 필요 처리량(throughput)을 중국계 각사의 공식 API 가격, 기술 발표, 재무 공시와 대조하여, 추론 판매 그 자체로 이익이 나고 있다고 어디까지 추정할 수 있는지 검토하겠습니다.
주요 1차 자료
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기