
중국계 LLM API는 추론에서 이익을 내고 있는가
요약
중국계 LLM API의 가격 경쟁력과 추론 비용 간의 상관관계를 분석합니다. GPU TCO와 API 가격을 비교하여 API 사업의 매출총이익과 회사 전체의 수익성 사이의 차이를 설명합니다.
핵심 포인트
- 중국계 LLM API 가격과 GPU 추론 원가 간의 채산성 분석
- API 사업의 매출총이익과 전사적 이익(R&D 포함)의 구분 필요성
- Zhipu 등 일부 기업의 API 플랫폼 매출총이익 양수 확인
- 추론 비용(Serving Cost)과 전체 사업 수익성의 차이 강조
서론
중국계 LLM API의 가격을 보면, 100만 token당 수십 엔(Yen) 수준인 모델이 있습니다. 이 가격으로 고가의 GPU를 구동하여 정말로 이익을 낼 수 있을까요?
전편에서는 Qwen, DeepSeek, Kimi, GLM, MiniMax, Tencent Hy3의 공개 가중치(Open Weights)를 공식 레시피에 따라 셀프 호스팅(Self-hosting)할 때의 비용을 시산했습니다. 본고에서는 그 TCO(총 소유 비용)와 필요 throughput(처리량)을 각사의 공식 API 가격, 기술 발표, 재무 공시와 대조해 보겠습니다.
먼저, 입력 80%·출력 20%, cache hit(캐시 히트)가 없는 공식 표준 가격을 동일한 8×B200 노드의 이용량별 코스트와 나란히 배치합니다.

세로선은 전편에서 시산한 8×B200의 셀프 호스팅 상정 TCO(월 약 16,013달러)를 월 100억·300억·600억 token으로 나눈 것뿐입니다. 각사의 GPU, 실효 throughput, 계약 할인을 알지 못하므로 프로바이더의 실제 원가를 나타내는 선은 아닙니다. Qwen은 단일 GPU 구성이 가능하므로 이 공통 노드 선의 직접적인 비교 대상에서 제외됩니다.
결론은 다음 3단계로 나눌 필요가 있습니다.
추론 설비 포함 채산성: 가동률이 높다면 양(+)의 값을 가질 수 있음. GLM은 공개 벤치마크를 통해 참고치를 만들 수 있고, DeepSeek에도 구세대 GPU 비용 proxy(대리 지표)가 있음 -
API 사업의 매출총이익: Zhipu(智谱)는 2025년 Open Platform/API에서 18.9%의 양(+)의 매출총이익을 공시함. MiniMax도 API를 포함한 기업용 구분에서 69.4%였으나, API 단독은 아님 -
회사 전체의 이익: 학습, 연구자, 판촉비를 제외하면 별개의 문제임. Zhipu와 MiniMax는 대규모 연구개발비와 조정 후 적자를 기록하고 있음
따라서, "중국계 LLM API는 전부 원가 미달이다"라는 증거도, "현행 프론티어 모델은 전사 흑자다"라는 증거도 없습니다. 공개 자료를 통해 강력하게 말할 수 있는 것은, 적어도 Zhipu에서는 과거의 API/Open Platform 판매 자체가 양(+)의 매출총이익이었다는 점이며, 다만 현행 GLM-5.2 고유의 채산성까지는 공시되지 않았다는 것입니다.
"이익"을 3종류로 나누기
추론 API 논의에서는 다음 세 가지가 혼동되기 쉽습니다.
API 매출
− 추론 GPU의 감가상각·리스
− 추론 전력·데이터 센터·회선·추론 운영
...
모델 개발 회사가 적자더라도 API 사업의 매출총이익이 양(+)일 수는 있습니다. 반대로 추론 노드 단체의 계산이 흑자라 하더라도, 학습비와 연구개발비까지 회수할 수 있다고는 장담할 수 없습니다.
본고에서 "추론 원가"라고 부르는 것은 별도의 언급이 없는 한 최상단의 serving cost(서빙 비용)입니다. 전편의 TCO에는 자본 회수, 코로케이션(Colocation), 회선 등의 고정비도 포함되어 있으므로, 여기서 계산하는 margin(마진)은 회계상의 매출총이익도, 엄밀한 한계 이익도 아닌 편의적인 serving margin proxy입니다. 학습비를 token에 무리하게 배분하지 않습니다.
현행 6개 모델의 공식 가격
주요 케이스는 입력:출력=4:1, cache hit=0%입니다.
| 개발사 / 모델 | Cache miss input | Cache hit | Output | 4:1 혼합 가격 |
|---|---|---|---|---|
| Alibaba / Qwen3.6-27B, 중국 내륙 | 3위안 | 별도 가격 없음 | 18위안 | 6위안 / 약 138.6엔 |
| ... |
환산은 1달러=158엔, 일본은행의 2026년 7월 보고 성령 환율에 있는 1위안=0.146달러에서 1위안=23.1엔으로 반올림합니다. Qwen, GLM, Hy3는 저렴한 중국 국내 가격을 사용합니다. Qwen의 Singapore는 $0.60/$3.60, GLM의 Global은 $1.40/$4.40이므로, 해외 가격으로 보면 셀프 호스팅과의 가격 차이는 더 벌어집니다.
가격 출처는 Alibaba Model Studio, DeepSeek API, Kimi K2.6, Z.ai, MiniMax PAYG, Tencent TokenHub입니다. 중국 내륙, 광저우, Global이 혼재되어 있으며, 세금, 이용 가능 지역, 장문 tier(계층)도 통일되어 있지 않습니다. 이는 동일 지역에서 이용할 수 있는 6개 모델의 나란한 비교가 아니라, 각사의 공식 표준 가격을 관측하는 표입니다.
또한, 이는 리스트 가격(List Price)입니다. batch, 연간 계약, 무료 구간, 판촉, Coding Plan, 기업 개별 계약을 사용하면 실현 단가는 낮아집니다. cache hit 또한 입력 가격을 크게 낮춥니다. 따라서 리스트 가격으로부터 계산하는 매출은 평균 판매 단가의 상한선에 가깝습니다.
추론 원가를 어떻게 추측할 것인가
프로바이더의 GPU 조달 가격, 가동률, 라우팅, 장애율, 실제 트래픽은 비공개입니다. 따라서 원가 추측을 3단계로 나눕니다.
| 추측 방법 | 활용 가능한 것 | 강점 | 한계 |
|---|---|---|---|
| A: 동일 모델의 절대적 throughput | 공개 벤치마크 × 셀프 호스팅 (Self-host) TCO | 토큰 (token) 원가를 직접 계산할 수 있음 | SLO, 부하, GPU가 실제 운영 환경과 다름 |
| ... | |||
active parameter 수만으로 throughput을 비례 계산하는 방식은 사용하지 않습니다. attention, expert routing, precision, MTP, 통신, 입력 길이(input length)에 따라 결과가 크게 달라지기 때문입니다.
Alibaba / Qwen: 전용 배포 가격은 있으나, 용량을 알 수 없음
Qwen3.6-27B는 dense 27B 모델이며, 공식 FP8 checkpoint는 약 30.9GB입니다. vLLM 레시피(recipe)를 따르면 40GB급 GPU 1장에 수용 가능하므로, 6개 모델 중 설비 규모가 크게 다릅니다.
전편의 단일 GPU 고정 케이스는 연간 TCO 약 125.5만 엔, 월 약 10.5만 엔이었습니다. 중국 API의 4:1 혼합 가격인 약 138.6엔/100만 토큰과 비교하면, 분기점은 월 약 7.55억 토큰, 달력 시간(calendar time) 평균 287 total tok/s입니다.
Alibaba는 별도로 Qwen3.6-27B의 전용 모델 배포를 월 24,600위안에 판매하고 있습니다. Pay-as-you-go 방식의 혼합 가격인 6위안/100만 토큰과의 분기점은 다음과 같습니다.
24,600위안 ÷ 6위안 × 1M
= 41억 토큰 / 월
= 달력 시간 평균 약 1,560 total tok/s
이는 흥미로운 가격 차이지만, 전용 인스턴스의 보장 throughput이 공개되지 않았기 때문에 Alibaba의 원가를 역산할 수 없습니다. 24,600위안은 원가가 아니라 전용 서비스의 소매 가격입니다.
Alibaba의 FY2026 Cloud Intelligence 매출은 1,581.32억 위안, adjusted EBITA는 142.65억 위안으로, 산술적인 마진(margin)은 약 9.0%입니다. 마지막 분기에는 외부 클라우드 매출의 30%가 AI 관련이었습니다. 다만, IaaS, PaaS, Model Studio, 기업 계약이 혼재되어 있어 Qwen API만의 매출 총이익은 아닙니다.
판단: Qwen은 단일 GPU에 수용되어 고정비를 작게 유지하기 쉬운 반면, 필요한 평균 287 tok/s를 SLO 내에서 충족한다는 공식적인 실측치는 없습니다. 셀프 호스팅의 채산성도, Alibaba Qwen3.6 API 고유의 이익률도 미확정 상태입니다.
DeepSeek: 구세대 자기 공개 데이터 기준 GPU 비용 proxy는 약 $0.112/M
DeepSeek는 6개사 중 과거의 추론 운영을 가장 구체적으로 공개하고 있습니다. 2025년 DeepSeek-V3/R1 추론 시스템 개요에서는 24시간 평균 226.75 노드, 1노드당 8×H800을 사용하여 608B input token과 168B output token을 처리한 사례를 보여주었습니다.
해당 회사가 설정한 H800 1GPU당 2달러를 적용하면, GPU 비용 proxy는 하루 87,072달러입니다.
$87,072 ÷ (608B + 168B)
≈ $0.112 / 1M total token
동일한 공개 자료에서는 당시의 cache 구성과 가격을 사용한 이론 매출을 하루 562,027달러로 상정하고 있습니다. 동일한 공개 자료 내에서만 비교하면, GPU 비용 proxy를 제외한 마진은 약 84.5%입니다.
($562,027 − $87,072) ÷ $562,027 ≈ 84.5%
해당 회사가 기재한 545%는 (매출 − GPU 비용) ÷ GPU 비용이며, 매출에 대한 매출 총이익률이 아닙니다. 이 84.5% 역시 V3/R1의 이론 매출에 대한 GPU 비용만의 비율일 뿐, 실제 실현된 매출 총이익은 아닙니다.
- 대상은 V3/R1이며, V4-Pro가 아님
- 2달러/H800은 해당 회사의 가정일 뿐, 실제 조달 비용이 아님
- GPU 비용 proxy에는 통신, 스토리지, 비(非) GPU 설비, 운영 비용이 포함되지 않음
- 회사 측에서도 이론 매출보다 실제 매출이 대폭 적다고 명시함
V4-Pro는 1.6T total / 49B active이며, native mixed FP4/FP8 방식입니다. 공식 모델 카드(model card)에 따르면, V3.2와 비교하여 1M context에서 single-token FLOPs를 27%, KV cache를 10%로 억제했다고 합니다. DSpark도 speculative decoding의 개선율을 공표했으나, 절대적 throughput 조건이 결여되어 있어 현재의 원가로 업데이트할 수 없습니다.
판단: DeepSeek의 과거 공개 정보는 가동률이 높은 구세대 시스템에서 GPU 비용 proxy가 이론적 매출보다 낮아질 수 있었던 사례입니다. 이는 V4-Pro의 현재 원가, 실현 매출, 회사 이익의 증거가 될 수 없습니다.
Moonshot / Kimi: 높은 API 단가만으로는 흑자를 증명할 수 없다
Kimi K2.6은 1T total / 32B active이며, native INT4를 사용하고 공식 대표 구성은 8×H200입니다. 전편의 8×H200 케이스에서는 연간 TCO가 약 2,412.1만 엔, 월 약 201.0만 엔이었습니다.
4:1 혼합 가격은 약 246.5엔 / 100만 token이므로, 셀프 호스팅(Self-host) 분기점은 월 약 81.6억 token, 평균 3,103 total tok/s입니다. 가격만 보면 대형 모델 중에서는 분기점이 낮은 편이지만, SGLang의 K2.6 recipe에 기재된 절대값은 동일한 architecture인 K2.5를 측정한 참고치입니다. K2.6의 원가 계산에는 사용할 수 없습니다.
Moonshot은 감사받은 API 구분 재무제표를 공개하지 않았습니다. native INT4, 8×H200 배치, 배치(batch) 가격이 표준의 60%라는 점은 알 수 있지만, GPU 조달 비용, 가동률, API 판매량이 없습니다.
판단: 동일한 8×H200 고정 케이스에서는 대형 모델 중 분기량이 비교적 낮지만, K2.6 자체의 절대 throughput이 없기 때문에 Moonshot의 추론 채산은 공개 자료만으로는 판정 불가능합니다.
Z.ai / 智譜(Zhipu): 기술 추정과 API 구분 매출총이익 모두 존재
GLM-5.2는 현행 모델 중 추론 원가를 가장 구체화하기 쉬운 사례입니다. 전편에서 사용한 8×B200의 연간 TCO는 약 3,036.1만 엔, 월 약 253.0만 엔입니다.
이전 기사에서 참조한 SGLang의 고정 commit에서는 8×B200, FP8, 8,192 input → 1,024 output, MTP 없음의 측정으로부터 4:1로 기계적 환산한 생용량(raw capacity)을 월 약 474.1억 token으로 두었습니다. 60%의 용량 여력과 99%의 가용성을 곱한 잠정 용량은 월 약 281.6억 token입니다.
이 두 지점에서 추론 원가의 참고 범위를 만들면 다음과 같습니다.
| 케이스 | 월간 token | 셀프 호스팅 원가 / 1M | GLM 중국 혼합 가격 277.2엔에 대한 계산상 margin |
|---|---|---|---|
| 생 벤치마크 환산 | 474.1억 | 약 53엔 | 약 81% |
| 60% 용량 · 99% 가용성 | 281.6억 | 약 90엔 | 약 68% |
생 벤치마크는 TTFT가 긴 throughput 측정이며, 판매 가능한 goodput이 아닙니다. 그럼에도 불구하고 필요 분기점이 월 91.3억 token이므로, GLM은 이번 분석에서 가장 긍정적인 추론 설비 포함 채산을 설명하기 쉬운 모델입니다.
재무 측면에서도 智譜(Zhipu)의 2025년 연간 실적은 Open Platform/API를 구분하여 공시하고 있습니다.
| 智譜 2025년 | 금액 |
|---|---|
| Open Platform/API 매출 | 1.90379억 위안 |
| ... |
2024년의 동일 구분 매출총이율(gross margin) 3.3%에서 18.9%로 개선되었으며, API/Open Platform 판매 자체는 양(+)의 매출총이익이었습니다. 반면, 추정한 GLM-5.2의 serving margin proxy인 68~81%보다는 대폭 낮습니다.
이 차이는 모순이 아닙니다. 재무 구분에는 Coding Plan 등이 포함되어 있으며, 실현 단가, 클라우드 조달 비용, 저가동, 제공 운영 등이 반영됩니다. 또한, 2025년의 구분은 2026년 6월 공개될 GLM-5.2 이전의 데이터입니다.
판단: 6개 회사 중에서 API에 가까운 구분이 양(+)의 매출총이익이었다는 것을 가장 강력하게 확인할 수 있는 곳은 智譜(Zhipu)입니다. 다만, GLM-5.2의 매출총이율은 불분명하며, 전사 차원에서는 거액의 R&D로 인해 적자 상태입니다.
MiniMax: 공개 벤치마크와 과거 구분 매출총이익의 양상이 반대로 나타남
MiniMax-M3는 약 428B total / 약 23B active이며, MXFP8로 약 443.7GB입니다. 공식 SGLang recipe는 8×B200, 2,048 input → 256 output, concurrency 64로, 합계 약 19,080 total tok/s를 나타냅니다.
이 측정은 입력:출력 = 8:1이며, 본고의 가격 주 케이스는 4:1입니다. GLM과 동일한 방법으로, 측정 시의 output throughput을 19,080 ÷ 9 = 2,120 tok/s로 두고, 4:1로 기계적 환산하면 2,120 × 5 = 10,600 total tok/s입니다. 월 약 278.6억 token, 60% 용량 · 99% 가용성 기준으로는 약 165.5억 token이 됩니다.
| 케이스 | 셀프 호스팅 원가 / 1M | M3 혼합 가격 약 75.8엔에 대한 계산상 마진 (margin) |
|---|---|---|
| 4:1 기계 환산, 생 벤치마크 (raw benchmark) | 약 91엔 | 약 -20% |
| 4:1 기계 환산, 60% 용량 · 99% 가용성 | 약 153엔 | 약 -102% |
즉, 공개 리스트 가격은 8×B200을 소매 가격으로 조달하는 단일 노드의 셀프 호스팅 가정에는 상당히 엄격한 수준입니다. 입력 비율을 바꿨을 때 동일한 output throughput이 유지된다는 보장이 없으므로, 이 값도 방향성을 보는 참고용으로 제한되며, 최종 판단에는 4:1 직접 측정이 필요합니다.
한편, MiniMax의 IPO 투자설명서에서는 2025년 1~9월의 「Open Platform and other AI-based enterprise services」가 매출 1,541.7만 달러, 매출총이익 1,070.2만 달러, 매출총이익률 69.4%였습니다.
다만, 이 구분에는 API뿐만 아니라 전용 추론 풀(inference pool), 커스텀 프로젝트, 모델 라이선스가 포함됩니다. M3 공개 전이기도 하므로, "M3 API의 매출총이익률이 69.4%"라고는 말할 수 없습니다.
IPO 투자설명서에서는 2025년 1~9월 매출원가의 92.7%가 추론 클라우드 비용이었습니다. 2025년 통기 전사 매출은 7,903.8만 달러, 전사 매출총이익률 25.4%, R&D는 2억 5,277.1만 달러, 조정 후 적자는 2억 5,085.6만 달러이며, 통기 자료는 R&D 증가를 파운데이션 모델 (foundation model) 학습 관련 클라우드 비용 등으로 설명하고 있습니다.
판단: MiniMax는 API를 포함한 기업용 판매에서 양(+)의 매출총이익을 만든 실적이 있습니다. 다만 M3의 저렴한 현행 가격이 단독으로 흑자인지, 다른 기업용 매출이 매출총이익을 끌어올린 것인지는 알 수 없습니다.
Tencent / Hy3: 가격은 최저지만, 절대 원가는 공개되지 않음
Hy3는 295B total / 21B active, MTP layer 3.8B입니다. Tencent TokenHub의 4:1 혼합 가격은 1.6위안, 약 37.0엔 / 100만 token으로 이번 6개 모델 중 가장 저렴합니다.
8×H200 셀프 호스팅 가정에서 이 가격에 맞추려면 월 약 543.8억 token, 평균 20,694 total tok/s가 필요합니다. 공식 vLLM recipe에는 4×GB300으로 약 8,408 total tok/s의 측정이 있지만, GPU와 비용이 다르기 때문에 Hy3의 원가로 직접 사용할 수는 없습니다.
Tencent는 2026년 6월 회사 자료에서 Hy3 preview의 추론 비용을 기존 모델 대비 40% 이상 절감했다고 설명했습니다. 상대적인 개선은 가격 설정을 뒷받침하는 방향이지만, 비교 대상인 절대 원가가 없기 때문에 37.0엔 / 100만 token을 밑돌았다고는 증명할 수 없습니다.
Tencent의 2026년 1분기에는 FinTech and Business Services 매출 598.85억 위안, 매출총이익 311.76억 위안, 매출총이익률 52%입니다. 하지만 결제, 자산 운용, EC 기술, 클라우드가 혼재되어 있습니다. AI 투자와 무료 제품도 일체형이므로, Hy3 API의 추론 매출총이익은 아닙니다.
판단: Hy3는 소규모 셀프 호스팅이 따라가기 힘든 가격입니다. Tencent의 규모, 내부 수요, 상대적 효율 개선은 설명 요인이 될 수 있지만, 현행 API의 흑자 여부는 비공개 상태입니다.
공개된 API 채산성에 근접한 사례 나열
6개사의 공개 범위를 동일한 것으로 취급할 수는 없습니다.
| API 채산성 근접도 | 회사 | 공개 내용에서 알 수 있는 것 | 알 수 없는 것 |
|---|---|---|---|
| A: API 근사 | 智譜 (Zhipu) | 2025 Open Platform/API는 매출총이익률 18.9%로 양(+)의 매출총이익 | GLM-5.2 고유의 매출총이익, 전사 흑자 |
| ... |
중요한 점은, **현행 6개 모델 고유의 흑자를 재무 공시를 통해 증명할 수 있는 회사는 제로(0)**라는 점입니다. 재무 수치가 있는 智譜, MiniMax, Alibaba, Tencent에서도 대상 모델은 공시 기간 이후에 등장했으며, DeepSeek와 Moonshot에는 감사받은 API 구분 재무 정보가 없습니다.
실현 단가와 provider 원가는 모두 공개 비교에서 벗어남
추정에는 매출 측면과 원가 측면 모두 반대 방향의 오차가 존재합니다.
매출을 낮추는 요인
- cache hit 가격
- batch 할인
- Coding Plan 또는 token plan
- 무료 Web · 앱 이용
- 대규모 계약, 판촉, 무료 구간
- 사고(thought) token의 계상 방법과 출력 길이의 차이
원가를 낮추는 요인
- GPU 대량 조달 할인
- 기존 클라우드 설비와의 공유
- 여러 모델 간의 수요 평준화
- native FP4/INT4, MTP (Multi-Token Prediction), sparse attention (희소 어텐션)
- 높은 batching (배칭) 효율과 prefix cache (접두사 캐시)
- 내부 트래픽을 포함한 높은 가동률
원가를 높이는 요인
- 여러 지역 및 중복성 (redundancy)
- 피크(peak)에 대비한 유휴 용량
- GPU 고장, 유지보수, 모델 전환
- moderation (검열/조정), 로그, 과금, 지원
- 긴 context (컨텍스트), 이미지·동영상 입력, 생성 실패
따라서, 소매 GPU 가격으로 계산한 셀프 호스팅(self-host) 원가를 "provider (프로바이더) 원가"라고 부르는 것도, 리스트 가격을 "평균 판매가"라고 부르는 것도 부적절합니다. 본고의 추정은 흑자 전환에 필요한 자릿수와 공식 발표·재무 공시의 정합성을 확인하는 것입니다.
어디까지 결론 내릴 수 있는가
공개 자료를 통해 뒷받침할 수 있는 주장은 다음과 같습니다.
- 가동률이 높은 추론 노드에서는 현재의 API 가격으로도 양(+)의 serving margin proxy (서빙 마진 프록시)를 만들 수 있다
- Zhipu (智譜)의 경우 2025년 API/Open Platform 구분은 실제로 양(+)의 매출총이익이었다
- MiniMax에서도 API를 포함한 기업용 구분은 양(+)의 매출총이익이었다
- DeepSeek의 구세대 자기 공개는, 자기 신고 throughput (처리량)에 가정한 GPU 단가를 적용한 낮은 GPU 비용 proxy (프록시)를 보여준다
- Alibaba Cloud는 양(+)의 adjusted EBITDA를 기록했고, Tencent의 광역 구분은 양(+)의 매출총이익을 기록했으나, 이것이 LLM API 단독의 증거는 아니다
- 회사 전체의 적자는 추론 token을 추가로 판매할 때마다 적자가 난다는 것을 의미하지 않는다
반면, 다음 사항은 단정할 수 없습니다.
- DeepSeek와 Moonshot의 현행 API가 흑자이다
- GLM-5.2와 MiniMax-M3의 과거 연도 구분 매출총이익이 현재도 동일하다
- Hy3의 약 37.0엔/100만 token이 판촉이 아니라 항구적인 완전 원가를 회수하고 있다
- 각 회사가 학습 비용까지 API 매출만으로 회수하고 있다
- 현행 6개 모델의 모델별 매출총이익률
결론
중국계 LLM 프로바이더에 대해, 과거 연도 API 근사 구분에서 양(+)의 매출총이익을 공개한 사례가 있으며, Zhipu의 경우 Open Platform/API의 매출총이익률이 18.9%였습니다.
하지만 현행 프론티어 모델별 추론 원가와 판매량은 비공개이며, 전사를 일괄적으로 흑자 또는 원가 미달로 판정할 수는 없습니다.
기술 측면에서는 GLM-5.2가 공개된 throughput과 셀프 호스팅 TCO (총 소유 비용)를 통해 양(+)의 serving margin proxy를 설명하기 쉬우며, DeepSeek의 과거 운영 공개에는 가정한 GPU 단가에 따른 낮은 비용 proxy가 있습니다. MiniMax-M3와 Hy3의 가격은 소매 설비를 사용하는 셀프 호스팅 가정하에는 매우 엄격하며, provider 측의 조달력, 가동률, 양자화 (quantization), batching, 타 사업과의 혼합이 중요해집니다.
재무 측면에서는 추론 판매의 매출총이익과 회사 전체의 이익을 구분해야 합니다. Zhipu와 MiniMax는 추론 판매를 포함한 구분에서 양(+)의 매출총이익을 보이면서도, 거액의 학습·R&D로 인해 회사 전체로는 적자입니다. 이는 모순이 아니라, 추론을 파는 경제와 프론티어 모델을 계속 만드는 경제가 별개임을 보여줍니다.
현 시점에서 가장 정확한 답은 다음과 같습니다.
중국계 LLM API는 가동률이 높은 추론 설비에서는 설비 포함 채산이 양(+)이 될 수 있으며, 과거 연도 API 근사 구분에서 양(+)의 매출총이익이었던 사례도 있다. 다만, 2026년 현행 프론티어 모델별 완전 원가, 판매량, 매출총이익은 공개되지 않았으므로 각 사의 흑자를 일률적으로 증명할 수는 없다.
주요 1차 자료
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기