Ben Thompson: 토큰은 범용 상품(Commodity)이 아니지만, 지능은 그렇다
요약
Ben Thompson은 오픈 웨이트 모델의 경제성을 분석하며, R&D 고정 비용과 추론 비용인 COGS(매출원가)를 구분해야 한다고 주장합니다. 토큰 자체는 범용 상품이 아닐 수 있지만, 모델이 제공하는 지능(정답)은 점차 범용 상품화되고 있음을 강조합니다.
핵심 포인트
- 오픈 웨이트 모델의 가중치는 무료지만, 추론을 위한 COGS는 가변 비용으로 발생함
- R&D는 고정 비용인 반면, 쿼리당 발생하는 추론 비용은 사용량에 비례하는 가변 비용임
- 긴 추론 체인을 가진 모델은 토큰당 가격 우위를 상쇄할 수 있음
- 지능(정답)은 점차 범용 상품(Commodity)의 성격을 띠게 될 것임
2026년 7월 20일 Ben Thompson이 Stratechery에 게시한 에세이는 이미 종결된 것처럼 보였던 논쟁을 다시 불러일으켰습니다. Kimi K3와 같은 중국의 오픈 웨이트 (Open Weights) 모델들은 모델 자체를 무료로 다운로드할 수 있다고 해서 공짜인 것은 아닙니다. **AI의 매출원가 (COGS)**를 중심으로 한 핵심 논거는 추론 (Inference)을 서비스하는 데 실제 비용이 발생하며, 이 비용은 모델을 사용하는 사람의 수와 직접적으로 연결되어 있다는 점입니다.
Thompson은 토큰당 과금하는 모든 팀이 명확히 인지해야 할 구분을 통해 이를 요약합니다. R&D (연구개발)는 고정 비용이지만, COGS (매출원가)는 가변 비용이며 처리되는 각 쿼리(Query)에 따라 증가합니다.
요약 (TL;DR)
- Ben Thompson은 2026년 7월 20일 Stratechery에 중국 오픈 모델의 경제성에 관한 분석을 게시했습니다.
- 에세이에 따르면, Kimi K3는 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러를 부과합니다.
- Sol은 입력 100만 개당 5달러, 출력 100만 개당 30달러를 부과하며, 더 비싸지만 토큰 측면에서 잠재적으로 더 효율적입니다.
- Thompson은 수익과 연결된 가변 비용인 COGS (매출원가)와 사용량과 무관한 고정 비용인 R&D (연구개발)를 구분합니다.
- Nvidia의 CEO Jensen Huang은 자신의 GPU를 '토큰 공장'이라 부르지만, Thompson은 이 지표가 불충분하다고 간주합니다.
- 핵심 논거: 토큰은 대체 가능한 범용 상품 (Commodity)이 아니지만, 올바른 답변은 범용 상품이다.
- 에세이에 따르면, 더 긴 추론 체인 (Reasoning chains)을 가진 모델은 토큰당 가격 우위를 상쇄할 수 있습니다.
서론
Thompson의 에세이가 시작되는 일화는 그가 Kellogg School of Management에서의 첫날, MBA 입문 과목의 커리큘럼에 왜 기술 기업 사례가 포함되어 있지 않은지 교수에게 질문했던 것에서 비롯됩니다. 교수의 답변은 특정 산업을 공부하는 것이 목적이 아니라, 어떤 기업에도 적용 가능한 보편적 원칙 (Universal principles)을 공부하는 것이 목적이라는 것이었습니다. 당시 Thompson은 이에 만족하지 않았습니다. 그에게 있어 소프트웨어와 유통의 한계 비용 (Marginal cost)이 제로라는 점은 질적으로 다른 문제였으며, 여기서 그의 Aggregation Theory (집계 이론)의 상당 부분이 탄생했습니다.
그는 인공지능 (AI)의 흥미로운 점은 이러한 보편적 원칙들이 강력하게 다시 돌아왔다는 것이라고 씁니다. 이 에세이를 촉발한 논의는 2026년 7월의 어느 주말, 기술 커뮤니티가 X(구 트위터)에서 성능 면에서 최첨단 (State-of-the-art) 수준에 근접한 중국의 오픈 웨이트 (Open weights) 모델인 Kimi K3의 함의에 대해 토론하며 시작되었습니다. Thompson의 결론은 다음과 같습니다. 한계 비용은 최신 무료 모델들의 단기적 가격뿐만 아니라 산업의 장기적 구조 측면에서도 다시 중요해졌다는 것입니다.
무슨 일이 일어났는가
오픈 웨이트 (Open weights) 모델에 대해 가장 흔한 오해는 누구나 가중치 (Weights)를 다운로드하여 자체 모델을 훈련하는 데 드는 시간과 비용을 건너뛸 수 있기 때문에, 이 모델들이 저렴하거나 심지어 무료라고 가정하는 것입니다. 이는 사실이지만, 그 "무료"는 오직 연구 개발 (R&D)에만 해당되는 이야기입니다. 즉, 제품이 얼마만큼의 수익을 창출하느냐와 관계없이 발생하는 고정 비용 (Fixed cost)을 의미합니다. 만약 한 기업이 R&D에 100만 달러를 지출한다면, 매출이 10만 달러이든 1억 달러이든 그 수치는 변하지 않지만, 그 투자액 중 얼마를 회수할 수 있는지는 달라집니다.
매출에 따라 달라지는 것은 바로 매출원가 (COGS)입니다. Kimi든 Sol이든 모델에 대해 추론 (Inference)을 실행하는 데는 비용이 들며, 이 비용은 얼마나 많은 사람이 사용하는지와 직접적인 상관관계가 있습니다. Kimi K3는 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러를 부과합니다. 이는 Sol의 5달러 및 30달러보다 저렴하지만, Thompson은 이러한 토큰당 가격 비교가 올바른 지표가 아닐 수 있다고 경고합니다.
맥락과 역사
이것이 왜 중요한지 이해하려면 인터넷의 첫 번째 파도로 거슬러 올라가야 합니다. 당시 소프트웨어의 제로 한계 비용 (Zero marginal cost)과 배포 방식은 중앙집중화를 초래했습니다. 공급을 배포하는 것보다 수요를 통제하는 것이 더 중요해진 세상에서 승자는 애그리게이터 (Aggregators)였습니다. 이것이 Thompson이 10년 넘게 발전시켜 온 집합 이론 (Aggregation Theory)의 핵심 논지입니다.
생성형 AI (Generative AI)는 처음에는 동일한 패턴을 따르는 것처럼 보였습니다. 점점 더 저렴해지는 모델, 0을 향해 수렴하는 한계 비용, 그리고 시장의 거의 전부를 차지하는 승자 한 명의 등장 말입니다. 하지만 Kimi K3와 같은 경쟁력 있는 오픈 모델 (Open models)의 등장은 **AI의 매출원가 (COGS)**가 실재함을 증명했습니다. 이는 전통적인 소프트웨어가 20년 전에 더 이상 갖지 않게 된 특성입니다.
한계 비용이 0인 소프트웨어와 달리, 생성되는 각 토큰은 실제 컴퓨팅 자원을 소비합니다.
기술적 세부 사항: AI의 매출원가 (COGS)와 토큰당 비용의 4가지 요소
Thompson은 인프라 팀이라면 누구나 인지하고 있는 네 가지 요소로 AI의 매출원가 (COGS)를 분해합니다:
- 모델 풋프린트 (model footprint): 모델의 가중치 (weights)와 런타임 상태 (runtime state)는 각 서비스 복제본 (replica)을 호스팅하는 데 얼마나 많은 고가의 메모리와 가속기 (accelerators)가 필요한지를 결정합니다.
- 추론 효율성 (inference efficiency): Mixture-of-Experts (MoE)와 같은 아키텍처 결정은 생성된 토큰당 필요한 연산량을 줄여줍니다.
- 메모리 효율성 (memory efficiency): KV 캐시 (KV cache)를 최적화하면 동일한 GPU로 더 많은 동시 요청을 처리할 수 있습니다.
- 서비스 효율성 (serving efficiency): 배치 (batching), 스케줄링 (scheduling), 프리픽스 캐싱 (prefix caching)은 하드웨어의 실제 활용도를 극대화합니다.
Nvidia는 CEO Jensen Huang를 통해 자신들이 구축하고 있는 것을 '토큰 공장 (token factories)'이라고 설명합니다. Nvidia의 관점에서 GPU는 모델에 구애받지 않으며(agnostic), 단순히 가능한 한 가장 빠르고 효율적인 방식으로 토큰을 생성할 뿐입니다. 여기서부터 초당 토큰 수 (tokens per second), 첫 번째 토큰 생성 시간 (time-to-first-token), 와트당 토큰 수 (tokens per watt), 또는 토큰당 비용 (cost per token)과 같은 지표가 도출되며, Huang는 이를 의사결정의 기초로 제안합니다.
💭 핵심: 초당 토큰 수나 토큰당 비용만으로 추론하는 오류는 한 모델의 토큰이 다른 모델의 토큰과 교환 가능하지 않다는 점에 있습니다. Thompson은 개별 토큰이 아니라, '정답 (the answer)'이 바로 대체 가능한 (fungible) 요소라고 말합니다.
이러한 구분은 실질적인 결과를 초래합니다. ChatGPT가 주도했던 생성형 AI의 첫 번째 시대에는 토큰이 최종 사용자에게 직접 전달되었기 때문에 초당 토큰 수를 측정하는 것이 의미가 있었습니다. 하지만 추론 (reasoning)의 시대인 두 번째 시대는 해당 지표를 복잡하게 만듭니다. 추론은 사고의 사슬 (chain of thought) 토큰의 폭발을 수반하며, 각 모델은 정답에 도달하기 위해 서로 다른 양의 토큰을 필요로 합니다. 보고서에 따르면 Kimi는 동일한 작업에 대해 Sol보다 현저히 더 많은 토큰을 사용하며, 이는 명목상의 토큰당 가격 우위를 상쇄할 수 있습니다.
flowchart TD
A["모델 가중치 (model weights)"] --> B["추론 효율성 (MoE)"]
B --> C["메모리 및 KV 캐시 (KV cache)"]
...
이 흐름은 네 가지 요인을 모두 합산했을 때, 백만 토큰당 명목 가격이 동일한 두 모델이라도 실제 매출원가 (COGS, Cost of Goods Sold)가 왜 매우 다를 수 있는지를 요약합니다.
Kimi K3 vs. Sol: 백만 토큰당 공시 가격
| 모델 | 입력 가격 (백만 토큰당) | 출력 가격 (백만 토큰당) | 비고 |
|---|---|---|---|
| Kimi K3 | 3 USD | 15 USD | 오픈 웨이트 (Open weights), Moonshot AI가 공시 |
| Sol | 5 USD | 30 USD | 폐쇄형 모델 (Closed model), Thompson이 에세이에서 사용한 참조값 |
이 표는 명목 가격을 보여주지만, 동일한 작업을 해결하기 위해 각 모델이 얼마나 많은 토큰을 필요로 하는지에 대해서는 아무것도 말해주지 않습니다. 이것이 바로 Thompson이 지적하는 사각지대입니다. 추론 토큰 (Reasoning tokens)의 양으로 정규화하지 않고 토큰당 가격을 비교하는 것은 사과와 오렌지를 비교하는 것과 같습니다.
검증 방법: 귀하의 유스케이스(Use case)에 대한 실제 COGS 측정하기
모델을 비교하는 가장 정직한 방법은 공시된 가격을 보는 것이 아니라, 귀하의 실제 워크로드에서 정답에 도달하는 데 비용이 얼마나 드는지 측정하는 것입니다. Kimi K3는 OpenAI 형식과 호환되는 API를 제공하므로, 첫 번째 단계는 단순히 테스트 호출을 수행하는 것입니다.
운영 체제에 따라 API 키를 환경 변수로 설정하세요:
# Linux / macOS (bash 또는 zsh)
export MOONSHOT_API_KEY="tu-api-key-aqui"
...
변수가 정의되면, Kimi K3 API에 대한 첫 번째 최소 요청은 다음과 같습니다:
curl https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
...
응답에는 prompt_tokens와 completion_tokens를 포함하는 usage 객체가 포함됩니다. 이 숫자들에 공시된 가격을 곱해야 해당 특정 쿼리에 대한 실제 COGS를 얻을 수 있습니다.
반복 가능한 작업에서 Kimi K3를 Sol과 비교하기 위해, 짧은 스크립트로 계산을 자동화할 수 있습니다:
const PRICING = {
"kimi-k3": { input: 3, output: 15 },
"sol": { input: 5, output: 30 },
...
동일한 프롬프트를 두 모델 모두에 실행하고, 각 응답의 usage를 저장한 뒤 calcularCOGS의 최종 결과를 비교해 보세요. 만약 Kimi가 동일한 답변에 도달하기 위해 훨씬 더 많은 추론 (reasoning) 토큰을 필요로 한다면, 토큰당 명목상 절감액은 완전히 사라질 수 있습니다. 이는 바로 이 에세이가 설명하는 현상입니다.
⚠️ 주의: 두 모델에 동일한 프롬프트를 실행하여 실제 사용량 (usage)을 측정하지 않고, 단순히 백만 토큰당 가격만 비교하는 것은 추론 (inference) 제공업체를 선택할 때 저지르는 가장 흔한 실수입니다.
응답의 usage 필드는 실제 매출원가 (COGS)를 계산할 수 있는 유일하게 신뢰할 수 있는 데이터입니다.
영향 및 분석
이러한 추론의 직접적인 결과는 오픈 모델과 폐쇄형 모델 간의 경쟁이 누가 더 많은 가중치 (weights)를 무료로 제공하느냐가 아니라, 누가 정답 하나당 가장 낮은 AI COGS를 달성하느냐에 의해 정의된다는 점입니다. 이는 Thompson이 언급한 네 가지 요소(발자국, 추론 효율성, 메모리 효율성, 서비스 효율성)에 투자할 수 있는 기업에 유리하게 작용하며, 반드시 토큰당 가격을 가장 낮게 공시하는 기업에 유리한 것은 아닙니다.
또한 제품 팀이 무엇을 살펴봐야 하는지도 변화시킵니다. 토큰당 가격은 40% 더 저렴하지만 동일한 작업에 두 배의 추론 토큰이 필요한 모델은 결과적으로 해결된 쿼리당 비용이 더 높을 수 있습니다. 올바른 지표는 '백만 토큰당 달러'가 아니라 '정답당 달러'입니다. 그리고 이 수치는 공시된 가격표가 아니라, 각 특정 작업에 대한 각 모델의 추론 효율성에 달려 있습니다.
Nvidia의 경우, 지능이 아닌 컴퓨팅을 판매하는 자사의 비즈니스 모델에서 '토큰 공장 (token factories)'이라는 접근 방식은 여전히 유효합니다. 하지만 Thompson은 제품을 구축하기 위해 추론을 구매하는 구매자에게 이와 동일한 접근 방식을 적용할 경우 잘못된 의사결정으로 이어진다고 경고합니다.
다음 단계
Thompson의 논증에 따른 논리적 귀결은 모델 비교 시 단순히 백만 토큰당 가격이 아니라, 해결된 작업당 AI의 매출원가 (COGS)를 보고해야 한다는 것입니다. 이 데이터 없이는 그 어떤 가격표도 불완전합니다. Nvidia는 이미 와트당 토큰 (tokens per watt)이나 첫 번째 토큰 생성 시간 (time-to-first-token)과 같은 지표를 발표하고 있습니다. 이제 업계에는 제품 팀이 Kimi K3, Sol 또는 다른 모델 중 무엇을 선택할지 결정하는 데 필요한, 즉 '정답 하나당 달러 비용'을 표현할 수 있는 동등한 지표를 채택하는 과정이 남아 있습니다.
어떤 공급업체를 사용할지 평가하는 라틴 아메리카의 개발자들에게 이 에세이에서 도출되는 실질적인 권장 사항은 간단합니다. 제품을 대표하는 동일한 프롬프트 세트를 각 후보 모델에 실행하고, 각 응답의 실제 usage를 합산하여 공표된 가격이 아닌 결과적인 COGS를 비교하십시오.
📖 Telegram 요약: 요약 보기
직접 시도해 보세요: 이 기사의 calcularCOGS 스크립트를 Kimi K3 API의 본인 프롬프트에 실행해 보고, 그 결과를 현재 팀이 Sol 또는 다른 폐쇄형 모델에 지불하는 비용과 비교해 보십시오.
자주 묻는 질문 (FAQ)
Kimi K3는 정말 무료로 사용할 수 있나요?
아니요. 가중치 (weights)는 비용 없이 다운로드할 수 있지만, 해당 가중치에 대해 추론 (inference)을 제공하는 데는 실제 비용이 발생합니다. Moonshot AI는 API를 통해 입력 백만 토큰당 3달러, 출력 백만 토큰당 15달러를 부과합니다.
AI 문맥에서 COGS와 R&D의 차이점은 무엇인가요?
R&D (연구개발)는 모델을 훈련시키는 고정 비용입니다. 이는 사용자가 얼마나 많은지에 따라 변하지 않습니다. COGS (매출원가)는 각 쿼리를 처리하는 가변 비용이며, 사용량에 비례하여 증가합니다.
Thompson는 왜 토큰이 범용 상품 (commodity)이 아니라고 말하나요?
한 모델의 토큰은 다른 모델의 토큰과 교환될 수 없기 때문입니다. 각 모델은 답변에 도달하기 위해 서로 다른 양의 토큰을 필요로 합니다. 그의 논증에 따르면, 실제로 대체 가능한 (fungible) 것은 정답 그 자체입니다.
내 사용 사례에 맞는 모델의 실제 COGS를 어떻게 측정하나요?
각 후보 모델에 동일한 프롬프트 (prompt)를 실행하고, 각 응답의 usage 필드(prompt_tokens 및 completion_tokens)를 가져와 각 모델의 공시된 가격을 곱합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기