중국산 모델이 두려운가?
요약
중국 Kimi K3와 같은 고성능 오픈 웨이트 모델의 등장이 AI 산업의 가치 사슬에 미치는 영향을 분석합니다. 소프트웨어의 한계 비용이 0이 아닌, 추론 비용(COGS)이 매출과 직결되는 AI 산업 특유의 경제 구조를 설명합니다.
핵심 포인트
- Kimi K3 등 고성능 오픈 웨이트 모델의 부상
- AI 산업에서 추론 비용(COGS)은 매출과 비례하여 증가함
- R&D는 고정 비용이지만, 추론은 변동 비용으로서의 성격을 가짐
- 규모의 경제와 수요 통제가 AI 비즈니스 모델의 핵심
Kellogg School of Management의 필수 입문 과정인 STRT-431 수업 첫날에 대해 제가 들려주는 이야기가 있습니다. 저는 읽기 자료와 사례 연구들을 훑어보며 의제에 기술 기업이 하나도 없다는 사실에 실망했습니다. 저답게 수업이 끝난 후 교수님께 그 이유를 여쭈었고, 이 과정의 목표는 반드시 특정 산업에 대해 배우는 것이 아니라, 어떤 산업의 어떤 기업에도 적용될 수 있는 폭넓게 적용 가능한 보편적 원칙(universal principles)을 발견하는 것이라는 답변을 들었습니다.
제가 평소 이 이야기를 할 때처럼, 저는 이것이 전혀 만족스럽지 않았습니다. 저에게 기술의 본질, 특히 소프트웨어와 배포(distribution)가 한계 비용(marginal costs)이 0(그리고 거래 비용(transaction costs)도 0)이라는 사실은 근본적으로 다른 것이었습니다. 공식에 0을 집어넣는 것은 대개 대혼란을 야기하곤 하니까요! 하지만 곧 저는 그것이 저에게 기회라는 것을 깨달았습니다. 집적 이론 (Aggregation Theory)을 뒷받침하는 근본적인 통찰은, 한계 비용이 0이 된다는 것이 사람들이 과거 인터넷에서 기대했던 것과는 근본적으로 다른 가치 사슬(value chains)로 이어진다는 점입니다. 즉, 공급을 배포하는 것보다 수요를 통제하는 것이 더 중요해진 세상에서의 중앙집중화(centralization)와 규모의 경제(scale)입니다.
하지만 AI에서 흥미로운 점은, 그러한 오래된 보편적 원칙들이 다시 전면으로 부상하고 있는 정도입니다. 지난 주말, 중국에서 나온 또 다른 오픈 웨이트 (open weights) 모델인 Kimi K3가 성능 면에서 최첨단 (state-of-the-art) 수준에 근접함에 따라 X(구 트위터)에서 그 영향에 대한 논쟁이 격렬하게 벌어졌을 때, 이 사실은 그 어느 때보다 명확하게 드러났습니다. 요점은 이렇습니다. 최첨단 무료 모델들이 가져올 단기적 영향 측면에서나, 산업의 장기적 구조 측면에서나 한계 비용이 거대한 규모로 다시 돌아오고 있다는 것입니다.
매출원가 (COGS) 대 연구개발비 (R&D)
오픈 웨이트 (open weights) 모델에 관한 논의의 근저에 깔린 가장 흔한 오해 중 하나는 이 모델들이 더 저렴하다는 것, 심지어는 무료라는 점입니다. 결국, 가중치 (weights)를 그냥 다운로드하기만 하면 자신만의 모델을 만드는 데 필요한 시간과 비용, 그리고 역량을 건너뛸 수 있기 때문입니다. 물론 그것은 사실이지만, 이 경우의 "무료"는 연구 개발 (R&D)에 지출해야 하는 금액을 의미합니다. R&D는 당신이 창출하는 매출과 무관한 고정 비용 (fixed expense)입니다. 만약 당신이 R&D에 100만 달러를 지출했다면, 매출이 10만 달러이든 1억 달러이든 상관없이 여전히 R&D에 100만 달러를 지출한 것입니다 (물론 이것이 수익성에는 영향을 미칩니다).
매출과 관련된 것은 매출원가 (COGS, cost of goods sold)이며, AI 분야에서 COGS는 아주 오랫동안 소프트웨어 분야에서 그렇지 않았던 방식으로 실재합니다. 구체적으로, 모델이 Kimi이든 Fable이든 상관없이 모델에 대한 추론 (inference)을 실행하는 데는 비용이 들며, AI 제공업체가 추론에 지출하는 금액은 적어도 대부분의 비즈니스 모델에서 매출과 직접적인 상관관계가 있습니다. 위의 예시를 다시 활용하자면, 1억 달러의 매출을 올리는 것과 10만 달러의 매출을 올리는 것은 아마도 1,000배의 COGS를 필요로 할 것입니다. 구체적인 수치로 예를 들면, 1달러의 매출을 일으키는 토큰 (tokens)을 생성하는 데 50센트가 든다면, 1억 달러의 매출에는 5,000만 달러의 COGS가 발생할 것이고, 10만 달러의 매출에는 단 5만 달러의 COGS만 발생할 것입니다.
오픈 웨이트 모델 측면에서의 핵심은 이를 서비스(serve)하는 데 비용이 들지 않는 것이 아니라는 점입니다. Kimi K3는 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러의 비용이 듭니다. 이는 Sol의 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 30달러보다 저렴하지만, 이것이 올바른 측정 기준조차 아닐 수도 있습니다.
토큰 (Tokens) 대 지능 (Intelligence)
Nvidia의 CEO Jensen Huang은 Nvidia가 구축하고 있는 것을 "토큰 공장 (token factories)"라고 묘사했으며, Nvidia의 관점에서는 이러한 프레임워크가 타당합니다. Nvidia GPU는 모델 불가지론적 (model agnostic)입니다. 즉, 이들은 토큰을 생성하며, 가능한 가장 빠르고 효율적인 방식으로 이를 수행합니다. 이는 초당 토큰 수 (tokens-per-second), 첫 번째 토큰 생성 시간 (time-to-first-token), 와트당 토큰 수 (tokens-per-watt), 토큰 비용 (token cost) 등과 같은 측정 지표로 이어지며, Huang은 이러한 지표들이 의사 결정의 기초가 될 것이라고 주장합니다.
이러한 프레임워크는 토큰이 최종 사용자에게 직접 전달되던 AI의 첫 번째 패러다임인 ChatGPT 시대에는 확실히 타당했습니다. 그러나 AI의 두 번째 패러다임인 추론 (reasoning) 시대는 이러한 측정을 혼란스럽게 만듭니다. 추론은 사고의 사슬 (chain-of-thought) 토큰의 폭발적인 증가를 수반하며, 서로 다른 모델들은 정답에 도달하기 위해 서로 다른 양의 추론 토큰을 필요로 합니다. 예를 들어, Kimi는 Sol보다 훨씬 더 많은 토큰을 사용하는 것으로 알려져 있어, 그 가격 우위가 무의미해집니다. 에이전트 (Agents) 또한 유사한 역학을 도입합니다. 어떤 모델들은 에이전트 워크플로우 (agentic workflows)를 실행하는 데 필요한 토큰 수 측면에서 다른 모델들보다 더 효율적입니다.
이것이 의미하는 바는 토큰이 범용 상품 (commodity)이 아니라는 것입니다. 범용 상품의 정의적 특징은 대체 가능성 (fungible)입니다. 1갤런의 기름은 1갤런의 기름이고, 1톤의 구리는 1톤의 구리이며, 1부셸의 밀은 1부셸의 밀입니다. 그러나 한 모델의 토큰은 다른 모델의 토큰과 동일하지 않습니다. 대체 가능한 것은 토큰으로부터 구축되는 것, 즉 지능 (intelligence)입니다. 다시 말해, Kimi와 Sol이 모두 정답을 생성했다면 그 정답은 대체 가능합니다. 정답에 도달하기 위해 생성된 토큰의 차이는 매출원가 (COGS)의 차이를 만드는 요인이 됩니다.
지능의 매출원가 (COGS)는 몇 가지 서로 다른 요인의 함수입니다:
- 모델 풋프린트 (Model footprint): 가중치 (Weights)와 런타임 상태 (Runtime state)는 각 서빙 복제본 (Serving replica)을 호스팅하는 데 얼마나 많은 고가의 메모리와 얼마나 많은 가속기 (Accelerators)가 필요한지를 결정합니다.
- 추론 효율성 (Inference efficiency): 아키텍처 선택 (예: Mixture-of-Experts)은 생성된 토큰당 계산량을 줄여줍니다.
- 메모리 효율성 (Memory efficiency): 아키텍처 선택은 KV 캐시 (KV cache) 요구 사항을 줄여 더 많은 동시 요청을 허용하고 더 나은 GPU 활용도를 제공할 수 있습니다.
- 서빙 효율성 (Serving efficiency): 배치 (Batching), 스케줄링 (Scheduling), 접두사 캐싱 (Prefix caching) 및 기타 추론 최적화는 활용도를 극대화하고 요청 간에 작업을 공유합니다.
- 토큰 효율성 (Token efficiency): 정답에 도달하는 데 필요한 토큰이 적을수록 추론 비용은 낮아집니다.
이것이 중요한 이유는 경제적으로 유익한 많은 작업에 대한 지능이 사실상 범용 상품 (Commodity)이 되는 상태에 빠르게 접근하고 있기 때문입니다. 예를 들어, 기본적인 CRUD 앱을 구축하는 사람이라면 여러 제공업체의 모델을 사용하여 구축할 수 있을 것입니다. 그리고 범용 상품 시장에서 수익성을 확보하는 경로는 더 높은 가격을 책정하는 것이 아니라 — 다시 말하지만, 여러분은 여러 모델을 사용하여 정확히 동일한 앱을 만들 수 있거나 곧 만들 수 있게 될 것입니다 — 오히려 우월한 비용 구조를 갖추는 것을 통해 이루어집니다.
범용 상품 시장 (Commodity Markets)의 이해
여기서의 메커니즘을 단계별로 살펴볼 가치가 있습니다. 몇 달 전 Amazon의 Durability에서 언급했듯이, 범용 상품 시장의 역학은 기술 분야 사람들이 일반적으로 익숙하지 않은 것이기 때문입니다:
- 범용 상품 시장에서는 모두가 같은 것을 판매하기 때문에 모두가 동일한 가격을 책정하며, 그 가격은 수요와 공급에 의해 결정됩니다.
- 범용 상품에 대한 수요는 가격 탄력성 (Price elasticity)의 함수입니다. 즉, 상품이 저렴할수록 수요가 더 많아지고, 그 반대도 마찬가지입니다.
- 범용 상품에 대한 공급은 상품을 생산하는 한계 비용 (Marginal cost)의 함수입니다.
이해해야 할 핵심은 상품을 생산하는 한계 비용 (Marginal cost)이 공급자마다 다르다는 점입니다. 이것이 실무적으로 의미하는 바는, 가장 열악한 비용 구조를 가진 공급자가 (생산이 가능하다면) 자신의 한계 비용으로 상품을 판매하게 된다는 것입니다. 다른 모든 이들의 이익은 그들의 비용 구조가 한계 공급자보다 얼마나 더 나은지에 달려 있습니다.
예를 들어:
- 공급자 A는 상품 10단위를 개당 $10에 생산할 수 있음
- 공급자 B는 상품 10단위를 개당 $15에 생산할 수 있음
- 공급자 C는 상품 10단위를 개당 $20에 생산할 수 있음
가격 탄력성이 $20에서 상품 25단위에 대한 수요가 발생하는 수준이라고 가정해 봅시다. 이는 다음과 같습니다:
- 공급자 A는 상품 10단위를 $20에 판매하여, 단위당 $10의 이익을 얻음
- 공급자 B는 상품 10단위를 $20에 판매하여, 단위당 $5의 이익을 얻음
- 공급자 C는 상품 5단위를 $20에 판매하여, 단위당 $0의 이익을 얻음
이것이 정확하지는 않습니다. 공급자 C가 부족분을 떠안게 되는 이유는 공급자 A와 B가 가격을 약간 더 낮게 책정할 수 있기 때문이며, 이는 당연히 (탄력적인) 수요에 영향을 미치겠지만, 핵심은 전달됩니다. 공급자 A는 훌륭한 사업을 하고 있고, 공급자 B는 괜찮은 사업을 하고 있으며, 공급자 C는 파산하게 될 것입니다.
파산 위험은 고정 비용 (Fixed costs)이 다시 전면에 등장하는 지점입니다. 공급자 C는 고정 비용(잠재적인 R&D 지출 등)을 가지고 있을 뿐만 아니라, 상품 생산에 필요한 장비를 마련하기 위해 부채를 끌어다 썼을 수도 있습니다. 공급자 C는 이러한 비용을 고려하여 상품 가격을 책정할 수 없습니다. 시장 청산 가격 (Market-clearing price)은 수요를 충족하는 데 필요한 가장 비용이 높은 단위의 한계 비용에 근접한다는 점을 기억하십시오. 하지만 이러한 비용은 분명히 공급자를 사업에서 몰아낼 수 있습니다. 그리고 만약 그 공급자가 파산한다면, 다른 공급자가 진입을 결정할 때까지(또는 다른 공급자들이 확장할 때까지) 가격은 상승합니다.
지능 시장 (The Intelligence Market)
이를 모델의 관점으로 다시 가져와 보겠습니다. 현재로서는 위에서 언급한 분석 중 어느 것도 적용되지 않는데, 그 이유는 프론티어 모델 (frontier models)에 대한 수요가 공급을 초과하고 있으며, 공급은 컴퓨팅 자원 (compute)의 부족으로 인해 제한되어 있기 때문입니다. 이러한 컴퓨팅 부족은 Nvidia와 같은 컴퓨팅 공급업체가 매우 높은 마진을 남긴다는 것을 의미할 뿐만 아니라, SpaceXAI와 같은 Nvidia의 고객들이 Anthropic과 같은 기업에 컴퓨팅 자원을 높은 마진으로 다시 되팔 수 있음을 의미하기도 합니다. 한편, Anthropic은 토큰을 훨씬 더 높은 마진으로 판매할 수 있기 때문에 이러한 마진 상승분 (markup)을 지불할 수 있습니다.
하지만 Anthropic에게 높은 마진을 안겨주는 것이 단지 과잉 수요 때문만은 아닙니다. Anthropic과 OpenAI는 모델 성능 (model capability), 서빙 규모 (serving scale), 그리고 토큰 효율성 (token efficiency) 덕분에 프론티어급 지능의 단위당 비용이 아마도 가장 낮은 수준일 것입니다. 이들은 경쟁사들보다 몇 달 앞서 특정 성능 수준의 모델을 서비스하고 있으며, 동시에 이러한 비용을 최적화하는 데 최적의 모델들을 적용하고 있습니다.
또한 시장이 아직 지능을 상품 (commodity)처럼 취급하지 않고 있다는 점도 주목할 만합니다. 수요는 구체적으로 Anthropic과 OpenAI를 향하고 있으며, 그만큼 성능이 떨어지는 모델들에 대한 수요는 훨씬 적습니다 (따라서 SpaceXAI와 Meta가 Anthropic에 용량을 판매하는 구조가 됩니다). 비용 최적화를 추진하는 방식에 대해 생각할 수 있는 한 가지 방법은, 지능 구매자들이 지능이 상품화되는 시장을 만들 수 있도록 지능 수준에 따라 '수행해야 할 과업 (jobs-to-be-done)'을 정의하는 함수로 보는 것입니다. 그러나 장기적으로는 프론티어에 있는 whoever가 비프론티어 시장 또한 지배하기에 가장 유리한 위치를 점하게 될 것입니다. 비프론티어 시장이란 단순히 프론티어에서 n개월을 뺀 시장, 즉 프론티어 모델 제작자들이 서빙 비용을 최적화해 온 기간만큼의 차이를 둔 시장을 의미합니다.
이 모든 것은 Kimi와 중국산 모델들에 대한 반응이, 적어도 경제적 관점에서는 상당히 과장되어 있다고 생각한다는 것을 의미합니다. 현재는 컴퓨팅 자원(Compute)의 부족으로 인해 하류(Downstream) 단계에서 가격 보호막(Price umbrella)이 형성되어 있습니다. 저는 중국산 모델들이 한계 비용(Marginal cost) 기준으로 서빙하기에 더 저렴할 것이라고는 전혀 생각하지 않습니다. 단지 Anthropic과 OpenAI가 공급 제약(Supply constrained) 상태에 있어, 지능에 대한 수요를 충족할 충분한 공급이 있을 때보다 훨씬 더 높은 가격을 책정하고 있기 때문에 중국산 모델이 더 저렴해 보일 뿐입니다.
프론티어 연구소의 편집증 (Frontier Lab Paranoia)
그렇다면 왜 모델 제작자들은 특히 중국산 모델에 대해 그토록 공포를 느끼는 것처럼 보일까요?
첫째, 프론티어 연구소(Frontier labs)들은 훈련 비용(Training costs)이 재무 모델링의 주를 이루던 세상에 고착되어 있다고 생각합니다. 추론(Inference)보다 훈련에 더 많은 GPU를 소비하는 동안에는, 다음 훈련 과정을 지원하기 위해 추론 수익을 극대화하는 것이 매우 중요했으며, 이는 곧 추론에 대해 매우 높은 가격을 책정해야 함을 의미했습니다.
하지만 앞으로는 추론 시장이 훈련 비용보다 훨씬 더 빠르게 성장할 것으로 예상하며(이는 훈련 비용이 계속해서 치솟을 것이라는 가정을 포함합니다), 이는 그들이 물량(Volume)을 통해 충분히 만회할 수 있음을 의미합니다. 불과 8개월 전만 해도 이 상황이 명확하지 않았으나, 에이전트 패러다임(Agent paradigm)의 해방은 매우 거대하기 때문에, 프론티어 연구소들은 (충분한 컴퓨팅 자원을 확보한 후에는) 낮은 가격으로도 단순히 생존하는 것을 넘어 번창할 수 있다는 확신을 가져야 합니다.
둘째, 지능은 사실 완벽한 범용 상품(Commodity)이 아닙니다. 부분적으로는 응용된 지능(Applied intelligence)이 스스로를 더 똑똑하게 만들기 때문입니다. 구체적으로, 추론을 실행하는 주체는 데이터를 수집하게 되며, 그 데이터는 다음 세대의 모델을 더 개선하는 데 사용됩니다. 이는 한편으로는 더 많은 컴퓨팅 자원이 가동됨에 따라 프론티어 연구소들이 가격을 낮추고 사용량을 늘려야 할 더 큰 이유가 되지만, 다른 한편으로는 Microsoft와 같은 기업들이 기업들이 자체 모델을 실행하도록 돕는 것에 점점 더 집착하는 이유이기도 합니다. 중국산 모델이 실행 가능한 대안이 된다면, 이러한 방식은 훨씬 더 생존 가능성이 높아지기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기