
거품이 유지되는 동안 즐기세요: 당신의 AI 청구서 뒤에 숨겨진 비밀
요약
OpenAI와 Anthropic의 구독 서비스가 실제 API 사용 비용보다 훨씬 저렴하게 제공되고 있다는 SemiAnalysis의 분석을 다룹니다. 기업들이 막대한 손실을 감수하며 사용자에게 AI 서비스를 보조금 형태로 제공하고 있는 비즈니스 구조를 설명합니다.
핵심 포인트
- ChatGPT Pro 최대 사용 시 API 기준 월 14,000달러 상당의 토큰 소모
- Claude Max는 최대 사용 시 월 8,000달러 수준의 비용 발생
- AI 기업들은 현재 막대한 운영 손실을 감수하며 구독 모델을 운영 중
- 이러한 보조금은 기관 투자자나 하이퍼스케일러의 자본으로 충당됨
다른 누군가가 당신의 AI 구독료를 대신 내주고 있습니다. 대부분이 아니라, 거의 전부를 말이죠.
이것은 이 시대 전체의 공공연한 비밀이지만, 가격 페이지에는 나와 있지 않습니다. 그 산술적 계산이 너무나 불편하기 때문에, 당신에게 플랜을 판매하는 그 누구도 이를 서둘러 설명해주려 하지 않습니다.
SemiAnalysis는 명백한 실험을 수행했습니다: OpenAI와 Anthropic이 판매하는 모든 플랜을 구매한 다음, 한 달 동안 실제로 모델들을 혹사시키는 것입니다. 즉, 긴 에이전트 실행 (agentic runs)과 멈추지 않는 코드 생성 (code generation)을 수행하는 것이죠. 완전히 최대치로 사용한 ChatGPT Pro 구독은 API 가격 기준으로 월 14,000달러 상당의 토큰을 소모합니다. Claude Max는 8,000달러 근처에 도달합니다. 당신은 200달러를 내고 있습니다. 서비스 비용 (Serving costs)은 정가보다 낮으므로, 실제 손실액은 월 3,500달러에 가깝습니다. 이는 여전히 당신이 지불한 금액의 17배에 달하는 수치입니다.

플랜 가격 vs API 가격 기준 가능한 최대 지출액. 출처: SemiAnalysis.
우리가 비용 센터(cost center)이며, 그것이 좋은 소식인 이유
만약 당신이 AI를 진지하게 사용하는 소프트웨어 엔지니어라면, 당신은 정확히 이 플랜들이 손해를 보는 바로 그 사용자입니다. 에이전트 기반 코딩 작업 (Agentic coding tasks)은 표준 채팅 쿼리보다 대략 1,000배 많은 토큰을 소비하며, 최첨단 모델 (frontier models)은 단일 작업에서 100,000개 이상의 출력 토큰 (output tokens)을 태워버립니다. 당신이 에이전트를 저장소 (repo)에 지정하고 실행할 때마다, 당신은 누군가의 자본을 쓰고 있는 것입니다.
그 누군가는 연기금, 국부 펀드, 하이퍼스케일러 (hyperscaler)의 대차대조표, 혹은 자신의 고객에게 자금을 지원하는 칩 제조사일 것입니다. 즉, 궁극적으로는 매우 부유한 소수의 개인들과 그들의 자금을 움직이는 기관들을 의미합니다. 오늘 형성된 습관이 내일의 가격 결정력 (pricing power)으로 전환될 것이라는 데 베팅하는 거대한 자본의 더미입니다. 그 베팅이 맞을 수도 있고, 틀릴 수도 있습니다. 어느 쪽이든 자본은 이미 소비되었으며, 그 영수증은 당신의 터미널에 도착하고 있습니다.
이것은 사기가 아니며 새로운 것도 아닙니다. 이는 우리에게 5달러짜리 시내 이동 서비스, 이틀 내 무료 배송, 그리고 원가 미만의 클라우드 컴퓨팅 (cloud compute)을 제공했던 것과 동일한 플레이북 (playbook)입니다. 차이점은 배수 (multiple)에 있습니다. Uber는 아마도 승차 요금의 50% 정도를 보조했을 것입니다. 하지만 이것은 40~70배에 달합니다.
당신의 몫인 청구서의 부분
하지만 우리가 완전히 깨끗하게 벗어나는 것은 아니며, 이 절반의 이야기는 출시 키노트 (launch keynote)에는 포함되지 않습니다.
RAM 키트를 가격을 확인해 보십시오. 2025년 초에 6080달러였던 32GB DDR5 키트가 이제는 180250달러를 요구합니다. 이것은 단순한 공급 차질이 아닙니다. Samsung, SK Hynix, Micron이 전 세계 DRAM의 95% 이상을 생산하고 있으며, 이들은 자신들의 웨이퍼 (wafers)를 AI 가속기 (accelerators)를 위한 고마진 HBM으로 향하게 하고 있습니다. 데이터 센터 (Datacenters)는 몇 년 전 20~30%였던 수준에서 올해 고성능 메모리 생산량의 약 70%를 흡수할 궤도에 올라 있으며, 이러한 압박은 적어도 2027년까지 지속될 것입니다.
따라서 세금은 존재합니다. 다만 우리 이름이 적힌 송장에 찍혀 있지 않을 뿐입니다. 거대 기업들이 우리의 추론 (inference) 비용을 보증하고 있으며, 우리는 지난 20년 동안 아무 생각 없이 구매해 왔던 부품에 대해 세 배의 비용을 지불함으로써 그들의 메모리 공급망 (memory supply chain)을 보증하고 있습니다. 매달 수천 달러에 달하는 프런티어 컴퓨팅 (frontier compute) 비용에 비하면, 몇 년마다 발생하는 수백 달러의 비용은 여전히 우리에게 매우 훌륭한 거래입니다.
하지만 그 "우리"에 또 누가 포함되어 있는지는 주목할 만합니다. 마진(markup)은 AI 요금제가 아니라 메모리(memory)에 붙기 때문에, 노트북, 스마트폰, 콘솔, 완제품 PC를 구매하는 모든 사람에게 전가됩니다. 이들 대부분은 에이전트(agent)를 실행조차 하지 않을 것입니다. 보조금은 AI를 사용하는 사람들에게 흘러가지만, 메모리 세금은 컴퓨터를 구매하는 모든 사람에게 분산됩니다.
하지만 이는 하나의 징후입니다. 모델을 직접 실행하는 데 필요한 유일한 입력 요소인 메모리가 감당할 수 없는 가격으로 책정될 때, 저렴한 경로와 독립적인 경로는 조용히 갈라지기 시작합니다.
거품, 하지만 어떤 종류인가
"우리는 거품 속에 있다"는 말은 이제 기술 업계에서 가장 안전한 의견이 되었으며, 이는 보통 그 의견이 곧 유용성을 잃게 될 것임을 의미합니다. 흥미로운 질문은 거품의 _여부_가 아니라, 다음에 어떤 일이 일어날 것인가이며, 대략 세 가지 형태가 있습니다:
거품이 터진다 (It bursts). 자본이 마르고, 미끼 상품(loss-leader) 요금제들이 사라지며, 추론(inference) 비용이 실제 비용에 맞춰 책정됩니다. 불편한 상황이겠지만 끝은 아닙니다. 모델이 학습한 내용을 지우지는 않으니까요.
거품이 빠진다 (It deflates). 가격이 서서히 오르고, 제한 사항이 조용히 강화되며, 관대한 요금제들이 이름이 바뀌고 가격이 재조정됩니다. 솔직히 말해서 가장 가능성이 높은 시나리오입니다. 아무도 보조금의 종료를 발표하지 않습니다. 그저 할당량(quota)을 조정할 뿐입니다.
마진이 따라잡는다 (The margins catch up). 토큰당 비용은 벤치마크에 따라 연간 9배에서 900배 사이로 하락하고 있으며, 중앙값은 약 50배 수준입니다. 또한 API 매출 총이익률(gross margins)은 이미 올바른 방향으로 움직이고 있습니다. 자금이 바닥나기 전에 효율성이 비용 소모(burn) 속도를 앞지를 가능성은 진정으로 존재합니다.
저는 어떤 쪽이 될지 모릅니다. 그것에 대해 자신 있게 트윗하는 그 누구도 모릅니다. 하지만 세 가지 모두 결론은 같습니다. 당신이 지불하는 금액과 실제 비용 사이의 격차가 좁혀진다는 것입니다. 오직 세 번째 경우만이 당신에게 유리하게 그 격차를 좁힙니다.
보조금을 어떻게 활용할 것인가
스포츠처럼 토큰을 낭비하는 것은 이를 허비하는 명백한 방법입니다. 아마도 더 나은 방법은 이를 당신이 통제할 수 없는 종료 날짜가 정해진 창문(window)으로 취급하는 것입니다.
실험 비용이 거의 들지 않는 지금, 워크플로우(workflows)를 배우세요. 에이전트(agent)와 함께 일하는 근육 기억(muscle memory) — 무엇을 위임할지, 무엇을 검증할지, 어디에서 에이전트가 당신에게 신뢰할 수 없는 거짓말을 하는지 아는 것 — 은 어떠한 가격 변동에도 살아남는 부분입니다. 기술에는 가격이 다시 매겨지지 않습니다. 쿼터(Quotas)에 가격이 매겨질 뿐입니다.
오늘날의 가격에서만 작동하는 것들을 만드세요. 어떤 아이디어들은 너무 많은 토큰(tokens)을 필요로 해서, 추론(inference)의 실제 비용을 적용하면 결코 수익을 낼 수 없습니다. 지금은 여전히 그것들을 실행할 수 있습니다. 그러니 실행해 보시고, 그 가치를 알아내는 비용이 저렴할 때 그것들이 무엇인지 확인하십시오.
그리고 탈출구를 마련해 두세요. 이것은 소형 모델에 대해 제가 했던 주장을 다른 각도에서 바라본 것입니다. 프런티어 모델(frontier scale) 규모에서 월 14,000달러가 드는 동일한 작업이, 당신의 자체 하드웨어에서 실행되는 4B 모델에서는 거의 비용이 들지 않는 경우가 많습니다. 모든 것에 해당되는 것은 아닙니다. 우리가 실제로 자동화하는 대부분을 구성하는, 집중적이고 반복적인 작업의 롱테일(long tail) 영역에 해당합니다. 당신의 워크플로우 중 어떤 것이 10배의 가격 인상에서도 살아남을 수 있을지 아는 것은 저렴한 보험이며, 이는 단 한나절 만에 알아낼 수 있습니다. 어차피 살 계획이었다면, 상황이 더 나빠지기 전에 RAM을 구매하세요.
솔직한 입장
우리는 매우 부유한 사람들이 매우 큰 도박을 하고 있기 때문에, 인류 역사상 가장 비싼 연산 자원을 개별 개발자들이 그 비용의 오차 범위 수준으로 사용할 수 있는 기묘하고 짧은 순간을 지나고 있습니다.
비밀은 이 수치들 중 어느 하나가 숨겨져 있었다는 것이 아닙니다. 이 수치들이 결코 서로 나란히 놓이지 않는다는 점이 비밀입니다. 즉, 당신의 플랜을 서비스하는 데 드는 비용, 수익성이 없어지기 전까지 사용할 수 있는 비용의 비율, 그리고 메모리(memory) 가격에 어떤 일이 일어났는지가 함께 다뤄지지 않습니다. 각각의 정보는 공개되어 있으며, 각각 별도의 주제로 다뤄져 왔습니다. 컴퓨팅 경제학은 AI 이야기로, 메모리 부족 현상은 하드웨어 이야기로 다뤄졌습니다. 이들을 같은 문단에 놓으면 아무도 당신에게 설명해주지 않을 거래의 실체가 드러납니다. 왜냐하면 연구소(labs)들이 당신에게 잣대를 건네줄 이유는 없기 때문입니다.
즐기세요. 마음껏 사용하세요. 그로부터 배울 수 있는 모든 것을 배우세요. 다만, 보조금(subsidy)이 우주의 영구적인 특징이라는 가정 위에 당신의 모든 실무를 구축하지는 마세요. 그리고 현재의 가격을 당신이 사용하고 있는 것의 실제 가치로 오해하지 마세요.
청구서는 실재합니다. 다만 아직은 당신의 몫이 아닐 뿐입니다. 적어도 대부분은 말이죠.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기