5주 동안 발생한 두 번의 상반된 가격 변동: 2026년에 AI 기능을 미터링(metering)하고 과금하는 방법
요약
OpenAI와 Anthropic의 상반된 가격 변동 사례를 통해 AI 기능의 수익성 관리 필요성을 분석합니다. 사용자당 고정 요금제의 위험성을 지적하며, Salesforce의 사례처럼 토큰 기반이 아닌 '에이전틱 작업 단위'와 같은 새로운 과금 모델 도입을 제안합니다.
핵심 포인트
- AI 모델 벤더의 가격 변동은 고정 요금제 모델의 매출 총이익에 직접적인 타격을 줌
- 사용자별 토큰 소비량 차이가 극심하므로 단순 구독 모델은 리스크가 높음
- 효율적인 과금을 위해 미터링, 과금 단위 설정, 가격 여유분, 사용량 제한이 필요함
- Salesforce는 토큰 대신 '에이전틱 작업 단위'라는 새로운 과금 단위를 도입함
5주 동안 발생한 두 번의 상반된 가격 변동: 2026년에 AI 기능을 미터링(metering)하고 과금하는 방법
요약. 2026년 7월 30일, OpenAI는 GPT-5.6 Luna의 가격을 80% 인하하여 입력 토큰(input tokens) 100만 개당 $0.20, 출력 토큰(output tokens) 100만 개당 $1.20로 낮추었으며, Terra는 20% 인하하여 각각 $2.00와 $12.00로 조정했습니다. 32일 후인 2026년 9월 1일, Anthropic의 Claude Sonnet 5 도입 특가 기간이 만료되면서 해당 모델의 가격이 입력 100만 개당 $2, 출력 100만 개당 $10에서 $3와 $15로 50% 인상되었습니다. 3대 대형 모델 벤더 중 두 곳이 5주라는 짧은 기간 내에 공시 가격을 서로 반대 방향으로 움직였습니다. 만약 귀하의 AI 기능이 사용자당 고정 추가 요금(flat per-seat add-on) 방식으로 가격이 책정되어 있다면, 두 가지 움직임 모두 매출 총이익(gross margin)에 직접적인 타격을 주며 고객에게는 아무런 영향을 미치지 않습니다. Salesforce는 2026년 1월 31일에 종료된 회계연도 실적을 통해 대안을 보여주었습니다. Salesforce는 현재까지 전년 대비 5배 증가한 19조 개 이상의 토큰을 처리했다고 보고했으며, 토큰을 상회하는 새로운 과금 단위인 Agentic Work Unit(에이전틱 작업 단위)을 고안하여 24억 개를 제공했습니다. 이 글은 AI 기능을 미터링(metering)하고, 과금 단위를 선택하며, 실제 공시 가격을 바탕으로 마진 산술을 수행하고, 평균보다 100배 더 많이 소비하는 사용자의 사용량을 제한(capping)하는 방법에 대한 실무 가이드입니다.
한 단락으로 요약한 문제점
사용자당 구독(per-seat subscription) 방식은 각 사용자를 서비스하는 비용이 대략 동일하다는 가정을 전제로 합니다. AI 기능은 이 가정을 깨뜨립니다. 동일한 플랜을 사용하는 두 사용자라도 소비하는 토큰 양에서 두 자릿수(two orders of magnitude) 차이가 날 수 있는데, 한 명은 일주일에 질문을 세 번 던지는 반면 다른 한 명은 귀하의 기능을 야간 스크립트에 연결해 두었기 때문입니다. 고정 요금제 하에서는 헤비 유저가 다른 모든 사용자에 의해 보조를 받게 되며, 귀하가 통제할 수 없는 벤더의 가격 변동이 일어날 때마다 매출원가(cost of goods sold)가 변동하게 됩니다. 해결책은 복잡하지 않지만, 함께 구축해야 할 네 가지 요소가 있습니다: 미터링(metering)할 수 있는 이벤트 스트림(event stream), 고객이 이해할 수 있는 과금 단위(billable unit), 가격 변동을 대비한 여유(headroom)를 둔 가격, 그리고 사용량 제한(cap)입니다.
1단계: 실제로 무엇에 대해 과금할지 결정하기
현재 시장에서는 세 가지 단위가 사용되고 있으며, 각각 서로 다른 트레이드오프(trade-off) 관계를 가집니다.
| 과금 단위 (Billable unit) | 고객이 보는 것 | 한계점 |
|---|---|---|
| Raw tokens (원시 토큰) | 공급업체 가격의 직접적인 전달; 귀사의 청구서와 대조하기 쉬움 | 고객이 지출을 예측할 수 없음. 작업을 실행하기 전에는 토큰 수를 예측할 수 없기 때문 |
| ... |
Salesforce의 해답은 두 번째 행에 있으며, 이 회사가 그 이면의 산술적 근거를 공개했기에 시사하는 바가 큽니다. Salesforce의 의장 겸 CEO인 Marc Benioff는 2026년 2월 25일에 다음과 같이 말했습니다: "우리는 현재까지 거의 20조 개의 토큰을 소비했으며, 이를 24억 개 이상의 에이전트 작업 단위 (agentic work units)로 전환했습니다. 이는 AI가 단순히 추론하는 것을 넘어, 실제 업무를 수행한 순간들입니다." 이 회사는 29,000개 이상의 계약을 통해 전년 대비 169% 증가한 8억 달러의 Agentforce 연간 반복 매출 (ARR)을 보고했습니다. 토큰은 입력 비용이며, 에이전트 작업 단위 (Agentic Work Unit)는 인보이스(invoice)에 기재되는 항목입니다. 그 격차야말로 공급업체의 가격 변동이 흡수되는 지점입니다.
단위를 선택하기 위한 실질적인 테스트: 고객이 아무것도 실행하기 전에 다음 달 청구 금액을 약 20% 오차 범위 내에서 추정할 수 있는가? 만약 그렇지 않다면, 그 단위는 토큰에 너무 가깝게 설정된 것입니다.
2단계: 가격을 책정하기 전에 미터(meter)를 구축하십시오
측정되지 않은 것은 가격을 책정할 수 없으며, 출시 후에 미터를 사후 장착하는 것은 자신의 과거 데이터를 추측하는 것을 의미합니다. 모든 과금 가능한 작업에 대해 미터링 이벤트 (metering event)를 발생시키고, 최소한 다음 다섯 가지 필드를 기록하십시오: 고객 또는 워크스페이스 ID, 과금 단위 수량, 사용된 모델 및 경로, 제공업체가 반환한 입력 (input), 캐시된 읽기 (cached-read) 및 출력 (output) 토큰 수, 그리고 타임스탬프 (timestamp).
두 주요 제공업체 모두 응답(response)에 필요한 수치들을 반환합니다. Anthropic의 사용량(usage) 객체는 input_tokens, output_tokens, cache_read_input_tokens, cache_creation_input_tokens를 구분하며, web_search_requests와 같은 서버 측 도구 호출 (server-side tool calls)을 계산하는 server_tool_use 블록을 추가합니다. 이 모든 항목을 저장하세요. 총 토큰 수(total tokens)만 집계하는 것은 마진(margin) 문제가 사용량 때문인지, 캐시 히트율 (cache-hit rate) 하락 때문인지, 아니면 라우팅 (routing) 변경 때문인지 파악할 수 있는 능력을 상실하게 만듭니다.
결제 인프라 (billing plumbing) 측면에서, Stripe는 종량제 (pay-as-you-go) 플랜에 대해 결제 규모 (Billing volume)의 0.7%를 부과합니다. 연간 티어 (annual tiers)는 월간 결제 규모가 각각 $100,000, $250,000, $500,000, $1,000,000까지일 때 월 $620, $1,500, $2,950, $5,750이며, 티어를 초과하는 규모에 대해서는 0.67%를 부과합니다. Meters API는 결제 가격에 포함되어 있으며 월 최대 1억 개의 이벤트 (events)까지 지원하는데, 이는 모든 토큰이 아닌 비즈니스 액션 (business action)을 미터링 (metering)한다면 대부분의 제품에 충분한 양입니다. Stripe는 이제 고급 사용량 기반 결제 (advanced usage-based billing)를 자신이 인수하여 Stripe 제품으로 판매 중인 Metronome으로 라우팅합니다. 카드 처리 (Card processing) 비용은 성공적인 결제 건당 2.9% + 30센트가 추가로 발생합니다.
가격을 책정할 때 이 스택 (stack)에 대한 예산을 고려하세요. 결제 수수료를 차감하기 전 매출 총이익률 (gross margin)이 40%인 기능은 수수료 차감 후 약 36%가 됩니다.
3단계: 실제 요율로 산술 계산 수행
다음은 발표된 2026년 8월 요율을 기준으로 계산한 동일한 워크로드 (workload) 비용입니다. 워크로드: 월 100,000건의 대화를 처리하는 고객 지원 어시스턴트 (support-assistant) 기능으로, 대화당 약 3,700개의 토큰을 사용합니다. 이는 Anthropic이 자체 고객 지원 사례 연구에서 사용하는 수치입니다. 계산을 위해 이를 입력 (input) 3,000개와 출력 (output) 700개로 나누었습니다.
| 경로 (Route) | 입력 비용 (Input cost) | 출력 비용 (Output cost) | 100,000건의 대화에 대한 벤더 비용 (Vendor cost) |
|---|---|---|---|
| $1 / $5 per MTok 기준 Claude Haiku 4.5 | 300M 토큰 | 70M 토큰 | $650 |
| ... |
Anthropic은 자체적인 계산 방식을 발표했으며, Haiku 4.5 모델 기준 티켓 10,000건당 약 $37.00라는 결과에 도달했습니다. 위 표는 동일한 모델에 대해 10,000건당 $65로 계산되는데, 이 차이는 평균을 내어 없애버리기보다는 이해할 가치가 있습니다. 이 차이는 전적으로 가정된 입력 대비 출력 비율 (input-to-output split)에서 기인합니다. Anthropic의 예시는 여기서 사용된 3,000 대 700 비율보다 출력 비율을 상대적으로 더 적게 가정합니다. Haiku 4.5에서 출력 토큰은 입력 토큰보다 5배 더 비싸기 때문에, 총량이 아닌 비율이 청구 금액을 결정합니다. 가격을 책정하기 전에 여러분만의 비율을 먼저 측정하십시오.
이제 그에 따른 가격을 책정해 봅시다. 해결된 대화당 $0.05를 부과하면 100,000건의 대화에 대해 $5,000를 청구하게 됩니다. Luna 경로의 경우 벤더 비용은 $144로, 매출 총이익률 (gross margin)은 약 97%입니다. 9월 Sonnet 5 경로의 경우 비용은 $1,950이며, 이익률은 약 61%입니다. 가격도 같고, 제품도 같으며, 시기도 같습니다. 이 차이는 전적으로 라우팅 (routing) 및 요금표 (rate-card) 결정에 따른 것이며, 이것이 바로 송장의 단위가 토큰이 되어서는 안 되는 이유입니다.
해당 표에서 세 가지 결론을 도출할 수 있습니다. 첫째, 가장 저렴한 경로가 자동으로 최선의 경로인 것은 아닙니다. 왜냐하면 두 번의 시도가 필요한 더 약한 모델이 한 번의 통과로 끝나는 더 강력한 모델보다 비용이 더 많이 들 수 있기 때문입니다. 둘째, 의존하고 있는 경로의 요금이 50% 인상되면 이러한 비율에서는 이익률의 약 3분의 1이 사라집니다. 셋째, 경쟁사 모델의 가격 인하는 여러분의 가격을 인하할 이유가 아니라, 라우팅 결정을 다시 실행해야 할 이유입니다.
4단계: 이미 제시되어 있는 할인 혜택을 활용하라
두 벤더 모두 대부분의 팀이 충분히 활용하지 못하고 있는 구조적 할인 (structural discounts)을 발표하고 있습니다.
| 메커니즘 | Anthropic | OpenAI |
|---|---|---|
| 캐시 읽기 (Cache read) | 기본 입력 가격의 0.1배; 5분 캐시에서 한 번 읽으면 (쓰기 시 1.25배) 또는 1시간 캐시에서 두 번 읽으면 (쓰기 시 2배) 자체적으로 비용을 회수함 | 모든 모델 행에 별도의 낮은 열로 게시된 캐시 입력 |
| ... | ||
| 캐싱 승수(caching multipliers)는 정확하게 언급할 가치가 있습니다. 왜냐하면 손익분기점(payback point)이 명확하지 않기 때문입니다. 5분 캐시 쓰기는 기본 입력의 1.25배 비용이 들고, 1시간 캐시 쓰기는 2배가 들며, 캐시 히트(cache hit)는 0.1배가 듭니다. 따라서 5분 이내에 시스템 프롬프트를 두 번 읽으면 이미 캐싱을 통해 더 저렴해집니다. 하지만 한 시간에 한 번만 읽는 것은 그렇지 않습니다. |
여기에는 두 가지 함정이 있습니다. Anthropic은 Claude 4.7 및 이후 모델이
- 요청당 상한선 (A per-request ceiling). Anthropic은 단 한 번의 fetch가 약 125,000 토큰에 해당하는 500 kB 크기의 PDF를 컨텍스트로 가져오지 못하도록 하기 위해 web fetch 도구에서
max_content_tokens를 정확히 노출합니다. 사용자로부터 제공받는 모든 입력에 대해 이와 동등한 제한을 설정하십시오. - 자체 미터링 (metering) 레이어에서의 고객별 일일 예산. 이는 인보이스(invoice) 발행 후가 아니라, 제공업체(provider) 호출 전에 평가되어야 합니다.
- 차단 대신 성능을 저하시키는 소프트 캡 (soft cap): 계정이 특정 임계값을 넘어서면 더 저렴한 모델로 라우팅하고, 고객에게 어떤 일이 발생했는지 알리십시오.
- 엔터프라이즈 계정을 위한 Human-in-the-loop 방식의 하드 캡 (hard cap): 유료 고객을 조용히 차단하는 것은 예상치 못한 지원 티켓(support ticket)보다 더 나쁘기 때문입니다.
- 총 지출뿐만 아니라 고객별 마진(margin)에 대한 알림 설정. 매출과 함께 총 지출이 상승하는 것은 건전한 상태입니다. 한 계정의 비용 곡선이 매출 곡선에서 이탈하는 것이 바로 포착해야 할 대상입니다.
서버 측 도구(Server-side tools)는 토큰 가격 외에 별도로 청구되므로 예산에 별도의 항목으로 기재해야 합니다. Anthropic은 Claude API에서 표준 토큰 비용 외에 1,000회의 웹 검색당 10달러를 부과하며, 코드 실행(code execution)은 조직당 월 1,550시간의 무료 허용량을 초과할 경우 컨테이너당 시간당 0.05달러를 청구하며, 실행당 최소 5분이 적용됩니다. 요청당 조용히 세 번의 검색을 수행하는 기능은 단 하나의 토큰이 계산되기 전에 요청당 3센트의 최저 비용을 가집니다.
6단계: 필요하기 전에 재가격 책정 조항(repricing clause)을 작성하십시오
모델 가격은 다시 움직일 것입니다. 계약서에 메커니즘을 포함하고 제품 출시 시점에 이를 적용하십시오:
- 가격을 토큰(tokens) 단위가 아닌 귀사의 단위(unit)로 공시하십시오. 그래야 고객의 인보이스(invoice)에 공급업체의 요금표(rate card)가 노출되지 않습니다.
- 약관에 검토 주기(review cadence)를 명시하십시오. 예를 들어, 무기한 고정 요금을 약속하기보다는 30일 전 통지를 포함한 분기별 가격 검토(quarterly price review)를 명시하십시오.
- 제품과 공급업체 사이에 라우팅 계층(routing layer)을 유지하십시오. 그래야 요금 변경이 릴리스(release)가 아닌 설정 변경(configuration change)이 됩니다. 이는 모든 하이브리드 모델 라우팅 결정 (hybrid model routing decision)에서와 마찬가지로 동일한 논리가 적용됩니다. 즉, 추상화(abstraction)의 가치는 가격이 변동되는 날에 드러납니다.
- 단위당 비용(cost per unit)을 활성화(activation) 및 유지율(retention)과 함께 핵심 제품 지표(first-class product metric)로 추적하고, 매월 검토하십시오. 매달 2%포인트씩 침식되는 마진은 분기별 검토에서는 보이지 않지만, 월별 검토에서는 명확히 보입니다.
- 가격을 인하하는 공지를 포함하여, 모든 공급업체의 발표가 있을 때마다 라우팅 결정(routing decision)을 다시 실행하십시오. 7월 30일의 가격 인하로 인해, 이전에는 중간 단계 모델(mid-tier model)로 라우팅되었던 워크로드에 Luna를 사용할 수 있게 되었습니다. 비교 작업을 다시 수행하지 않은 팀은 아무 이유 없이 이전 요금을 계속 지불했습니다.
이러한 규율은 화려하지 않지만, 이것이 게임의 전부입니다. AI 기능의 가격 책정(pricing)은 출시 시점의 결정이 아니라, 매월 수행해야 하는 운영 루틴(operating routine)입니다.
인도 특화 고려 사항
인도에서 제품을 구축하는 팀을 위한 두 가지 실무적인 포인트입니다.
미터링 이벤트(Metering events)가 식별된 사용자와 연결될 경우 이는 개인 데이터(personal data)가 됩니다. 2023년 디지털 개인 데이터 보호법(Digital Personal Data Protection Act 2023)에 따라, 고객사의 어떤 직원이 어떤 쿼리(query)를 실행했는지 기록하고 결제 이력을 위해 이를 무기한 보관하는 사용 로그(usage log)는 법적 근거와 보유 제한(retention limit)이 필요한 처리(processing)에 해당합니다. 두 저장소를 분리하십시오. 결제를 위해서는 사용자 식별자가 포함되지 않은 집계된 고객 수준의 미터(aggregate, customer-level meter)를 유지하고, 디버깅을 위해서는 짧은 보유 기간을 가진 사용자별 로그(per-user log)를 유지하십시오. 이러한 분리는 결제용 미터의 유지 비용을 훨씬 저렴하게 만들어 주며, 이는 Stripe에서 제공하는 기본 허용량이 월 1억 건인 상황에서 매우 중요합니다.
둘째, 고객의 통화로 가격을 책정하되 비용은 달러(USD)로 산정하고, 그 차이를 의도적으로 유지하십시오. Anthropic과 OpenAI 모두 모델 요율을 USD로 발표합니다. 달러 기준 비용에 대해 루피(rupee)로 표시된 가격표를 사용하는 것은 벤더 요율 리스크(vendor-rate risk) 외에 환율 리스크(currency risk)를 추가로 떠안게 되며, 이는 복합적으로 작용합니다. 동일한 분기에 요율 인상과 불리한 환율 변동이 동시에 발생하면, 단 한 번의 제품 변경 없이도 60%의 마진이 40%대로 떨어질 수 있습니다. AI 비용을 사용하는 팀에 귀속시키는 방법에서 다룬 것처럼, 이미 클라우드 지출에 대해 이러한 원칙을 실행하고 있는 팀은 동일한 보고 방식을 재사용할 수 있습니다. 단위만 바뀔 뿐, 메커니즘은 동일합니다.
90일 후의 이상적인 모습
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기