캐시된 접두사 교차점: 저렴한 LLM이 비싸지는 경우
요약
LLM 비용 비교 시 단순히 '백만 토큰당 $X'로 모델을 평가하는 것은 캐시 히트율의 영향을 간과할 수 있습니다. 본 글은 프롬프트 캐싱이 활성화될 때, 실제 요청 부하에 따른 두 모델의 비용 교차점(Crossover Point)을 산술적으로 계산하는 방법을 제시합니다.
핵심 포인트
- LLM 비용은 단순 토큰당 가격보다 '캐시 히트율'에 따라 달라진다.
- 비용 변화는 캐시 히트율에 선형적이며, 교차점 공식으로 분석 가능하다.
- 실제 워크로드(RAG 등)에서는 표면적인 가격표와 다른 모델 순위가 나타날 수 있다.
대부분의 LLM 비용 비교는 모델을 하나의 숫자로 축소합니다: 백만 입력 토큰당 $X. 이 숫자는 캐시 _미스(miss)_의 가격입니다. 프롬프트 캐싱이 활성화되면, 요청마다 보내는 대부분의 토큰은 대신 캐시된 읽기 비율로 청구됩니다—그리고 캐싱이 모든 모델을 동일하게 할인하지는 않습니다. 한 모델을 다른 모델보다 훨씬 더 많이 할인할 때, 순위가 바뀝니다.
그 변화(flip)에는 정확한 위치가 있습니다. 이 글에서 그것을 계산합니다.
산술적 계산 (The arithmetic)
모든 비율은 백만 토큰당 달러입니다. 캐시 히트 비율이 f이고, 입력 토큰이 N, 출력 토큰이 M인 요청의 경우:
cost(f) = N · [ (1 − f)·in + f·cached ] + M · out
= (N·in + M·out) − f · N · (in − cached)
비용은 히트율에 선형적입니다. 캐싱과 무관한 모든 것이 상수항이며, 캐시의 전체 효과는 기울기인 −N·(in − cached)입니다.
동일한 작업 부하를 가진 두 모델을 가정하고, cost_A(f) = cost_B(f)로 설정하고 풀면 다음과 같습니다:
(N·in_A + M·out_A) − (N·in_B + M·out_B)
f* = ─────────────────────────────────────────────
N·(in_A − cached_A) − N·(in_B − cached_B)
f* < 0또는f* > 1— 작동 범위 내에서 교차가 없습니다. 더 저렴한 모델이 계속 더 저렴합니다.0 ≤ f* ≤ 1— 실제 교차점이 존재합니다.f*보다 낮으면 첫 번째 모델이 이기고, 높으면 두 번째 모델이 이깁니다.
분모는 _캐시 이점의 차이(difference in cache benefit)_입니다. 만약 두 모델이 캐시된 읽기를 동일한 비율로 할인한다면, 분모는 0이 되고 아무리 좋은 비율이라도 캐싱은 그들을 재배열하지 못합니다.
사람들이 실제로 놓치는 수치: 캐시 할인율 (the cache discount ratio)
in / cached는 히트가 미스보다 얼마나 더 저렴한지를 나타냅니다. 우리가 추적하는 28개 모델 전반에 걸쳐, 이는 상수가 아닙니다:
| Model | input ÷ cached | Discount on a hit |
|---|---|---|
| DeepSeek V4.1 Flash | 50.0× | 98% off |
| ... |
실제 비용 차이가 나는 교차점 (RAG: 입력 5만 토큰 / 출력 2천 토큰)
검색(retrieval) 워크로드를 가정해 봅시다. 요청당 입력 토큰 50,000개, 출력 토큰 2,000개의 형태입니다. 이는 문서를 프롬프트에 붙여넣는 모든 요청에서 발생하는 형태와 같습니다:
| 히트율 0%일 때 더 저렴한 모델 | ~보다 비싸지는 모델 | 교차점 (Crossover) |
|---|---|---|
| GPT-4.1 | GPT-6.1 Sol | 20.0% |
| ... |
작동 예시: Grok 4.6 대 GPT-6 Sol
- Grok 4.6: 입력 $2, 캐시(cached) $0.50, 출력 $6
- GPT-6 Sol: 입력 $2, 캐시(cached) $0.20, 출력 $10
두 모델은 동일한 입력 가격을 공유하므로, 표면적인 가격표만 보면 피딩(feed)하는 데 비용이 같다고 합니다. 하지만 실제로는 그렇지 않습니다.
cost_Grok(f) = 50000·(2 − 1.5f) + 2000·6 = 112,000 − 75,000·f
cost_GPT6(f) = 50000·(2 − 1.8f) + 2000·10 = 120,000 − 90,000·f
...
캐시 히트율이 53.3% 미만일 때는 Grok 4.6이 더 저렴합니다. 그 이상에서는 GPT-6 Sol이 더 저렴합니다. 표면적인 입력 가격은 같지만, 캐시 동작 방식에 따라 결론이 달라지며, 어느 제공업체의 가격 페이지도 이러한 교차점이 존재한다는 사실을 알려주지 않습니다.
GPT-4.1의 결과는 더욱 극명합니다. GPT-4.1은 **20%**의 캐시 히트율까지는 GPT-6.1 Sol보다 저렴한데, 이는 GPT-4.1이 히트를 4배 할인하는 반면 GPT-6.1 Sol은 20배로 할인하기 때문입니다.
이것이 중요한 이유
팀들은 표면적인 입력 가격을 보고 모델을 선택하고 배포하지만, 실제 인보이스(invoice)를 받고는 이를 설명할 수 없습니다. 왜냐하면 그들의 실제 히트율이 그들이 존재한다는 것을 전혀 알지 못했던 경계를 넘게 했기 때문입니다. 캐시 할인 비율(cache discount ratio)이 헤드라인 가격(headline price)이 아니라, 캐싱이 활성화되었을 때 누가 승리할지를 결정하는 요소입니다.
이것이 말하지 않는 것
- 제시된 요율은 2026년 10월에 발표된 기본 티어(base tier) 가격입니다. 긴 컨텍스트 추가 비용(long-context surcharges)과 배치 티어는 상수 값을 변경하고
f*를 이동시킵니다. - 이는 캐시 히트가 무료로 확보할 수 있다고 가정합니다. 캐시 **쓰기(writes)**는 종종 별도로 청구되며, 대부분의 시간이 콜드 캐시(cold cache)인 워크로드는
f = 0근처에 머무릅니다. - Anthropic은 긴 컨텍스트 추가 비용을 부과하지 않습니다. 숨겨진 티어 임계값(hidden tier threshold)을 가진 모델은 이 단일 티어 모델이 보여주는 것과는 다르게 그 위에서 동작합니다.
공식 수식은 정확하지만, 입력 속도(input rates)가 취약한 부분입니다. f*를 신뢰하기 전에 이를 확인하고, 여러분의 워크로드 형태 또한 점검해야 합니다.
위의 수치들은 각 제공업체가 청구하는 방식대로 프롬프트 캐시 쓰기(prompt-cache writes), 캐시 읽기(cached reads), 배치 티어(batch tiers), 그리고 긴 컨텍스트 티어링(long-context tiering)을 적용하는 무료, 계정 불필요, 클라이언트 측 계산기에서 나온 것입니다. 이 계산기는 주어진 워크로드에 대해 28개 모델 모두의 실제 월별 비용으로 순위를 매겼습니다:
https://rabayid.com/. 제시된 속도들은 각 제공업체의 가격 페이지에서 전사되었으며 날짜가 명시되어 있습니다. 위의 캐시 교차점(cache crossover)은 공개된 data/pricing.json 파일로부터 재현 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기