LLM 비용 문제는 가격 책정 문제가 아니라 라우팅 문제입니다: 2026년 7월 토큰 비용 계산법
요약
LLM 비용 절감의 핵심은 모델 가격 자체가 아니라 작업의 난이도에 따른 적절한 모델 라우팅에 있습니다. 프롬프트 캐싱, 배치 API 활용, 그리고 작업 역량에 따른 모델 분류를 통해 비용을 획기적으로 줄일 수 있습니다.
핵심 포인트
- 모델별 가격 격차가 매우 크므로 작업 난이도에 맞는 라우팅이 필수적임
- 프롬프트 캐싱을 통해 입력 비용을 최대 5~10배 절감 가능
- 비동기 배치 API를 활용하면 표준 요율 대비 50% 할인 혜득 가능
- 토크나이저 차이를 고려하여 토큰당 비용이 아닌 작업당 비용으로 측정해야 함
당신의 LLM 비용은 가격 책정 (pricing) 문제가 아니라, 라우팅 (routing) 문제입니다. 2026년 7월 공식 벤더 페이지에서 확인된 가격에 따르면, "GPT-4급" 출력 토큰 가격은 두 자릿수(two orders of magnitude) 차이가 납니다. 백만 토큰당 $0.28 (DeepSeek V4-Flash)부터 $50 (Claude Fable 5)까지 다양합니다. 만약 당신의 앱에 들어오는 모든 호출이 동일한 프론티어 모델 (frontier model)에 도달한다면, 당신은 $0.40짜리 모델이 충분히 처리할 수 있는 작업에 대해 프론티어 가격을 지불하고 있는 것입니다.
더 많은 팀이 첫 인보이스를 받기 전에 계산해 보길 바라는 수학적 근거는 다음과 같습니다.
2026년 7월 가격 격차 (USD per 1M tokens, 표준 티어)
| 모델 | 입력 (Input) | 출력 (Output) |
|---|---|---|
| DeepSeek V4-Flash | $0.14 ($0.0028 캐시 히트 시) | $0.28 |
| ... | ||
| (가격은 2026년 7월 7일 공식 벤더 가격 페이지에서 확인되었습니다. 제공업체 링크와 분기별 업데이트가 포함된 전체 표는 여기에서 확인할 수 있습니다.) |
이 내용을 스크린샷 찍기 전에 주의할 점이 하나 있습니다: 토크나이저 (tokenizers)가 서로 다릅니다. Anthropic은 자사의 최신 모델들이 이전 모델들보다 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성한다고 언급했습니다. 정직한 단위는 토큰당 비용이 아니라 '작업 (task)'당 비용입니다. 이 표를 1차 필터로 사용하되, 그다음에는 당신의 워크로드 (workload)를 직접 측정하십시오.
표 전체의 순서를 바꾸는 세 가지 할인 요소
1. 프롬프트 캐싱 (Prompt caching). DeepSeek의 V4-Flash 캐시 히트 (cache-hit) 입력 비용은 $0.0028/MTok로, 사실상 무료에 가까운 컨텍스트 재사용이 가능합니다. Anthropic은 캐시 읽기 비용을 기본 입력 비용의 0.1배로 청구합니다. 매 호출마다 대규모 시스템 프롬프트를 다시 보내는 모든 채팅이나 에이전트 (agent) 워크로드는 모델 교체를 고민하기 전에 캐시 최적화 (cache-optimized)를 먼저 수행해야 합니다. 이는 품질 저하 없이 입력 비용을 통상 5~10배 절감할 수 있는 방법입니다.
2. 배치 API (Batch APIs). OpenAI, Anthropic, Google 모두 비동기 배치 처리 (asynchronous batch processing)에 대해 50% 할인을 제공합니다. 만약 당신의 파이프라인 (pipeline)이 오프라인 작업 — 요약 백필 (summarization backfills), 분류 실행 (classification runs), 임베딩 준비 (embeddings prep) — 이라면, 표준 요율을 지불하는 것은 예산의 절반을 기부하는 것과 같습니다.
3. 기간 한정 가격 (Time-boxed pricing). Claude Sonnet 5는 2026년 8월 31일까지 $2/$10로 운영되며, 그 이후에는 $3/$15로 변경됩니다. 이러한 시장 환경에서 예산에는 반드시 날짜 정보가 포함되어야 합니다.
라우팅 (Routing): 확장이 가능한 유일한 레버
실제 운영 환경에서 비용을 절감하는 패턴은 지루할 정도로 단순합니다:
- 습관이 아닌, 요구되는 역량에 따라 호출을 분류하세요. 대부분의 제품에서 호출의 80-90%는 추출 (extraction), 재형식화 (reformatting), 분류 (classification), 짧은 요약 (short summaries)과 같은 기계적인 작업입니다. $0.28~$1.25 수준의 출력 티어 (output tier)로도 충분히 처리 가능합니다.
- 남은 10-20%를 라우팅하세요 — 다단계 추론 (multi-step reasoning), 까다로운 종합 (tricky synthesis), 고객에게 노출되는 긴 형식의 글 (long-form) 등은 프런티어 모델 (frontier model)로 보냅니다.
- 캐싱 (caching)과 배치 (batch)를 기본적으로 활성화하세요. 표준 요율의 오프라인 작업을 그대로 두는 것은 버그로 간주해야 합니다.
실제 사례: 각각 약 1,000개의 입력 토큰과 300개의 출력 토큰을 사용하는 10,000개의 요약 작업은 약 1,300만(13M) 토큰입니다. DeepSeek V4-Flash를 사용하면 약 $2.24가 듭니다. $5/$25 수준의 프런티어 모델을 사용하면, 아마도 활성화하는 것을 잊었을 배치 할인 (batch discount)을 적용하기 전에도 동일한 배치의 비용은 약 $140입니다. 동일한 작업량임에도 약 60배의 차이가 발생하며, 요약 작업의 경우 평가 (evals) 상에서 품질 차이가 거의 느껴지지 않는 경우가 많습니다.
이 중 어떤 것도 플랫폼 마이그레이션 (migration)을 요구하지 않습니다. 대부분의 팀은 가벼운 라우터 함수 (router function)와 두 개의 모델 클라이언트 (model clients)만으로도 이 단계에 도달할 수 있습니다.
자신의 워크로드 형태에 맞춰 수치를 계산해 보세요
백만 토큰당 가격은 워크로드의 형태, 즉 입력/출력 비율 (input/output ratio), 캐시 히트율 (cache hit rate), 배치 비중 (batch share)을 추상화해 버립니다. 스프레드시트를 만들지 않고도 작업당 비용 (cost-per-task) 계산을 하고 싶다면, 제가 무료 토큰 비용 계산기 (token cost calculator)와 제공업체별 소스 링크가 포함된 분기별 업데이트 가격 비교 (price comparison)를 운영하고 있습니다. 가입은 필요 없으며 표만 확인하시면 됩니다.
현재 여러분의 라우터 설정은 어떠신가요? 저는 실제 라우팅 분할 비율 (호출의 몇 %를 프런티어 티어 대 예산 티어로 보내는지)을 수집하고 있습니다. 댓글로 여러분의 사례를 공유해 주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기