토큰 가격에서 작업별 가격으로: 세 가지 작업과 일곱 개의 API
요약
본 글은 LLM API 가격이 단순히 '백만 토큰당'으로 제시되는 방식의 한계를 지적하며, 실제 사용 시에는 작업별(task-specific) 비용 계산이 필수적임을 보여줍니다. 지원 메시지 라벨링, 초안 요약 변환, 도구 기반 버그 수정 등 세 가지 구체적인 작업을 예시로 들어 토큰 소비량과 예상 비용을 상세히 분석했습니다.
핵심 포인트
- LLM API 가격은 작업별(task-specific) 관점에서 계산해야 정확하다.
- 토큰 사용량은 단순 측정치가 아닌, 실제 워크플로우에 기반한 가정이 필요하다.
- 캐시 읽기/쓰기 등 특수 기능의 요율 적용 방식도 이해해야 한다.
모든 공급업체는 백만 토큰당 가격을 발표합니다. 하지만 어떤 것도 특정 '작업'에 비용이 얼마가 드는지 공개하지 않으며, 이 숫자는 기능 출시 여부를 결정하는 산수 숙제처럼 남아 있습니다.
저는 2026-10-09일에 읽은 첫 번째 파티(first-party) 가격표를 바탕으로 세 가지 작업에 대한 계산을 해보았습니다. 토큰 수는 측정치가 아닌 가정이며, 아래에 작성했습니다. 금액은 공급업체의 표준 등급 목록 가격(standard-tier list price) 기준이며, USD로 표시되어 있습니다.
세 가지 작업
작업 1: 지원 메시지 1,000개 라벨링. 각 호출은 400 토큰의 명령어 블록과 120 토큰의 메시지를 전송하고 15 토큰의 답변을 요청합니다. 실행당 청구되는 양은 총 520,000개의 입력 토큰이며, 이 중 400,000개는 1,000번 전송된 명령어 블록이고, 나머지 15,000개가 출력 토큰입니다.
작업 2: 10만 단어 분량의 초안을 구조화된 요약으로 변환. Google의 토큰 가이드에 따르면 토큰은 약 4개의 문자에 해당하며, 100토큰은 약 6080개의 영어 단어입니다. 따라서 10만 단어는 125,000167,000 토큰(Google token counting guide 참조, 2026-10-09일자)에 해당합니다. 저는 140,000개를 사용했습니다:
- One shot: 입력으로 140,000 토큰을 사용하고, 구조화된 요약으로 3,000 토큰을 출력합니다.
- Map-reduce: 약 10,000 토큰씩 14개의 청크(chunk) 호출과 청크당 700토큰의 노트가 필요하며, 이후 9,800토큰의 reduce 호출이 필요합니다. 총합은 입력 149,800개, 출력 12,800개입니다.
작업 3: 도구 지원 버그 수정 한 라운드. 20,000 토큰 규모의 저장소(repository)를 대상으로 하는 8번의 턴(turn) 작업입니다. 시스템 프롬프트, 도구 스키마, 세 개의 파일이 포함됩니다. 도구 결과가 돌아올 때마다 프롬프트는 턴당 약 2,500토큰씩 증가하여 20,000개에서 37,500개로 커집니다. 누적 청구 입력은 230,000 토큰이며, 이 중 192,500개는 캐시가 제공할 수 있는 재전송 접두사(re-sent prefix)입니다. 출력은 추론을 포함하여 6,000 토큰입니다.
가격표를 읽은 방법
모든 페이지는 2026-10-09일에 읽은 첫 번째 파티 웹페이지였으며, Gemini API 페이지는 테이블이 클라이언트 측에서 구축되었기 때문에 브라우저에서 읽었습니다.
- OpenAI API 가격 — 표준 요금제
- Anthropic 가격
- Gemini API 가격 — 유료 요금제, 2026년 12월 31일까지 소개 요율 적용
- DeepSeek 모델 및 가격 — 비피크(off-peak) 열
- xAI 가격
제가 적용한 규칙:
- 배치(batch)라고 명시된 행을 제외하고는 표준 요금제만 적용했습니다: 실시간(real-time) 요금제입니다.
- 캐시 읽기(Cache reads)는 발표된 캐시 입력 요율로 청구됩니다. 캐시 쓰기(Cache writes)는 공급업체가 쓰기 가격을 발표한 경우에만 청구됩니다. OpenAI와 Anthropic은 5분 캐시에 대해 각각 두 개의 최첨단 모델(frontier models)의 경우 밀리언 토큰당 $2.50, 두 개의 소형 모델(small ones)의 경우 $0.125를 책정했습니다. Google, DeepSeek, xAI는 쓰기 가격을 발표하지 않았으므로 저는 0으로 청구하여 이 세 회사 모두 캐시된 모든 행에서 유리하게 만들었습니다.
- 캐시된 행에서는 캐시 읽기가 아닌 모든 입력 토큰에 대해 쓰기 비용을 청구합니다: 작업 1의 경우 400 토큰, 작업 3의 경우 37,500 토큰입니다.
- 추론(Reasoning) 토큰은 출력 토큰으로 간주됩니다. OpenAI는 이것이 출력 토큰으로 청구된다고 명시했습니다(OpenAI 추론 가이드, 2026년 10월 9일자 참고). Gemini의 출력 가격은
| 작업 (Task) | 모델 (Model) | 예상 비용 (Estimated cost) | 가정 (Assumptions) | 가격 출처 (Price source) (2026-10-09 기준) |
|---|---|---|---|---|
| Job 1, 캐시 없음 (no cache) | gpt-6.1-sol | $1.19 | 표준 등급; 입력 520k / 출력 15k | OpenAI |
| ... | ||||
| 두 쌍의 행은 의도적으로 동일합니다. gpt-6.1-sol과 Claude Sonnet 5.5는 모두 입력 토큰당 $2.00, 출력 토큰당 $10.00, 캐시된 입력 토큰당 $0.10, 그리고 캐시 쓰기(cache write)에 $2.50를 책정했습니다 (OpenAI 가격 및 Anthropic 가격, 2026-10-09 기준); gpt-6-luna와 Claude Haiku 5.5는 모두 $0.10, $0.50, $0.01 및 $0.125를 책정했습니다. |
각 공급업체의 최대 할인율이 적용된 동일한 작업 (The same jobs with each vendor's biggest discount)
배치(Batch)가 가장 큰 공개 할인입니다: OpenAI에서는 50% 할인 (가격 페이지, 2026-10-09 기준), Anthropic에서는
Claude Haiku 5.5의 one-shot 셀은 예외적입니다: 배치(batch)를 사용하면 $0.039로 떨어지지만, 여전히 캐시된 Job 1($0.012)보다 세 배 비쌉니다. 이는 140,000 토큰 프롬프트가 100,000 토큰 단계보다 높기 때문입니다 (Anthropic pricing, 2026년 10월 9일 기준).
수치들이 말하는 것
여기에 제시된 모든 수치는 위에 있는 행들의 산술적 계산이며, 이 비율들은 연결되어 있습니다 (OpenAI, Anthropic, Google, DeepSeek, xAI, 2026년 10월 9일 기준).
최전선(frontier) 등급에서는 출력 토큰이 비용을 결정합니다. gpt-6.1-sol의 캐시된 Job 1에서 $0.43 중 $0.15는 출력(35%)이고 $0.04는 캐시된 명령어 토큰(9%)입니다.
하나의 공급업체 내에서의 격차가 공급업체 간의 격차보다 더 큽니다. 캐시된 Job 1은 gpt-6-luna와 Haiku 5.5에서 $0.024, gpt-6.1-sol과 Sonnet 5.5에서 $0.43, Grok 4.7에서 $0.53입니다: 가장 비싼 것부터 가장 저렴한 것까지는 22배 차이이며, 저가 쌍과 최전선 쌍 사이에는 18배 차이가 납니다. 같은 등급에서는 공급업체가 아무것도 바꾸지 않습니다.
에이전트 루프(agent loop)가 여기서 가장 저렴한 작업입니다. Job 3은 gpt-6.1-sol에서 $0.25인 반면, one-shot 요약은 $0.31이고 Job 1은 $1.19입니다. 소형 모델의 경우 순서가 바뀝니다: Haiku 5.5는 140,000 토큰이 임계값을 넘고 8회에 걸친 230,000 토큰은 그렇지 않기 때문에 one-shot 요약에 $0.078을 지불하고 루프에는 $0.013을 지불합니다.
Map-reduce가 one-shot보다 비용이 많이 듭니다. 두 개의 $2/$10 모델에서 이는 각각 $0.43 대 $0.31이며, 그 차이는 모두 출력 토큰에 기인합니다: 12,800개 대 3,000개입니다. 청킹(Chunking)은 신뢰성을 구매하며 출력 비용으로 지불됩니다.
절대적인 수치들은 작습니다. 주요 표는 $0.0098에서 $1.19까지 범위이며, 배치(batch) 작업은 최저가인 $0.0067을 기록합니다. 이러한 규모에서는 비용 문제가 보통 볼륨(volume) 문제입니다.
변동성을 만드는 요인들
임계값(Thresholds)이 전체 요청의 가격을 재설정합니다. Claude Haiku 5.5는 최대 100,000 개의 프롬프트 토큰까지 입력 및 출력 토큰당 각각 $0.10과 $0.50를 부과하며, 그 이상은 각각 $0.50와 $2.50를 부과합니다. 길이는 캐시 읽기(cache reads)와 쓰기(writes)를 계산하며, 각 요청은 개별적으로 가격이 책정됩니다 (Anthropic pricing, 2026-10-09 조회). Job 2의 140,000 토큰 프롬프트는 모든 항목에서 더 높은 요율을 적용받습니다: 최대치 대비 $0.078입니다. xAI는 프롬프트가 200,000을 초과하면 요청 내 모든 토큰에 장문 컨텍스트(long-context) 요율을 적용하며, 이 경우 Grok 4.7은 입력 $4.00, 캐시 입력 $1.00, 출력 $12.00를 부과하여 기존의 $2.00, $0.50 및 $6.00보다 높습니다 (xAI pricing, 2026-10-09 조회). Gemini 3.1 Pro Preview는 200,000 토큰 초과 시 입력당 백만 토큰 기준으로 $2.00에서 $4.00로 상승합니다 (Gemini Enterprise Agent Platform pricing, 2026-10-09 조회). OpenAI의 요율은 열 설명자(column tooltip)에 게시된 272,000 입력 토큰을 기준으로 하며, 이를 초과하면 gpt-6.1-sol의 입력 비용은 $4.00로 두 배가 되고 출력 비용은 $15.00가 됩니다 (OpenAI pricing, 2026-10-09 조회). 세 작업 모두 모든 요율보다 낮은 수준을 유지하며, Job 2는 OpenAI의 중간 지점에 위치합니다.
토크나이저 차이점. Anthropic은 Claude 4.7 이후 버전에서
시간대별 가격 책정. DeepSeek의 피크 시간대는 월요일부터 금요일까지 UTC 기준 01:00-04:00 및 06:00-10:00이며, 중국 공휴일은 제외됩니다. 다른 모든 시간대는 반값인 비피크(off-peak)입니다 (DeepSeek Models & Pricing, 2026-10-09 읽음). Job 1의 uncached 비용은 비피크 시 $0.087, 피크 시 $0.174입니다. 비피크 시간대는 주간 총 168시간 중 133시간에 해당합니다.
캐시 경제성은 비율뿐만 아니라 형태에서도 다릅니다. Anthropic의 경우 대부분의 모델에서 캐시 적중(cache hit) 비용은 입력 가격의 10%이며, Opus 5.5와 Sonnet 5.5에서는 5%, Fable 5.1과 Mythos 5.1에서는 2.5%입니다. 쓰기(write)는 5분당 1.25배, 시간당 2배가 부과되므로, 5분 캐시는 한 번의 읽기로 비용을 회수할 수 있습니다 (Anthropic pricing, 2026-10-09 읽음). DeepSeek의 적중(hit) 가격은 백만 토큰당 $0.003이며, 누락(miss) 시에는 $0.15입니다 (DeepSeek pricing, 2026-10-09 읽음). Google은 쓰기 비용을 부과하지 않지만, Gemini 3.8 Flash의 경우 2026-12-31까지 시간당 백만 토큰당 $0.50, Gemini 3.1 Pro는 $4.50의 스토리지 비용을 청구합니다 (Gemini pricing 및 Gemini Enterprise Agent Platform pricing, 2026-10-09 읽음). 캐시된 140,000 토큰 문서의 경우 Flash는 시간당 $0.07, Pro는 $0.63입니다.
플랫폼 수수료는 토큰 사용량 측정기 밖에 존재합니다. OpenAI는 도구 호출(tool calls) 건당 1,000건에 대해 $2.50, 웹 검색(web searches) 건당 1,000건에 대해 $10을 청구하므로, Job 3의 8개 호출은 $0.02가 소요되며, Anthropic의 도구 사용 프롬프트는 토큰 286~675를 추가합니다 (OpenAI pricing 및 Anthropic pricing, 2026-10-09 읽음). xAI는 가져온 항목당 X 검색 비용을 청구합니다: 게시물 1,000개당 $5, 프로필 1,000개당 $10입니다 (xAI pricing, 2026-10-09 읽음).
지연 시간(Latency)과 지리적 위치는 승수(multipliers)를 가집니다. OpenAI의 Fast 모드는 2026년 7월 30일자로 Priority에서 이름이 변경되었으며, 이는 2배가 적용되고 데이터 거주지 엔드포인트는 10%가 추가됩니다. Gemini 3.8 Flash의 Priority 티어는 입력 기준으로 $1.35에, 표준(standard)은 $0.75입니다 (OpenAI 가격 책정 및 Gemini 가격 책정, 2026년 10월 9일자 참조). xAI의 priority 티어는 2배이며, 미국 지역 엔드포인트는 1.1배가 적용됩니다. Anthropic은 미국 전용 추론(inference)에 대해 1.1배를 부과하며, 지역별 Bedrock 및 Google Cloud 엔드포인트에는 10% 프리미엄이 추가됩니다 (xAI 가격 책정 및 Anthropic 가격 책정, 2026년 10월 9일자 참조).**
표시된 기본 가격 자체도 변동합니다. Google은 Flash 모델의 가격을
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기