Claude Haiku 5.5, 프롬프트 토큰 수에 따라 가격이 다섯 배로 급등합니다
요약
Anthropic의 Claude Haiku 5.5는 입력 토큰 길이에 따라 가격 책정 방식이 달라지는 것이 특징입니다. 최대 10만 토큰까지는 저렴하지만, 이 임계값을 넘어서면 비용이 급격히 상승합니다. 또한, 새로운 토크나이저 사용으로 인해 기존에 알고 있던 프롬프트 크기 기준(76,900 토큰)을 염두에 두어야 합니다.
핵심 포인트
- Claude Haiku 5.5는 입력 토큰 길이에 따라 가격 구조가 달라집니다.
- 10만 토큰 임계값을 넘으면 비용이 급격히 상승하는 점을 유의해야 합니다.
- 새로운 토크나이저 사용으로 인해 실제 프롬프트 크기 기준이 변경되었습니다 (약 76,900 토큰).
- 프롬프트 캐싱 시 입력 토큰 계산 방식에 대한 이해가 필요합니다.
10만 개의 토큰을 가진 프롬프트와 2,000개의 출력 토큰으로 Claude Haiku 5.5를 요청하는 비용은 $0.011입니다. 여기에 프롬프트를 1토큰 추가하면 같은 요청이 $0.055가 됩니다. 다른 것은 전혀 변하지 않았지만, 가격표에서 한 선을 넘었습니다.
Anthropic은 2026년 10월 7일에 Haiku 5.5를 출시했으며, 10월 8일 기준으로 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry 및 AWS의 Claude Platform에서 ID claude-haiku-5-5 (Bedrock에서는 anthropic.claude-haiku-5-5)로 이용 가능합니다. 핵심은 가격입니다. Haiku 4.5가 입력 토큰당 $1인 것에 비해, Haiku 5.5는 백만 개의 입력 토큰당 $0.10입니다. 문제는 저렴한 요율이 "최대 100,000 토큰의 프롬프트"에 대한 것이고, 모델은 그보다 10배나 큰 프롬프트를 처리한다는 점입니다. Hacker News에서 이 출시를 논의한 글에서는 에이전트 워크로드가 이 선을 넘지 않을 수 있는지에 대해 오고 갔지만 결론을 내리지 못했습니다. 그래서 저희가 작은 Go 프로그램을 사용해 계산해보았습니다. 이번 실행에는 API 키가 없었기 때문에 아래 내용은 모델에 전송되지 않습니다: 가격은 Anthropic의 문서를 기반으로 하며, 비용은 이를 통해 계산되었습니다.
Claude Haiku 5.5의 가격 책정은 두 가지 완전한 요금표를 가집니다
가격 페이지는 Haiku 5.5에 두 개의 행을 제공합니다. 하나는 "최대 100,000 토큰의 프롬프트용"이고 다른 하나는 "100,000 토큰 초과 프롬프트용"입니다. 백만 토큰당:
| | 최대 100,000 | 100,000 초과 | Haiku 4.5 | :--- |
| 입력 | $0.10 | $0.50 | $1.00 |
| ... |
문서에서 프롬프트로 간주하는 것과 제외하는 것
문서에서 '프롬프트(Prompt)'는 표에서 많은 역할을 하지만, 이를 usage 필드에 대한 공식으로 정의하고 있지는 않습니다. 여기에 명시된 내용은 다음과 같습니다.
프롬프트 캐싱(prompt caching)이 활성화되면 입력은 input_tokens, cache_creation_input_tokens, 그리고 cache_read_input_tokens로 분할됩니다. 컨텍스트 창(context windows) 페이지는 캐시된 토큰에 대해 단도직입적으로 말합니다: “프롬프트 캐싱은 해당 토큰을 지불하는 방식만 바꿀 뿐, 그 토큰이 계산되는지 여부는 바꾸지 않습니다.” 따라서 우리는 프롬프트를 이 세 가지 모두의 합으로 간주하며, 이는 100,000 토큰 길이의 캐시된 접두사(prefix)에 50 토큰짜리 질문이 더해져 비싼 등급에 속하게 되는 경우입니다. 이것은 우리가 해석한 것이지 인용된 규칙은 아닙니다. 청구서가 이에 의존한다면, 실제 송장과 크기를 아는 요청을 비교해 보세요.
라인을 움직이는 두 가지 추가적인 사항이 있습니다.
Haiku 5.5는 더 새로운 토크나이저(tokenizer)를 사용하며, 마이그레이션 가이드에 따르면 동일한 텍스트가 Haiku 4.5에서보다 “약 30% 더 많은 토큰을 생성”한다고 합니다. 만약 Haiku 4.5 기준으로 프롬프트 크기를 알고 있다면, 임계값은 당신에게 100,000이 아닙니다. 약 76,900입니다.
그리고 사전 점검(pre-flight check)도 근사치입니다. 토큰 계산 엔드포인트(token counting endpoint)는 무료이며 메시지 요청과 동일한 본문(body)을 사용하지만, 문서에서는 그 결과를
두 요청을 준비하여 토큰 수 차이가 하나 나는 경우와 동일한 자료에 대해 두 부분(각 1,000 출력 토큰)으로 나누어 150,000 토큰짜리 프롬프트를 보내보세요:
prompt 100000 + 2000 out $0.011000 long=false
prompt 100001 + 2000 out $0.055001 long=true
...
두 번째 쌍이 실질적인 예시입니다. 긴 문서를 두 개의 75,000 토큰 호출로 요약하는 비용은 한 번에 하는 것의 5분의 1이며, 여기에 세 번째 호출을 추가하여 두 부분을 병합해도 여전히 훨씬 저렴합니다. 이 모델이 판매되는 추출 및 분류와 같은 대규모 입력 처리에서, 청킹(chunking)은 이제 품질 문제뿐만 아니라 가격 결정 문제도 되었습니다.
에이전트 루프가 17번째 턴에서 경계를 넘다
100,000 토큰이 많은 양일까요? 단일 분류 호출의 경우 엄청난 양입니다. 하지만 모든 결과를 대화에 추가하는 도구 호출(tool-calling) 에이전트에게는 그렇지 않습니다.
저희는 프롬프트 캐싱을 적용한 루프를 모델링했습니다: 시스템 프롬프트와 도구 정의의 8,000 토큰 접두사(prefix)가 있고, 각 턴마다 5,000 토큰짜리 도구 결과와 500 토큰짜리 답변이 추가됩니다. 이 크기들은 그럴듯하게 만들기 위해 임의로 설정된 것입니다. 이것은 청구 모델을 보여주는 것이며, 사용자의 에이전트는 다른 수치를 가질 것입니다.
turn 16: prompt 95500 $0.00184 long=false
turn 17: prompt 101000 $0.00946 long=true
append only $0.3267 (첫 번째 long-tier 턴: 17)
...
17번째 턴은 거의 같은 작업량에 대해 16번째 턴보다 다섯 배 비싸며, 히스토리만 계속 늘어나기 때문에 이후의 모든 턴도 비싼 등급(expensive tier)에 머무릅니다. 40턴이 넘는 append-only 루프는 $0.33의 비용이 발생합니다. 두 번째 줄은 다음 프롬프트가 100,000을 초과할 때마다 히스토리를 3,000 토큰짜리 요약으로 대체하여 그 요약 작성에 대한 비용을 지불하며, 총 $0.06의 비용이 발생합니다. 요약본이 사용자의 작업에 충분한지는 가격표가 답할 수 없는 별개의 질문입니다.
명백한 해결책에도 함정이 있습니다. API의 임계치 압축(threshold compaction)은 베타 버전이며 Haiku 5.5를 지원하는 것으로 명시되어 있습니다. 이 기능은 입력이 특정 임계치에 도달하면 서버에서 이전 대화 내용을 요약합니다. 기본 임계치는 150,000 입력 토큰입니다. 다른 모델에서는 합리적인 기본값입니다. 하지만 Haiku 5.5의 경우 가격이 인상된 후 50,000 토큰마다 압축 기능이 작동한다는 의미입니다. 직접 설정해야 하며, 최소값은 50,000입니다:
{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
...
이 본문은 문서화된 예시를 각색한 것이며 anthropic-beta: compact-2026-01-12 헤더와 함께 사용됩니다. 저희는 이 헤더도 보내지 않았습니다.
마이그레이션 가이드를 먼저 읽지 않고 수동으로 기록을 자르지 마십시오. Haiku 5.5는 기본적으로 사고(thinking) 과정을 거치며, 이전 메시지에 변경 사항이 생겨 생각하는 블록(thinking block)을 다시 보내는 요청은 400 오류로 돌아올 수 있습니다 (가이드에 어떤 계정이 이 검사를 받는지 나와 있습니다). 이 모델의 지침은 대화를 추가 전용(append-only)으로 유지하는 것이므로, 수동으로
따라서: 라인 아래의 동일한 텍스트는 87% 저렴하고, 그 위는 35% 저렴합니다. Anthropic의 발표에 따르면 최대 100,000 토큰의 프롬프트가 '이전 Haiku 모델로 들어오는 요청의 약 90%'를 차지한다고 합니다. 이것은 요청의 점유율을 의미하며, 긴 요청일수록 각 요청마다 더 많은 토큰을 포함하므로, 장기(long) 티어에 할당되는 지출 비중은 1/10보다 훨씬 높을 수 있습니다.
이 전환은 단순히 가격 변경만 있는 것이 아닙니다. 수동 budget_tokens 지정, 기본값이 아닌 temperature 설정, 그리고 어시스턴트 프리필(assistant prefill) 모두 Haiku 5.5에서 400 오류를 반환합니다. 이는 Claude Sonnet 5.5에 대해 언급된 변경 사항과 매우 유사합니다. 그리고 만약 긴 프롬프트가 도구 정의(tool definitions) 때문에 길어진 것이라면, 먼저 측정해 보세요; 이들은 모든 요청에 포함됩니다.
저희의 조언은 간단합니다. Haiku 5.5로 보내는 모든 것에 대해 90,000 토큰을 예산으로 설정하고, 그 아래에 압축(compaction) 트리거를 설정하며, 몇 번 호출이 초과되는지 확인할 수 있도록 요청별 usage를 기록하세요. 만약 작업 부하가 들어맞지 않는다면, 분할하세요. 분할할 수 없다면, 어쨌든 실행하고, 받고 있는 것이 35% 할인이라는 것을 인지하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기