Claude Haiku 5.5의 비용이 Luna와 같다? 당신의 청구서는 아닐 것이다.
요약
Claude Haiku 5.5와 GPT-6 Luna의 공개된 가격표가 같아 보이지만, 실제 청구서에는 큰 차이가 있을 수 있습니다. 특히 입력 토큰이 10만 토큰을 초과할 경우 Haiku 5.5의 요율이 급격히 상승하는 '함정'이 존재합니다. 사용자는 이 경계선을 이해하고 비용 효율적인 모델 선택에 주의해야 합니다.
핵심 포인트
- Haiku 5.5와 GPT-6 Luna는 표면적으로 같은 가격이지만, 실제 청구서가 다를 수 있습니다.
- Haiku 5.5는 최대 10만 토큰을 초과하면 요율이 급격히 상승하는 경계선(cliff)이 존재합니다.
- 사용자는 긴 시스템 프롬프트나 채팅 기록 등으로 인해 이 비용 경계를 넘지 않도록 주의해야 합니다.
- Luna 모델은 Haiku 5.5보다 더 넓은 범위(272K 토큰)에서 저렴한 요율을 유지하는 장점이 있습니다.
같은 가격, 같은 청구서? 사실은 아니다
이번 주에 모두가 본 헤드라인입니다. Claude Haiku 5.5는 입력 토큰 백만 개당 $0.10, 출력 토큰 백만 개당 $0.50의 비용이 발생합니다. GPT-6 Luna 역시 정확히 같은 가격입니다 (Anthropic, VentureBeat).
따라서 당신은 동일한 청구서를 예상할 것입니다. 이제 각 모델에서 네 가지 실제 요청 크기가 얼마인지 살펴보세요:
| 요청 (입력 / 출력 토큰) | Haiku 5.5 | GPT-6 Luna | Haiku 대 Luna |
|---|---|---|---|
| 5K / 1K | $0.0010 | $0.0010 | 1x |
| ... | |||
| I calculated these from the official price tables. The first two rows match. The third one is five times more expensive on Haiku. Same list price, very different bill. |
이 게시물은 그 차이 뒤에 숨겨진 작은 함정들에 관한 것입니다. 네 가지가 있으며, 대부분의 출시 글들은 이를 건너뜁니다. 마지막에는 자체 트래픽으로 실행할 수 있는 작은 비용 테스트를 얻게 됩니다.

Claude Haiku 5.5란 무엇인가요? 30초 만에?
이것은 Anthropic의 5.5 제품군에 속하는 작고 저렴한 모델로, 2026년 10월 7일에 출시되었습니다. Anthropic은 요약, 분류, 데이터베이스 조회 및 서브 에이전트(subagents)와 같은 대용량 작업 처리를 위해 이를 만들었습니다 (Anthropic).
빠른 정보:
-
모델 ID:
claude-haiku-5-5 -
플랫폼: Claude Platform, Amazon Bedrock, Google Cloud, Microsoft Foundry
-
컨텍스트 윈도우: 100만 토큰, 최대 출력 128K 토큰 (Kingy AI)
-
노력(effort) 설정이 적용된 최초의 Haiku. 기본값은 medium입니다.
이제 함정들입니다.
함정 1: 왜 100K 프롬프트가 훨씬 더 많은 비용을 발생하나요?
Haiku 5.5는 두 가지 가격 구간이 있습니다. 프롬프트에서 최대 100,000 토큰까지는 저렴한 요율을 지불합니다. 이를 초과하면 모든 요율이 다섯 배로 곱해집니다.
| 1M 토큰당 | Haiku 5.5, 최대 100K | Haiku 5.5, 100K 초과 | GPT-6 Luna, 최대 272K | GPT-6 Luna, 272K 초과 |
|---|---|---|---|
| 입력 (Input) | $0.10 | $0.50 | $0.10 | $0.20 |
| ... |
Sources: Anthropic pricing and Kingy AI's rate table.
사람들이 놓치는 두 가지 세부 사항:
전체 요청에 대해 재가격 책정됩니다. 프롬프트가 100,001 토큰인 경우, 추가된 한 토큰에 대해서만 높은 요율을 지불하는 것이 아닙니다. 모든 토큰에 대해 그 요율이 적용됩니다. Kingy AI는 요청이 단지 하나의 토큰을 넘어서면서 $0.011에서 약 $0.055로 급등하는 것을 보여줍니다.
Luna의 경계선은 훨씬 더 멀리 떨어져 있습니다. 100K가 아닌 272K 토큰에서 상승합니다. 100K와 272K 사이에서는 Luna가 더 저렴한 모델입니다.
Anthropic에 따르면 Haiku 4.5 요청의 약 90%는 100K 미만이었으므로, 대부분의 앱은 저렴한 구간에 머무를 것입니다. 하지만 긴 시스템 프롬프트, 도구 목록(tool lists), 채팅 기록이 당신이 모르는 사이에 이 경계를 넘어설 수 있습니다.
함정 2: 프롬프트가 방금 30% 길어졌나요?
네, 아마도 그럴 겁니다. Haiku 5.5는 더 새로운 토크나이저를 사용합니다. Anthropic의 마이그레이션 가이드에 따르면 동일한 텍스트라도 내용에 따라 Haiku 4.5보다 약 30% 더 많은 토큰을 제공합니다(마이그레이션 가이드).
이미 가지고 있는 프롬프트로 계산해 보세요:
- Haiku 4.5에서의 이전 개수: 80,000 토큰. 안전하며, 경계선 미만입니다.
- Haiku 5.5에서의 새 개수: 약 104,000 토큰. 경계선을 초과했습니다.
프롬프트 자체는 변하지 않았지만, 가격 구간은 바뀌었습니다. 이것이 Anthropic이 평균 절감액을 90%가 아닌 약 75%라고 말하는 이유이기도 합니다.
해결책은 간단합니다. 새로운 모델로 토큰 수를 계산하고, 근접할 때 스스로에게 경고하세요:
import anthropic
client = anthropic.Anthropic() # 환경 변수에서 ANTHROPIC_API_KEY를 읽습니다
PRICE_LINE = 100_000
...
또한 max_tokens 제한을 높이세요. Haiku 4.5에 맞춰 조정된 숫자는 5.5에서도 동일한 답변을 잘라낼 수 있습니다.
함정 3: 헤드라인 점수는 최대 노력(max effort)에서 나온 건가요?
종종 그렇습니다. Haiku 5.5는 low, medium, high, xhigh, max의 다섯 가지 노력 수준을 가지고 있습니다. API 기본값은 medium입니다. 하지만 출시 테이블에 있는 최고의 수치 중 일부는 max에서 나옵니다.
| Result | At max effort | At medium effort |
|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 1277 |
| ... | ||
| Sources: Kingy AI가 시스템 카드에서 가져온 Elo 점수와 VentureBeat이 Terminal-Bench 판독 자료를 제공했습니다. Anthropic의 페이지에는 Terminal-Bench 노력도 차트가 나와 있지만 중간(medium) 수치가 인쇄되어 있지 않으므로, '약 20%'는 차트 판독으로 간주해야 합니다. |
이는 중간 수준이 나쁘다는 의미는 아닙니다. Kingy AI에 따르면 중간 수준은 GDPval-AA에서 최대 노력 대비 약 1/10 수준의 훨씬 적은 출력 토큰을 사용합니다. 이는 점수와 비용 사이의 트레이드오프(tradeoff)이며, 의도적으로 선택해야 합니다.
더 많은 노력이 항상 도움이 될까요?
아닙니다. Cognition의 FrontierCode 결과가 이를 잘 보여줍니다 (Kingy AI):
- GPT-6.1 Sol은 중간 노력에서 50.2%, 최대 노력에서 47.6%를 기록했습니다.
- Claude Sonnet 5.5는 반대로 갔습니다: 최대 노력에서 46.2%, xhigh 노력에서 52.1%를 기록했습니다.
따라서 가장 좋은 설정은 모델과 작업에 따라 다릅니다. 하나를 선택하기 전에 몇 가지 레벨을 테스트해 보세요.
함정 4: 72.4%가 정말 합격 점수일까요?
출시 표에는 Haiku 5.5가 컴퓨터 사용 테스트인 OSWorld 2.1에서 72.4%를 기록한다고 나와 있습니다. 이 수치는 부분 점수(partial credit)입니다. 모델이 최종 결과가 틀렸더라도 일부 단계를 완료하는 것에 대해 점수를 얻습니다.
모든 단계가 정확해야 하는 엄격한 합격률(strict pass rate)은 더 낮습니다. Kingy AI가 읽은 시스템 카드에서 두 가지 모두를 가져왔습니다:
| OSWorld 2.1 오프라인 서브셋 | 부분 점수 (Partial score) | 엄격 합격 (Strict pass) |
|---|---|
| Sonnet 5.5 | 83.9% | 48.8% |
| ... |
Source: Kingy AI 및 Kingy AI의 비교 페이지 모두 Anthropic의 시스템 카드를 판독한 자료입니다.
좋은 소식은 Haiku가 엄격 점수에서 Luna를 여전히 큰 폭으로 앞서며, 17.1% 대 37.1%로 기록했다는 것입니다. 우위는 실재하지만, 헤드라인보다 작아 보일 뿐입니다. 파일을 편집하거나 양식을 작성하는 에이전트의 경우, 엄격한 수치가 중요합니다. 왜냐하면 반쯤 완성된 작업이라도 여전히 사람이 고쳐야 하기 때문입니다.

Haiku가 실제로 얼마의 비용을 발생시키는지 어떻게 확인할까요?
가격 목록을 비교하는 것을 멈추세요. **수락된 결과당 비용(cost per accepted result)**을 비교하세요. 이는 모든 시도의 총비용을 실제로 보존한 답변 수로 나눈 값입니다.
두 모델 모두의 실제 가격 구간을 따르는 작은 계산기가 여기 있습니다:
# USD per 1M tokens, uncached input and output
RATES = {
# name: (cheap band limit, cheap input, cheap output, full input, full output)
...
제가 이것을 실행해 보니 숫자가 게시물 상단의 표와 일치합니다. 캐시 가격과 사고(thinking) 토큰은 무시하므로, 사용한다면 이들을 추가하세요.
이제 후반부입니다. 아이디어를 보여주기 위한 가상의 예시입니다:
- 저렴한 호출 비용이 $0.001이지만 답변 중 40%만 좋습니다. 수락된 답변당 비용: $0.0025.
- 더 비싼 호출 비용이 $0.002이고 답변의 90%가 좋습니다. 수락된 답변당 비용: 약 $0.0022.
'비싼' 모델이 이겼습니다. 이 숫자들은 꾸며낸 것이니, 본인만의 것을 사용하세요. 모델, 노력(effort), 토큰 개수, 그리고 답변을 수락했는지 여부를 기록한 다음 나누기 계산을 하세요.
Haiku 5.5는 어디서 빛날까요?
Anthropic은 짧고 반복적인 작업에 주목하며, Opus 5.5 또는 Sonnet 5.5의 하위 에이전트(subagent)로서 Haiku를 추천합니다. 또한 더 큰 모델들이 여전히 어려운 에이전트 코딩에는 더 나은 선택이라고 말합니다.
간단한 패턴은 계획을 세우는 큰 모델, 조각들을 수행하는 작은 워커들, 그리고 마지막에 확인하는 것입니다:
출시 페이지의 고객 노트 몇 가지. 이들은 Anthropic이 공유한 회사 보고서이므로 힌트로 간주하세요:
- Cognition은 Opus 5.5가 주도하고 Devin Fusion에서 Haiku 5.5를 도우미로 사용했습니다. 비용과 지연 시간을 줄이는 동시에 FrontierCode 점수 66.2를 기록했습니다.
- AlphaSense는 400개의 쿼리를 테스트하여 Haiku 4.5 대비 0.84점을 얻었고, 이는 0.76점입니다.
- Box는 Haiku 4.5보다 약 절반의 지연 시간으로 11점 향상을 보였습니다.
모범 사례
- 예산을 설정하기 전에 새 모델로 토큰 수를 계산하세요.
- 낮은 노력(low effort) 또는 중간 노력(medium effort)부터 시작하세요. 자체 테스트가 실패할 때만 늘리세요.
- 가능하다면 프롬프트를 100K 토큰 미만으로 유지하세요. 변경되지 않는 부분은 캐시하고, 캐시 읽기는 저렴한 구간에서 백만 토큰당 $0.01이 들기 때문입니다.
- 기다릴 수 있는 작업에는 배치 API(Batch API)를 사용하세요. Kingy AI는 배치 처리에 대해 50% 할인을 보고했습니다.
- 에이전트 작업의 최종 상태를 확인하세요. 파일이 저장되었나요? 필드가 채워졌나요? '완료' 메시지를 신뢰하지 마세요.
- 작은 모델을 계속 재시도하는 대신, 실패한 내용은 더 큰 모델로 전송하세요.
Haiku 4.5에서 이동할 때 무엇이 깨지나요?
여러 오래된 요청 습관들이 400 오류를 반환합니다. 이 목록은 마이그레이션 가이드에서 가져온 것입니다.
| 오래된 습관 | 발생하는 문제 | 해결 방법 |
|---|---|
thinking을 budget_tokens와 함께 활성화하는 경우 | 400 오류 | {"type": "adaptive"}를 사용하고 output_config.effort를 설정하세요.
| temperature, top_p, 또는 top_k 전송 | temperature 1과 top_p 0.99만 허용되며, 모든 top_k는 실패합니다 | 세 가지 모두 제거하세요 |
| messages를 어시스턴트 프리필(assistant prefill)로 끝내는 경우 | thinking을 꺼도 400 오류 발생 | 사용자 턴(user turn)으로 끝내세요 |
| computer_20250124 도구 | Claude API와 Google Cloud에서 400 오류 발생 | computer_toolset_20260801을 사용하세요 |
| 이전 메시지를 변경한 후 thinking 블록을 다시 보내는 경우 | 400 오류 | 대화는 추가만 하세요 (append only) |
| 첫 번째 콘텐츠 블록을 답변으로 읽는 경우 | thinking 블록일 수 있습니다 | type별로 블록을 선택하세요 |
Priority Tier 또한 Haiku 5.5에서 지원되지 않습니다. Claude Code에서는 가이드에 /claude-api migrate가 편집에 도움이 될 것이라고 나와 있습니다.
성능 고려 사항
Anthropic은 Haiku 5.5를 표준 속도에서 가장 빠른 모델이라고 부르지만, 한 가지 예외가 있습니다: Opus는 Fast Mode에서 더 빠릅니다. VentureBeat은 Anthropic이 출시 시점에 토큰/초(tokens per second) 수치를 공개하지 않았다고 언급했습니다. 따라서 평균값뿐만 아니라 자체 트래픽으로 측정하고 느린 끝단(p95)을 확인하세요.
비교: Haiku 5.5, Luna, 또는 Sonnet?
| Haiku 5.5 | GPT-6 Luna | Sonnet 5.5 | |
|---|---|---|---|
| Input / output per 1M tokens | $0.10 / $0.50 up to 100K | $0.10 / $0.50 up to 272K | $2.00 / $10.00 |
| ... | |||
| Sources: Anthropic과 Kingy AI. 이 수치들은 공급업체(vendor)가 보고한 것이므로, 어떤 것을 전환하기 전에 반드시 직접 테스트를 실행하세요. |
FAQ
Claude Haiku 5.5가 GPT-6 Luna보다 저렴한가요?
항상 그런 것은 아닙니다. 리스트 가격은 최대 100K 토큰까지 동일합니다. 100K에서 272K 입력 토큰 사이에서는 Luna가 더 저렴하며, 위 150K 예시에서 Haiku는 다섯 배 더 비쌉니다.
Anthropic이 90%가 아니라 75%라고 말하는 이유는 무엇인가요?
90% 감소는 최대 100K 토큰의 프롬프트에만 적용됩니다. 새로운 토크나이저는 약 30% 더 많은 토큰을 생성하며, 일부 요청은 그 선을 넘습니다. Anthropic은 평균치를 약 75%로 제시합니다.
어떤 노력 수준(effort level)을 사용해야 하나요?
낮음(low) 또는 중간(medium)부터 시작하여 테스트해 보세요. 기본값은 중간입니다. 더 높은 수준은 더 많은 토큰 비용이 들고 항상 더 나은 결과를 제공하지는 않습니다.
Sonnet 5.5를 Haiku 5.5로 대체해야 하나요?
좁은 작업(narrow tasks)에 대해서만 확인할 수 있습니다. 어려운 에이전트 코딩(agentic coding)의 경우, Anthropic 자체에서도 Sonnet 5.5와 Opus 5.5가 더 나은 선택이라고 말합니다.
모델 ID는 무엇인가요?
Claude API에서는 claude-haiku-5-5이며,
Amazon Bedrock에서는 anthropic.claude-haiku-5-5입니다.
결론
Haiku 5.5는 강력한 소형 모델(small model)이며, Haiku 4.5에서의 도약은 엄청납니다. 하지만 리스트 가격은 이야기의 시작일 뿐입니다.
다음 네 가지 함정을 기억하세요:
- 100K 토큰을 넘어서면 가격이 다섯 배로 곱해지고 전체 요청에 대해 재가격 책정됩니다.
- 새로운 토크나이저는 기존 프롬프트를 그 선 너머로 밀어낼 수 있습니다.
- 헤드라인 점수(Headline scores)는 종종 최대 노력(max effort)에서 나오며, 기본값은 중간입니다.
- 부분적인 기여도(Partial credit)가 완성된 작업과 같지는 않습니다.
다음 단계는 간단합니다. 하나의 작업을 선택하고, 몇백 개의 실제 예시를 가지고 낮은 노력 수준과 중간 노력 수준으로 실행하여 수락된 결과당 비용을 계산하세요. 그런 다음 그 숫자를 현재 사용 중인 모델의 수치와 비교해 보세요.
참고 자료
토론

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기