Haiku 5.5가 10센트의 가격으로 저가형 모델 시장을 재편하다
요약
Anthropic이 Claude Haiku 5.5를 입력 토큰당 $0.10, 출력 토큰당 $0.50의 파격적인 가격으로 출시하며 저가형 모델 시장에 큰 변화를 예고했습니다. 이는 기존 대비 최대 90% 가격 인하로, 개발자들이 API 호출 시 정말 필요한 모델 수준을 재검토하도록 강제합니다.
핵심 포인트
- Haiku 5.5는 입력 토큰당 $0.10의 저가 정책으로 시장에 진입했습니다.
- GPT-5.6 Luna 및 Gemini 3.8 Flash 등 경쟁사 대비 가격 우위를 점합니다.
- 가격 절벽(Pricing Cliff) 현상을 주의해야 하며, 컨텍스트 길이에 따른 비용 변화를 고려해야 합니다.
Anthropic이 Claude Haiku 5.5를 입력 토큰당 백만 개에 $0.10, 출력 토큰당 백만 개에 $0.50로 출시했습니다([https://www.marktechpost.com/2026/10/07/anthropic-releases-claude-haiku-5-5-a-small-model-with-1m-context-priced-at-0-10-per-million-input-tokens/]) — 이는 Haiku 4.5 대비 90% 가격 인하이며, 저가형 모델 전쟁이 새로운 국면에 접어들었음을 의미합니다. 이것은 단순한 점진적 가격 조정이 아닙니다. 1M 컨텍스트 창에 백만 토큰당 10센트라는 가격으로 Haiku 5.5는 GPT-5.6 Luna($0.20 입력)보다 저렴하고, Gemini 3.8 Flash($0.75 프로모션)보다 저렴하며, 프로덕션 워크로드를 운영하는 모든 빌더들이 외면해 왔던 질문에 답하도록 강요합니다: 나의 API 호출 중 실제로 $4 모델이 필요한 것이 무엇인가?

시기적절함이 매우 뛰어납니다. Anthropic은 OpenAI가 DevDay 2026을 개최한 날과 같은 날 Haiku 5.5를 출시했는데, 당시의 주요 테마는 새로운 플래그십 모델이 아니라
그 10만 토큰 경계는 5배의 가격 절벽입니다. 이 선을 넘어서면 입력 비용이 $0.10에서 $0.50으로 급증합니다. 갑자기 Sonnet에 근접한 요금을 내면서도 Sonnet 수준의 기능은 얻지 못하게 됩니다. One deep analysis가 이를 명확히 지적했습니다: '90% 저렴하다'는 헤드라인은 10만 토큰 미만의 프롬프트에만 해당됩니다. 이론적으로 1M 컨텍스트를 가능하게 하는 장문(long-context) 워크로드를 위해서는 실제 할인이 약 50% 수준으로 떨어집니다.

⚠️ 반대 의견: Haiku 5.5의 헤드라인 절감액은 짧은 프롬프트에 한해서는 사실입니다. 하지만 10만 토큰 경계가 있다는 것은 대용량 문서를 컨텍스트에 넣는 개발자(RAG 파이프라인, 코드 검토, 장문 대화 등)는 매우 다른 가격대에 도달한다는 의미입니다. 마이그레이션 전에 프롬프트 길이 분포를 확인하세요.
또한 토크나이저(tokenizer) 요인도 있습니다. Haiku 5.5는 Opus 4.7+ 제품군과 동일한 토크나이저를 사용하며, 이는 이전 토크나이저에 비해 같은 텍스트에 대해 약 1배~1.35배 더 많은 토큰을 생성합니다. 분석 결과, 실제 절감액은 무거운 토큰화(tokenization)를 고려할 때 75%에 가깝습니다. 여전히 극적이지만, 스티커 가격이 제시하는 90%는 아닙니다.
경쟁 환경: 누가 저가 공세를 펼쳤나
$0.10이 왜 중요한지 이해하려면, 2026년 10월 기준의 저가형(cheap-tier) 가격표를 살펴보세요:
| Model | Input $/MTok | Output $/MTok | Context | Notes |
|---|---|---|---|---|
| Claude Haiku 5.5 | $0.10 | $0.50 | 1M | Up to 100K; 5x above |
| ... | ||||
| Haiku 5.5는 입력 비용에서 Luna보다 50% 저렴하고, 출력 비용에서는 58% 저렴하다. 효과적인 입력 비용 면에서는 DeepSeek V4.1 Flash와 동등하며, 출력 비용은 더 적게 든다. 가장 저렴한 모델은 $0.10/$0.40인 Gemini 2.5 Flash-Lite이지만, 이는 Haiku 5.5가 가져오는 성능 도약(capability jump)이 없는 이전 세대 모델이다. |
Technology.org가 출시 당일에 보도했듯이, Haiku 5.5는 단순히 저렴한 것을 넘어선다. 초기 테스트 결과, 얼마 전까지만 해도 플래그십(flagship)-급으로 여겨졌던 수준의 성능을 보여준다. Bijan Bowen은 이 모델을 브라우저 OS 빌드, 게임 제작, FPS 벤치마크에 적용하며
YouTube에서는 같은 날의 보도가 채널 전반에 걸쳐 집중되었습니다. Chase AI는 'OpenAI 종말'이라는 논조로 경쟁 구도를 포착했지만, 실제 현실은 헤드라인보다 더 미묘합니다. WorldofAI는 이를 '게임 체인저'라 부르며 '90% 저렴하고 성능이 엄청나다'고 평가했습니다.
💡 캐시 계산법: Haiku 5.5의 캐시 읽기 비용은 MToken당 $0.01입니다. 이는 표준 입력 비용보다 100배 저렴합니다. 시스템 프롬프트와 도구 정의가 턴(turn) 전반에 걸쳐 안정적인 에이전트 루프(agentic loops)의 경우, 캐시 적중률(cache hit rate)은 90%를 초과할 수 있습니다. 이로 인해 실제 입력 비용은 백만 토큰당 한 자릿수 센트로 떨어집니다. 이것이 라우팅 결정을 내릴 때 고려해야 할 핵심 지표입니다.
빌더의 결정: $0.10으로 낮춰야 할 경우
모든 워크로드(workload)를 Haiku 5.5로 이전할 필요는 없습니다. 다음은 의사결정 프레임워크입니다.
다음과 같은 경우 Haiku 5.5로 라우팅하세요:
분류, 추출 및 구조화된 출력. 문서에서 구조화된 데이터를 가져오거나, 고객 지원 티켓을 라우팅하거나, 콘텐츠를 분류하는 경우 — Haiku 5.5가 명백한 선택지입니다. 이러한 작업은 정의된 출력이 있고 모호성이 낮으며, 깊이보다는 속도에 이점을 얻습니다. MToken당 $0.10으로 1,000만 건의 분류 호출을 실행하는 데 비용은 $1입니다.
에이전트 내부 루프. 에이전트 워크플로우에서 반복되는 도구 호출 사이클 — 어떤 도구를 호출할지 결정하고, 도구 출력을 파싱하며, 다음 단계를 결정하는 과정 — 은 최첨단 추론(frontier reasoning)을 필요로 하지 않습니다. 이 루프를 Haiku 5.5로 라우팅하고, 비싼 모델은 최종 합성 단계에 남겨두세요. 이는 Sonnet 5.5가 이미 도입했던 중급 티어 패턴이며, Haiku 5.5는 이를 한 단계 더 저렴하게 끌어내립니다.
대량의, 낮은 중요도의 생성. 제품 설명, 이메일 초안, 댓글 답글, 알림 텍스트 — 평범한 결과물의 비용이 낮고 볼륨(volume)이 높은 모든 곳입니다. $0.10에서는 볼륨 자체가 더 이상 비용 제약이 아닙니다.
사전 필터링 및 분류(Pre-filtering and triage). Haiku 5.5를 저렴한 첫 번째 통과 모델로 사용하세요. 이 문서가 관련성이 있는가? 이 코드는 명백한 오류가 있는가? 이 질의는 더 유능한 모델로 에스컬레이션되어야 하는가? Haiku 5.5를 게이트키퍼(gatekeeper)로 사용하는 2단계 아키텍처는 총 API 지출을 60~80% 절감할 수 있습니다.
비싼 모델을 유지해야 할 경우:
복잡한 추론 체인(Complex reasoning chains). 다단계 수학, 법률 분석, 미묘한 코드 아키텍처 결정 등은 Opus와 Sonnet이 제공하는 더 깊은 추론 능력이 필요합니다. Haiku 5.5는 낮은 수준부터 최대 수준까지 적응형 사고 및 노력 수준을 가지고 있지만, 그 추론 한계(reasoning ceiling)가 더 낮습니다. 잘못된 답변의 비용은 보통 토큰 절감액을 초과합니다.
긴 컨텍스트 합성(Long-context synthesis). 100K 클리프를 기억하세요. 작업량이 정기적으로 100K 토큰을 초과하는 경우—대규모 코드베이스, 다중 문서 분석, 확장된 대화—$0.50/MTok 입력에 도달하며 경제성이 변화합니다. 이 지점에서는 더 높은 역량 한계를 가진 Sonnet 5.5 at $2.00/MTok가 완료된 작업당 비용(cost-per-completed-task) 측면에서 더 나은 결과를 제공할 수 있습니다.
사용자 대상 창의적 작업(User-facing creative work). 블로그 게시물, 마케팅 카피 등 품질이 비즈니스 결과에 직접적인 영향을 미치는 모든 경우.
- Opus 5.5 (9월 22일) 가격 $4/$20 — Opus 5의 $5/$25 대비 인하된 가격
- Sonnet 5.5 (9월 28일) 가격 $2/$10 — Sonnet 5와 동일하지만, 벤치마크에서 Opus를 능가함
- Haiku 5.5 (10월 7일) 가격 $0.10/$0.50 — Haiku 4.5의 $1/$5 대비 90% 인하
이 패턴은 상위 모델부터 하위 모델로 의도적인 잠식(cannibalization)이다. 새로운 모델들은 그보다 높은 등급의 모델보다 성능 면에서 가격을 낮추어, 개발자들이 과도하게 지불하고 있는지 재고하도록 강요한다. Anthropic은 사용자가 OpenAI의 GPT-5.6 Luna를 $0.20에 사용하는 것보다 자사 플랫폼에서 Haiku 5.5를 $0.10에 사용하기를 바랄 것이다.

이는 우리가 GPT-5.6 가격 인하 시 분석했던 내용과 정확히 일치한다: 표면적인 가격 비교는 오해의 소지가 있다. 중요한 것은 실제 워크로드 분포에 따른 작업 완료당 비용(cost-per-completed-task)이다. 그리고 이 지표에서, DeepSeek의 공격적인 가격 책정조차 시장 점유율로 이어지지 않았다 — 생태계(ecosystem), 신뢰성(reliability), 도구 통합(tool integration)이 토큰 요금만큼이나 중요하다.

아무도 이길 수 없는 가격 전쟁
저가형 모델 전쟁에 대한 불편한 진실은 이것이다: 오직 가격만으로는 아무도 승리할 수 없다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기