Claude Haiku 5.5, Haiku 4.5 대비 비용 75% 절감
요약
Anthropic이 Claude Haiku 5.5를 출시하며 이전 모델 대비 평균 비용을 75% 절감하고 가장 빠른 소형 모델로 만들었습니다. 이와 함께 Sonnet 5.5의 캐시 읽기 비용이 절반으로 줄고, 모든 라인업에 '설정 가능한 노력(configurable effort)' 기능이 추가되어 유연성이 높아졌습니다.
핵심 포인트
- Claude Haiku 5.5가 출시되어 이전 모델 대비 평균 비용을 75% 절감했습니다.
- Haiku 5.5는 속도와 경제성에 최적화된 소형 모델입니다.
- 모든 Claude 라인업에 '설정 가능한 노력' 기능이 추가되었습니다.
- Sonnet 5.5의 캐시 읽기 비용이 절반으로 인하되어 에이전트 작업 비용이 감소했습니다.
Anthropic이 가장 작은 모델의 가격을 평균적으로 75% 인하하는 동시에, 2026년 10월까지 회사에서 제공하는 가장 빠른 모델로 만들었습니다. Claude Haiku 5.5는 지난 10월 7일에 Haiku 4.5를 직접 대체하며 출시되었으며, 추가적인 장점도 있습니다. 바로 Haiku 라인업의 모델이 처음으로 각 작업에 사용되는 추론(reasoning) 노력 수준을 조정할 수 있게 되었다는 점입니다.
이번 출시는 다른 두 가지 가격 변경과 함께 이루어졌습니다. Claude Sonnet 5.5의 캐시 읽기 비용은 이제 절반이 되었으며, Claude Max 및 Team 구독자는 Claude Platform 위에서 에이전트를 구축하기 위한 새로운 월별 크레딧을 받게 됩니다.
요약 (TL;DR)
- Anthropic은 2026년 10월 7일에 Haiku 4.5 대비 평균 비용이 75% 낮은 Claude Haiku 5.5를 출시했습니다.
- 새 모델은 Opus 및 Sonnet에서만 가능했던 구성 가능한 노력(effort) 조정 기능(Low부터 Max까지)을 추가했습니다.
- Sonnet 5.5의 캐시 읽기 비용이 절반으로 줄어들어, 에이전트 작업 비용이 약 20% 감소했습니다.
- Haiku 5.5는 컴퓨터 사용 벤치마크에서 Haiku 4.5의 15.7% 대비 72.4%를 기록했습니다.
- Claude Max 및 Team은 플랫폼 위에서 새로운 에이전트를 구축하기 위한 월별 API 크레딧을 받게 됩니다.
Claude Haiku 5.5란 무엇인가요
Claude Haiku 5.5는 Anthropic의 Claude 5.5 제품군 중 가장 작고 경제적인 모델로, 요약, 분류, 데이터베이스 질의와 같은 대규모 작업에 적합하도록 설계되었습니다. 또한 Opus 5.5 및 Sonnet 5.5와 함께 코드 서브 에이전트(subagent) 역할도 수행합니다.
Anthropic 공식 발표에 따르면, 이 모델은 실시간 고객 지원이나 브라우저 사용과 같이 속도가 중요한 작업에 최적화되어 있으며, 현재까지 회사가 공개한 가장 빠른 모델입니다.
Anthropic은 2026년 10월 7일 기준으로 Haiku 5.5를 카탈로그에서 가장 빠르고 저렴한 모델로 발표했습니다.
무슨 일이 있었나요
2026년 10월 7일, Anthropic은 Haiku 4.5의 후속 모델로 Claude Haiku 5.5를 발표했습니다. 이 회사는 이를 '지금까지 출시한 모델 중 가장 저렴하고, 빠르며, 유능한 소형 모델'이라고 설명하며 출시 페이지에서 공개했습니다. 이 모델은 이미 Claude Platform에서 이용 가능하며, 이전 모델 대비 평균 비용이 75% 낮습니다.
모델과 함께 Anthropic은 두 가지 추가 가격 변경 사항을 발표했습니다. 첫째, Claude Sonnet 5.5의 캐시 읽기(cache reading) 비용이 절반으로 인하되어, 대부분의 에이전트 작업에서 해당 모델의 비용이 약 20% 더 저렴해졌습니다. 둘째, Claude Max 및 Team 구독자는 플랫폼 위에서 자체 에이전트와 애플리케이션을 구축할 수 있도록 설계된 새로운 월별 API 크레딧을 받게 됩니다.
또한 Haiku 5.5는 이전에 대형 모델 전용이었던 '설정 가능한 노력(configurable effort)'이라는 새로운 기능을 통합했습니다. 사용자는 비용과 각 답변의 정확도 중 어느 것을 우선할지에 따라 Low, Med, High, Xhigh, Max 수준 중에서 선택할 수 있으며, 이는 이미 Opus 5.5와 Sonnet 5.5가 사용하는 논리와 동일합니다.
배경 및 역사
Haiku 라인은 Claude 제품군에서 첫 버전부터 가장 작은 모델이었습니다. Opus는 심층 추론(deep reasoning)에 초점을 맞추고, Sonnet은 비용과 성능 사이의 균형을 찾으려 하는 반면, Haiku는 항상 저렴한 가격으로 높은 볼륨(volume) 옵션으로 판매되어 왔습니다: 분당 수천 건의 호출. 이전 모델인 Haiku 4.5도 트래픽이 많은 제품에서 그 역할을 수행했지만, 여러 단계의 추론이나 도구 사용이 필요한 작업에서는 여전히 대형 모델에 크게 미치지 못했습니다.
이러한 성능 향상이 바로 Haiku 5.5로 바뀐 부분입니다. 실제 터미널 환경에서 에이전트 프로그래밍을 측정하는 Terminal-Bench 4.0에서, Haiku 4.5는 0.0%를 기록했습니다. Haiku 5.5는 39.2%에 도달했는데, 이는 여전히 Sonnet 5.5의 70.6%에는 미치지 못하지만, 소형 모델이 코드 조각뿐만 아니라 완전한 작업을 해결할 수 있는 범위에 진입했음을 의미합니다.
시장 상황도 중요합니다. Asana, HubSpot, AlphaSense, Box와 같은 고객들은 Haiku 5.5를 출시 전에 이미 테스트했으며, 그 결과는 Anthropic 자체 발표에 인용되어 있습니다. 이러한 기업 고객을 통한 초기 검증은 Anthropic이 모델을 일반 대중에게 공개하기 전에 측정 가능한 영향을 보여주려는 최근 출시 방식의 일반적인 관행입니다.
Haiku 5.5의 노력(effort) 조정은 이미 Opus 5.5와 Sonnet 5.5가 가지고 있는 Low-Max 스케일을 재사용합니다.
기술 상세: 노력 조정 작동 방식
이번 출시의 핵심 기술 포인트는 모델 자체라기보다는 Claude 5.5 전체 제품군이 공유하는 노력 제어(effort control)입니다. 실제로, 노력 매개변수는 모델이 응답하기 전에 얼마나 많은 내부 추론 토큰을 생성할지 결정합니다: Low 설정에서는 Haiku 5.5가 속도를 우선시하고 적은 사고 토큰을 사용하며; Max 설정에서는 모델이 응답에 더 많은 컴퓨팅 자원을 투자하여 더 큰 모델에 가까운 정확도에 도달하지만, 지연 시간(latency)과 비용을 감수해야 합니다. 또한, 이는 Haiku 라인업에서 이 옵션을 갖춘 최초의 모델입니다: 이전에는 Haiku 4.5나 그 어떤 Haiku 버전도 응답하기 전에 얼마나 추론할지 선택하는 것이 불가능했습니다.
이 메커니즘은 Haiku 5.5가 도구 없이 Humanity's Last Exam에서 45.9%를 기록하고, 같은 벤치마크에서 더 많은 노력을 주었을 때 Sonnet 5.5(56.9%)에 더 가까워지는 이유를 설명합니다: 모델이 Max 설정에서 더 많이 아는 것이 아니라, 응답을 제공하기 전에 자신의 답변을 확인하는 데 더 많은 추론 단계를 할애하기 때문입니다. 비용이 공짜인 것은 아닙니다: Anthropic이 발표한 정확도 대 비용 그래프에 따르면, OSWorld 2.1에서 Low에서 Xhigh로 변경하면 몇 퍼센트 포인트의 정확도를 얻기 위해 작업당 지출액이 여러 배 증가하므로, 높은 수준은 오류가 비싼 작업에 할당하는 것이 좋습니다.
GDPval-AA v2.1은 Artificial Analysis에서 설계했으며, 44가지의 다양한 직업군에서 실제 업무를 수행하는 에이전트를 평가합니다. 이 지표는 모델 간의 격차를 보여주는 또 다른 벤치마크입니다:
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 (참고) | GDPval-AA v2.1 (Elo) |
|---|---|---|---|---|---|
| AA-Briefcase v1.1 (Elo) | 157 | 86 | 141 | 336 | 182 |
| OSWorld 2.1 (오프라인, PC 사용) | 72.4% | 15.7% | 48.9% | 83.9% | |
| Humanity's Last Exam (도구 없음) | 45.9% | 10.2%, 56.9% | |||
| Terminal-Bench 4.0 (코딩 에이전트) | 39.2% | 0.0% | 16.4% | 70.6% |
숫자는 Anthropic에서 발표한 Haiku 5.5 시스템 카드에서 가져온 것입니다. GPT-6 Luna는 외부 참고 자료로 등장하며, Sonnet 5.5는 같은 회사 내의 소형 모델과 중형 모델 간에 얼마나 성능 격차가 있는지 보여주기 위해 포함된 것이지, 동일한 가격으로 경쟁하기 때문은 아닙니다.
flowchart LR
A["입력 작업"] --> B{"노력 수준"}
B -->|"낮음"| C["빠른 응답, 최소 비용"]
...
이 다이어그램은 다음과 같은 아이디어를 요약합니다: 노력(effort)은 모델을 바꾸는 것이 아니라, 답변하기 전에 얼마나 깊게 생각하는지를 바꿉니다.
영향 및 분석
가장 즉각적인 영향은 경제적입니다. 만약 한 기업이 분류나 요약을 위해 Haiku 4.5로 매일 수백만 건의 호출을 처리하고 있었다면, 동일한 양의 작업이 이제는 이전 지출액의 일부 비용으로 가능합니다. AlphaSense는 주당 약 8백만 개의 질의를 처리하는 자사 제품 Ask in Document가 400개 질의 테스트에서 Haiku 5.5를 사용하면서 점수가 0.76점에서 0.84점으로 상승했다고 보고했으며, 이 개선은 통계적으로 유의미하다고 평가했습니다.
한편 Box는 Haiku 4.5보다 11점 높은 점수를 기록하고 지연 시간은 절반으로 줄였으며, 이를 비용 보고서나 재무 요약과 같은 대규모 분석 작업에 활용했습니다. Asana는 AI Teammates 평가 스위트에서 지연 시간이 30% 이상 감소했으며 에이전트 턴당 추론 속도가 최대 2.5배 빨라졌다고 보고했습니다. CRM 시뮬레이션 작업을 통해 소형 모델을 평가하는 HubSpot은 Haiku 5.5가 이 테스트에서 지금까지 본 최고 점수인 세 번의 실행 평균 92.8%를 기록했다고 밝혔습니다.
💭 핵심: Anthropic은 더 많은 지능을 같은 가격에 팔아 Haiku를 개선한 것이 아니라, 거의 동일한 지능을 훨씬 저렴한 가격에 판매했으며, 능력 향상으로 인한 이익은 더 많은 노력을 비용 지불하는 사람에게 남겨두었습니다.
이 수치들이 종합적으로 보여주는 것은 단발적인 도약이라기보다는 전략적 변화입니다. Anthropic은 Claude Haiku 5.5를 이전에는 중간급 모델이 필요했던 작업으로 밀어붙이고 있으며, 이를 위해 대형 모델을 비싸게 만드는 대신 소형 모델의 가격을 낮추고 있습니다. 이는 경쟁사들로 하여금 경계 성능(frontier benchmarks)이 아닌 백만 토큰당 센트 단위에서 마진이 결정되는 경제적인 자체 모델로 대응하도록 압박합니다.
향후 계획
Anthropic은 Haiku 라인의 다음 업데이트 날짜를 공개하지 않았지만, 최근 출시 패턴은 짧은 주기를 시사합니다. Haiku 4.5가 먼저 나왔고, 이제 Haiku 5.5는 노력 조정을 전체 카탈로그로 확장하고 있습니다. 가장 가능성이 높은 것은 Sonnet과 Opus의 차세대 모델들이 Haiku가 다시 업데이트되기 전에 유사한 효율성 개선을 계승할 것이라는 점입니다.
개발자들에게 실질적으로 주목해야 할 변화는 Claude Max 및 Team 구독자의 월별 API 크레딧입니다. 만약 이 크레딧만으로 별도의 비용 지불 없이 실제 에이전트 프로젝트를 실행할 수 있게 된다면, 현재 구독료와 API 비용을 분리하여 지불하는 소규모 팀의 어떤 플랜이 유리한지 계산 방식 자체가 바뀔 것입니다. Anthropic은 발표에서 정확한 크레딧 금액을 공개하지 않았기 때문에, 이 정보는 청구서에 반영될 때 확인해야 할 것입니다.
📖 텔레그램 요약: Ver resumen
직접 테스트해 보세요: Anthropic 콘솔에 접속하여 Haiku 4.5와 Haiku 5.5를 사용하여 동일한 분류 작업을 실행하고, 자체 데이터를 이용해 비용과 지연 시간을 비교해 보세요.
자주 묻는 질문 (FAQ)
Claude Haiku 5.5란 무엇이며 Haiku 4.5와 어떻게 다른가요?
Claude Haiku 5.5는 Anthropic의 최신 소형 모델 버전으로, 2026년 10월 7일 회사에서 발표한 벤치마크에 따르면 Haiku 4.5 대비 평균 비용이 75% 낮고 속도와 정확도가 향상되었습니다.
Haiku 5.5의 노력 조정(effort adjustment)은 어떻게 작동하나요?
노력 조정 기능에서는 Low, Med, High, Xhigh, Max 수준 중 하나를 선택할 수 있습니다. 이 수준이 높을수록 모델은 응답하기 전에 더 많은 내부 추론 토큰을 사용하며, 이는 정확도를 높이는 동시에 작업당 비용과 지연 시간도 증가시킵니다.
Haiku 5.5가 Sonnet 5.5 또는 Opus 5.5를 대체하나요?
아닙니다. Anthropic은 이 모델을 대용량 작업을 위한 서브 에이전트(subagent)로 Opus 5.5 및 Sonnet 5.5와 함께 포지셔닝하며, 가장 깊은 추론이 필요한 작업의 대체재는 아닙니다.
Claude 계열의 경량 모델은 이전 버전에 비해 얼마나 저렴한가요?
Anthropic에 따르면 평균 비용은 Haiku 4.5 대비 75% 낮지만, 최종 절감액은 선택된 노력 수준과 각 작업의 토큰 볼륨에 따라 달라집니다.
Claude Sonnet 5.5의 가격에는 어떤 변화가 있나요?
Sonnet 5.5의 캐시 읽기(cache reading) 비용이 절반으로 줄어들어, 같은 발표에 따르면 대부분의 에이전트 작업에서 해당 모델이 약 20% 더 저렴해졌습니다.
참고 자료 (References)
- Anthropic: Claude Haiku 5.5 소개: 가격, 벤치마크 및 고객 인용문이 포함된 공식 발표.- Anthropic: 공식 가격 페이지: Claude 5.5 제품군에 대한 현재 비용표.- Artificial Analysis: 발표에서 언급된 GDPval-AA v2.1 벤치마크 제작사.- Wikipedia: Anthropic: 회사 및 Claude 모델 제품군에 대한 배경 정보.
📱 이 콘텐츠가 마음에 드시나요? 기술, AI 및 개발 분야에서 가장 관련성 높은 정보를 매일 게시하는 저희 Telegram 채널 @programacion에 참여하세요. 빠르고 간결한 요약, 매일 새로운 콘텐츠를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기