Claude Haiku 5.5 출시: Luna를 능가하는 가성비 모델이 될 수 있을까?
요약
Anthropic이 Claude Haiku 5.5를 출시하며, 이전 세대 대비 최대 90%의 비용 절감과 성능 향상을 동시에 달성했습니다. 특히 에이전트 및 실무 시나리오 벤치마크에서 큰 폭의 점수 상승을 보여주며, 저비용 고효율 모델로서의 입지를 강화했습니다.
핵심 포인트
- Haiku 5.5는 이전 세대 대비 최대 90% 비용 절감을 달성했습니다.
- GDPval-AA v2.1 등 실무 시나리오에서 성능이 크게 향상되었습니다 (예: 2.2배 상승).
- OSWorld 2.1, Terminal-Bench 4.0 등 데스크톱/CLI 자동화 능력이 대폭 개선되었습니다.
- 저비용으로 GPT-6 Luna를 능가하는 실력을 보여주어 활용도가 높아졌습니다.
2026년 10월 7일, Anthropic이 Claude Haiku 5.5를 공식 출시했습니다.
'역사상 가장 저렴하고 빠르며 최고 성능의 소형 모델'이라는 캐치프레이즈는 과장이 아닙니다. 이전 세대인 Haiku 4.5와 비교하여 최대 90%의 비용 절감을 달성하면서도, 벤치마크 상의 성능은 전반적으로 크게 향상되었습니다.
본 기사에서는 공식 정보를 바탕으로 Haiku 5.5가 무엇을 변화시켰는지, 어떤 용도에 적합한지 정리합니다.
먼저 수치로 살펴보겠습니다.
| 항목 | Haiku 5.5 (~100k tokens) | Haiku 5.5 (100k 초과) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 입력 ($/1M tokens) | $0.10 | $0.50 | $1.00 | $2.00 |
| ... |
100,000 토큰 미만의 요청에서는 Haiku 4.5와 비교하여 입력과 출력 모두 90%의 가격 하락을 보입니다.
Anthropic에 따르면, 기존 Haiku 모델에 대한 요청 중 약 90%가 이 카테고리에 해당한다고 하므로, 실용상의 이점은 매우 크다고 할 수 있습니다.
토크나이저 변경에 주의할 점
Haiku 5.5는 Sonnet 5.5 및 Opus 5.5와 동일한 새로운 토크나이저를 채택했습니다.
같은 텍스트라도 토큰 수가 약간 증가하기 때문에, '1토큰당 90% 저렴 = 비용 90% 절감'이라고 단순하게 생각할 수 없는 점에 주의가 필요합니다. 실제 비용 절감 폭은 용도에 따라 다릅니다.
수치만 나열되어 있으면 체감이 어렵기 때문에, 벤치마크별로 무엇이 달라졌는지 깊이 있게 파헤쳐 보겠습니다.
GDPval-AA v2.1은 44가지 직종을 상정한 실무 시나리오에서 에이전트를 평가하는 벤치마크입니다.
Haiku 4.5의 점수가 735였던 것에 비해, Haiku 5.5는 1620으로, 2.2배의 상승률을 보였습니다. AA-Briefcase v1.1에서도 614에서 1578로 2.6배에 달합니다.
GPT-6 Luna는 GDPval-AA v2.1에서 1437점, AA-Briefcase v1.1에서 1336점의 점수를 가지고 있지만, Haiku 5.5는 각각 12.7%와 18.1%를 상회합니다.
'소형 모델로 실무 작업을 수행한다'는 맥락에서는, 비용을 대폭 낮추면서도 GPT-6 Luna를 능가하는 실력을 갖췄음을 의미합니다.
OSWorld 2.1 (오프라인 서브셋)은 실제 PC 환경에서 멀티스텝 작업을 수행하는 능력을 측정하는 벤치마크입니다. Haiku 4.5의 점수는 **15.7%**로, 솔직히 말해 실용성이 부족한 수준이었습니다. 하지만 Haiku 5.5에서는 **72.4%**까지 급등했습니다.
상승률은 4.6배입니다. GPT-6 Luna의 48.9%를 크게 앞지었으며, 상위 모델인 Sonnet 5.5 (83.9%)와의 격차도 11.5 포인트로 줄었습니다. Haiku 클래스의 모델이 브라우저 조작이나 데스크톱 자동화에 사용 가능해진 것은 이번 출시에서 가장 큰 질적 변화 중 하나라고 할 수 있습니다.
Terminal-Bench 4.0은 커맨드라인 환경에서 복잡한 다단계 작업을 수행하는 능력을 평가하는 벤치마크입니다.
Haiku 4.5의 점수는 **0.0%**였습니다. 이것이 Haiku 5.5에서는 39.2%에 도달했습니다.
GPT-6 Luna의 16.4%와 비교하면 2.4배 차이가 나며, 단순한 코딩 보조로는 Haiku 5.5만으로도 충분한 경우가 많아질 것으로 예상됩니다.
FrontierCode 1.1 (Main)에서는 Haiku 5.5가 46.4%를 기록했고 GPT-6 Luna는 42.4%였습니다.
이 경우 역시 Haiku 5.5가 더 높은 점수를 받았습니다. 참고로 Cognition은 Devin Fusion에 Haiku 5.5를 사이드킥으로 결합한 결과, FrontierCode 점수 66.2를 달성했다고 보고했습니다.
Opus 5.5와 같은 상위 모델과의 조합을 통해 비용 효율적인 코딩 파이프라인을 구축할 수 있습니다.
Chartography (도구 없음)에서는 Haiku 4.5가 **6.4%**였던 점수가 Haiku 5.5에서 **46.4%**에 도달했습니다.
상승률은 7.3배로, 이번 벤치마크 비교 중 가장 극적인 향상을 보였습니다. 그래프나 표 읽기, 시각 데이터에 대한 질의응답 등의 용도가 현실적인 선택지가 될 수 있습니다.
| 벤치마크 | Haiku 4.5 | Haiku 5.5 | 배율 |
|---|---|---|---|
| GDPval-AA v2.1 | 735 | 1620 | ×2.2 |
| ... | |||
| 비용 절감뿐만 아니라 성능 면에서도 Haiku 4.5와는 차원이 다른 모델이 되었습니다. |
Haiku 클래스 모델로는 처음으로 **조정 가능한 노력 설정(adjustable effort setting)**이 탑재되었습니다.
Low / Medium / High / Xhigh / Max의 5단계 중에서 선택할 수 있어, 작업별로 비용 우선인지 지능 우선인지를 고를 수 있습니다.
공식 차트를 보면, OSWorld 2.1에서는 노력(effort)을 높일수록 점수가 오르고, 최고 설정(Max)에서는 Sonnet 5.5의 낮은 노력 설정에 필적하는 점수를 얻을 수 있다는 것을 알 수 있습니다.
반면 비용은 노력에 비례하여 증가하므로, 용도에 맞는 선택이 중요합니다.
실제 사용 예시로는 다음과 같습니다.
Low: 대량의 분류/태그 지정, 정형문 요약 등 반복 처리 -
Medium: 일반적인 고객 지원 문의 응대 -
High / Xhigh: 코드 완성, 문서 읽기 및 추출 -
Max: 정확도가 우선되는 복잡한 컴퓨터 작업이나 멀티 스텝 추론
Sonnet 5.5나 Opus 5.5는 이미 노력 설정(effort setting)을 가지고 있었는데, 이번 Haiku 5.5가 여기에 추가되면서 모든 모델에서 비용과 성능을 태스크 단위로 제어할 수 있는 체제가 갖춰졌습니다.
같은 Haiku 5.5를 사용하면서도 처리 내용에 따라 노력을 전환하는 것만으로 지출을 최적화할 수 있습니다.
Anthropic 자체는 이를 '대용량/비용 중시 태스크용'으로 포지셔닝하고 있습니다. 구체적으로는 다음과 같은 용도입니다.
요약/압축(compaction): 긴 대화 기록이나 문서 요약 -
분류/데이터 추출: 대량 레코드에 라벨 지정, 감정 분석 -
서브 에이전트 처리: Opus 5.5나 Sonnet 5.5의 지시를 받아 실제 작업을 수행하는 역할 -
고객 지원 채팅봇: 응답 속도가 중요한 실시간 대응 -
브라우저 사용/컴퓨터 작업: OSWorld 점수가 보여주듯이, 멀티 스텝 UI 작업에도 실용적 -
시각 데이터 읽기: 그래프나 도표에 대한 질의응답(Chartography에서 46.4%)
공식 페이지에는 조기 테스트에 참여한 기업들의 실제 사용 후기가 게재되어 있습니다. 벤치마크 수치뿐만 아니라, 실제 운영에서의 변화가 구체적으로 제시되어 있어 인용합니다.
Asana는 버그 트리아지나 프로젝트 관리 에이전트 태스크로 평가를 진행했습니다.
결과적으로, 태스크 완료까지의 지연 시간(latency)이 30% 이상 감소했으며, 에이전트당 턴 추론 속도는 최대 2.5배 향상되었다고 보고했습니다.
HubSpot은 CRM 태스크(기회 보고서 등) 시뮬레이션 평가에서 Haiku 5.5를 검증했습니다.
해당 회사가 테스트한 소형 모델 중 평균 **92.8%**라는 최고 점수를 기록했다고 합니다.
또한, 오래된 모호한 레코드를 식별하는 태스크에서는 테스트한 모든 모델 중에서 가장 빠른 처리 속도, 최고의 히트율, 최저의 오탐지율을 달성했다고 밝혔습니다.
AlphaSense는 주당 약 800만 건의 API 호출이 발생하는 '문서 내 질의응답' 기능으로 평가를 진행했습니다.
400개 질의 테스트 세트에서 Haiku 4.5가 0.76이었던 점수가 Haiku 5.5에서는 0.84로 개선되어, 통계적으로 유의미한 향상을 확인했습니다.
Box는 대량의 엔터프라이즈 콘텐츠를 대상으로 평가를 실시했으며, Haiku 4.5 대비 11포인트 높은 정확도와 약 절반 수준의 지연 시간을 달성했다고 보고했습니다.
Haiku 5.5 출시와 동시에 몇 가지 주변 업데이트도 발표되었습니다.
Claude Sonnet 5.5의 캐시 로드 비용이 $0.20/1M에서 $0.10/1M으로 인하되었습니다. 캐시 로드는 에이전트 태스크에서 토큰 소비의 큰 비중을 차지하기 때문에, 대부분의 장시간 구동 태스크에서 약 20%의 비용 절감 효과가 있습니다.
이번 주 중 Max 및 Team 플랜의 모든 사용자에게 월별 API 크레딧이 지급될 예정입니다.
- Max 5x:월 $100
- Max 20x:월 $200
- Team:최대 $500 (팀 전체에서 풀링)
Claude Code 등을 사용하여 앱이나 에이전트를 시험 제작하고 싶은 사용자에게는 반가운 추가 기능입니다.
Claude Platform의 Python/TypeScript SDK가 업데이트되어 컴퓨터 사용 및 브라우저 사용에 대한 베타 지원이 추가되었습니다. Haiku 5.5의 속도와 낮은 비용은 이러한 용도에 특히 잘 맞습니다.
Claude Haiku 5.5에서 바뀐 점을 정리합니다.
| 관점 | 변화 |
|---|---|
| 비용 | 100k 미만 요청에서 최대 90% 절감 (토크나이저 변경의 영향은 별도 고려) |
| ... | |
| 참고 링크 |
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기