Claude Haiku 5.5 성능 테스트 결과
요약
본 기사는 Claude Haiku 5.5의 성능 테스트 결과를 다루며, OSWorld 2.1, GDPval-AA v2.1 등 여러 기준점에서의 점수를 비교합니다. 특히 Haiku 4.5 대비 크게 향상된 수치를 보여주지만, 독립적인 실험실 테스트 결과는 아직 공개되지 않았습니다.
핵심 포인트
- Haiku 5.5는 이전 버전(Haiku 4.5) 대비 전반적으로 성능이 크게 개선되었습니다.
- GDPval-AA v2.1에서 Haiku 5.5는 1620점을 기록하며 높은 점수를 받았습니다.
- 테스트 결과는 최대 노력(max effort)을 기준으로 하며, 기본값 사용 시 일부 항목은 점수가 감소합니다.
- Anthropic이 자체적으로 테스트를 수행했으며, GPT-6 Luna 등 다른 모델과의 비교도 포함됩니다.
Claude Haiku 5.5는 OSWorld 2.1에서 72.4%의 점수, GDPval-AA v2.1에서 1620점, FrontierCode 1.1에서 46.4%, Terminal-Bench 4.0에서 39.2%의 점수를 받았습니다. Haiku 4.5는 위 네 가지 항목에서 각각 15.7%, 735점, 그리고 0.0%의 점수를 받았습니다. 이 모든 수치는 최대 노력(max)을 기준으로 얻은 것이며, 기본값인 medium 노력을 사용할 경우 GDPval-AA는 1277점으로 감소합니다. Haiku 5.5에 대한 독립적인 실험실에서 공개된 테스트 결과는 없습니다.
이 글은 Claude Haiku 5.5의 모든 기준점, 테스트를 수행한 주체, 노력 수준에 따른 점수 차이 및 비용, 그리고 Apidog에서 실제 트래픽으로 모델을 테스트하는 방법까지 요약합니다. 사양 및 가격 정보는 Claude Haiku 5.5란 무엇인가에서 시작할 수 있습니다.
출시 테이블
Haiku 5.5의 모든 항목은 최대 노력(max)을 사용한 적응형 사고(adaptive thinking)를 사용하며, 일반적으로 다섯 번 시도한 평균값으로 계산됩니다. Terminal-Bench는 작업당 열 번을 사용합니다. n/r은 결과가 공개되지 않았음을 의미합니다.
| 기준점 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| ... |
각 기준점을 수행한 주체
Anthropic이 대부분의 테스트를 자체적으로 수행했습니다. 공급업체 간에 가로줄은 동일한 기준점 이름을 사용하지만, 항상 같은 테스트 세트나 노력 설정을 사용하는 것을 의미하지는 않습니다.
| 기준 | 수행자 | 조건 |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, 독립적 | GDPval-AA: 220 작업, 44 직업, DeepSeek V4.1 Flash (최고) 기반 Elo 1600; Briefcase: 수주 프로젝트 |
| ... |
GPT-6 Luna 셀 두 개는 추가 컨텍스트가 필요합니다: Anthropic은 OpenAI API를 통해 Luna의 OSWorld 점수를 동일한 82개 작업으로 실행했습니다. 또한, Luna의 Terminal-Bench 점수 16.4%는 최대 노력(maximum effort)을 사용한 공개 리더보드에서 나온 것입니다.
Terminal-Bench에서는 Haiku 5.5가 테스트 중단되는 현상이 1.8% 또는 660회 중 12회 발생했으며, 매번 실패로 계산되었습니다.
FrontierCode 함정
출시 표는 Haiku 5.5를 최고 수준에서 46.4%, Sonnet 5.5를 xhigh 수준에서 52.1%로 보여주며, 이는 Sonnet의 최고 점수입니다. 하지만 system card는 다음과 같은 비교 수치를 제공합니다:
| FrontierCode 1.1 | 기본 | 확장 |
|---|---|---|
| Haiku 5.5, 최고 | 46.4% | 58.4% |
| ... | ||
| 최대 노력에서 Haiku 5.5는 Main 세트에서 Sonnet 5.5보다 약간 우위에 있습니다: 46.4% 대 46.2%. 그러나 각 모델의 최고 설정을 비교했을 때 Sonnet이 5.7점 앞서고 있습니다. |
테스트 결과를 언급할 때는 항상 노력 수준을 명시해야 합니다. 왜냐하면 결과가 이 설정에 따라 유의미하게 변하기 때문입니다.
시스템 카드 추가 정보
시스템 카드는 출시 시점에 게시되지 않은 항목들을 포함합니다. 아래 모든 결과는 달리 명시되지 않는 한 최대 노력을 사용했습니다.
| 기준 | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 | |
| --- | --- | --- | --- |
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| ... |
OSWorld 점수 72.4%는 부분 점수(partial credit)이며, 전체 작업 중 단지 37.1%만 통과했습니다.
Chartography는 도구를 사용했을 때 거의 두 배 증가했습니다: 46.4%에서 86.2%로. 따라서 귀하의 작업이 차트와 관련되어 있다면 Haiku 5.5가 필요한 도구에 접근할 수 있도록 해야 합니다.
낮은 기본 노력 점수
Haiku 5.5는 Claude API 및 Claude Code에서 medium 기본값을 가집니다. 시스템 카드는 다음 기본값 수준에서의 결과를 보고했습니다:
| 기준 | 중간 (기본값) | 최대 | 참고 |
| :--- | :--- | :--- |
| GDPval-AA v2.1 | 1277 | 1620 | 중간 레벨은 최고 레벨 출력 토큰의 약 1/10을 사용합니다 |
| ... |
output_config.effort를 전송하지 않고 API를 호출하면 중간 열과 유사한 결과를 얻게 됩니다 노력(Effort) 문서. 다섯 가지 레벨을 모두 포함합니다.
노력 수준별 점수 및 비용
출시 차트의 데이터는 점수 (비용)으로 표시됩니다. OSWorld와 Terminal-Bench의 비용은 시도당, GDPval-AA는 작업당 계산됩니다.
| 모델 / 기준 |
| :--- | :---: | :---: | :---: | :---: |
| OSWorld 2.1 | | | | | |
| ... |
관찰된 모델 및 노력 수준 선택에 대한 사항:
- 최고 레벨은 마지막 결과물에 비싸다: GDPval-AA에서 최고 레벨의 비용은 중간 레벨의 약 28배입니다. OSWorld에서 343 Elo 포인트를 높이는 데 최고 레벨을 사용하면 4.8점을 올리는 것보다 두 배 이상의 비용이 듭니다.
- OSWorld에서 중간 레벨의 Haiku 5.5가 최고 레벨의 Luna를 능가: $0.13에 53.3%를 기록한 Haiku 5.5가 $0.21에 48.9%를 기록한 Luna를 능가했습니다. 하지만 Luna는 다른 유사 레벨에서 더 저렴하며, 두 모델 모두 중간 레벨에서는 비용이 비슷합니다. Haiku 5.5 대 GPT-6 Luna 비교
- OSWorld에서 최고 레벨의 Haiku 5.5가 중간 레벨의 Sonnet 5.5를 능가: $0.61에 72.4%를 기록한 Haiku 5.5가 $0.93에 66.0%를 기록한 Sonnet 5.5를 능가했습니다.
- Terminal-Bench는 예외: 낮은 노력 수준의 Sonnet 5.5 (43.0%, $1.46)가 최고 노력 수준의 Haiku 5.5 (39.2%, $2.64)보다 적은 비용으로 더 나은 성능을 보였습니다. Sonnet의 비용은 $0.10의 캐시 재읽기 가격을 사용했습니다.
비용은 다음 목록 가격을 기준으로 합니다: 최대 100K 토큰 프롬프트에 대해 $0.10/$0.50이며, 프롬프트가 길어질수록 가격이 높아집니다. 가격 세부 정보
Haiku 5.5가 아직 뒤처지는 부분
Sonnet 5.5는 표에 제시된 모든 항목에서 Haiku를 능가하며, 두 모델이 최대 노력(maximum effort)으로 실행되었을 때 FrontierCode 비교에서만 대등합니다.
가장 큰 격차를 보이는 것은 Terminal-Bench 4.0입니다:
- Haiku 5.5: 39.2%
- Sonnet 5.5: 70.6%
SWE-Bench Pro의 경우 64.8% 대 81.3%, SWE-bench Multimodal은 30.7% 대 54.3%로 동일한 패턴을 보입니다.
Anthropic에 따르면, Sonnet 5.5와 Opus 5.5는 “여전히 복잡한 코딩 작업에 더 나은 선택지”이며, Haiku 5.5는 축소(summarization), 요약(abstracting), 분류(categorizing), 브라우저 사용 및 대형 모델 하에서 subagent로 작동하는 등 범위가 좁은 작업에 적합합니다.
Haiku 5.5를 저렴한 subagent 방식으로 실행하는 방법은 Claude Code의 Haiku 5.5를 참고하세요.
독립적인 결과: 아직 없음
2026년 10월 8일 현재, Haiku 5.5의 테스트 결과를 공개한 독립적인 실험실은 없습니다. Artificial Analysis의 Haiku 5.5 페이지는 오류 404를 표시하며, 그들의 리더보드에는 Claude 4.5 Haiku만 명시되어 있습니다.
Vals, LMArena, SWE-bench 및 Aider 역시 결과를 보여주지 않았으며, 제3자로부터의 속도 수치 또한 없습니다. Anthropic은 Haiku 5.5를 표준 속도(standard speed)에서 “현재 가장 빠른 모델”이라고 언급했지만, Fast 모드에서는 Opus보다 느립니다.
가장 근접한 외부 수치는 Cursor에서 나왔습니다. 모델 문서에 따르면 Haiku 5.5는 최대 노력으로 “CursorBench에서 48.4%의 점수”를 기록했으며, 이는 낮은 수준에서의 30.9%보다 증가한 수치입니다.
사고(thinking) 기능을 비활성화(thinking off)했을 때 Cursor는 22.1%에서 26.2% 사이의 점수를 보고했고, 동일한 노력 수준에서 사고 기능 활성화(thinking on) 시에는 30.9%에서 42.3% 사이의 점수를 기록했습니다.
고객이 보고한 내용
다음 정보는 Anthropic의 출시 게시물에서 가져온 것이며 독립적으로 확인된 내용은 아닙니다.
- HubSpot: 가상 CRM 포털 세트에서 3회 실행한 평균 점수로, 해당 세트에서 기록된 최고 점수입니다.
- AlphaSense: 400개의 “문서 내 질문(Ask in Document)”에 대해 Haiku 4.5가 0.76을 기록한 것에 비해 0.84를 기록했으며, 이는 통계적으로 유의미합니다.
- Box: 초기 테스트에서 Haiku 4.5보다 11점 높고 지연 시간은 약 절반 수준입니다.
- Asana: 현재 모델 대비 완료 작업에 필요한 지연 시간이 30% 이상 감소했습니다.
- Cognition: Devin Fusion은 Haiku 5.5를 보조 모델로, Opus 5.5를 주도 모델로 사용하여 FrontierCode에서 66.2점을 기록했습니다. 이는 Haiku 단독 시스템이 아닌 두 개의 모델로 구성된 시스템입니다.
직접 평가 수행하기
벤치마크 기준이 귀하의 트래픽과 일치하지 않을 수 있습니다 Anthropic의 가이드에 따르면, xhigh 또는 max는 평가 결과가 이점을 보여줄 때만 사용하고, 동일한 평가를 Sonnet 5.5에서도 실행하여 비교할 것을 권장합니다.
다음 단계를 Apidog에서 수행하세요:
ANTHROPIC_API_KEY를 환경 변수로 설정하고, 실제 프롬프트 20개에서 50개를 Messages 요청으로 저장합니다.- 최소한 다음을 확인합니다:
- HTTP 상태가
200인지 stop_reason이 `
- HTTP 상태가
자주 묻는 질문 (FAQ)
-
Claude Haiku 5.5가 Sonnet 5.5보다 나은가요?
Anthropic의 수치만 놓고 보면 Sonnet 5.5가 출시 테이블의 모든 항목에서 앞서지만, 두 모델을 최고 수준(highest level)으로 실행했을 때 Haiku가 약간 더 우수합니다: FrontierCode에서 46.4% 대 46.2%. 자세한 업그레이드 관점은 Haiku 5.5 대 Haiku 4.5를 참조하세요.
-
Haiku 5.5의 SWE-bench 점수는 얼마인가요?
SWE-Bench Pro에서 64.8점, SWE-bench Multilingual에서 83.7점, 그리고 SWE-bench Multimodal에서 30.7점을 기록했습니다. 모두 최고 수준(highest effort) 기준입니다.
-
벤치마크는 어느 정도의 노력 수준으로 실행되었나요?
최고 수준이며, 일반적으로 다섯 번의 시도에 대한 평균값입니다. API의 기본 설정은 중간 수준(medium level)이며, 이 경우 GDPval-AA는 1277점을 기록했습니다 (원래 1620점 대비).
-
Haiku 5.5의 독립적인 벤치마크가 있나요?
아직 Artificial Analysis에서 GDPval-AA와 AA-Briefcase를 독립적으로 실행한 기록은 없습니다. 하지만 Anthropic이 해당 점수를 발표했으며, AA에는 Haiku 5.5 페이지가 아직 없습니다.
-
GPT-6 Luna보다 저렴한가요?
일반적으로 Luna는 GDPval-AA의 모든 노력 수준과 OSWorld의 모든 레벨에서 비용이 더 적게 들지만, 두 모델 모두 중간 수준에서는 비용 차이가 거의 없습니다. 하지만 Haiku 5.5가 두 벤치마크 모두에서 더 높은 점수를 기록했습니다.
다음 단계 (Next Steps)
'medium' 수준에서 시작하고, 성능 향상률이 비용 대비 가치가 있을 때만 노력 수준을 높이는 것을 권장합니다.
Apidog에서 다운로드하여 위 단계를 기반으로 평가 세트를 생성하고, 새로운 트래픽을 프로덕션 모델로 전환하기 전에 Sonnet 5.5 기준선과 비교하기 위해 [Apidog]에 결과를 저장하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기