판단 특화 AI 'Clef'와 Haiku 5.5의 분류 비교: 306문제 중 Clef가 자신감을 보인 13%는 95% 적중
요약
본 기사는 판단 특화 AI 모델인 Clef와 Claude Haiku 5.5를 비교 분석한 연구 결과입니다. 두 모델을 뉴스 헤드라인 분류 작업에 적용하여, 특히 높은 확신도(confidence) 구간에서의 정확도를 측정했습니다. 그 결과, Clef가 가장 높은 확신도(0.9 이상)에서 더 높은 정확도를 보였으나, 전체적인 성능 지표에서는 Haiku 5.5가 우위를 점하는 부분이 있었습니다.
핵심 포인트
- Clef는 선택지별 확률과 자신감(confidence)만을 반환하여 판단에 특화됨.
- 높은 확신도 구간(0.9 이상)에서 Clef의 정확도가 93.2%로 Haiku 5.5보다 높았음.
- 전체적인 성능 지표(ECE)는 Haiku 5.5가 더 우수했으나, 특정 고확신 영역에서는 Clef가 강점을 보임.
- 모델 비교 시 확신도 구간별 정확도를 분석하는 것이 중요하며, 이는 모델의 신뢰성 판단에 도움을 줌.
판단에 특화된 AI 'Jev'는 글을 쓰지 않고 선택지별 확률과 확신도(confidence)만을 반환하는 모델입니다.
사용해 보고 Cloudflare Workers AI에서 Jev를 호출했을 때 다음과 같이 응답이 왔습니다.
HTTP 402 {"errors":[{"message":"Insufficient balance; add money to your gateway or use BYOK","code":2021}]}
Jev는 무료 사용 범위 대상이 아니었습니다. 그래서 같은 형식으로 사용할 수 있는 Cloudflare 자체의 판단 모델 Clef를 무료 사용 범위에서 시험해 보았습니다.
비교 상대는 2026-10-07에 출시된 Claude Haiku 5.5(입력 100만 토큰당 $0.10)입니다.
뉴스 헤드라인 306문제를 9개 카테고리로 분류 (livedoor 뉴스 코퍼스)
정확도: 자신감 있는 10% 전후만 자동 결정한다고 가정할 경우
Clef 58.2% confidence 0.8 이상(13% 문제) → 정확도 95.1%
...
검증 환경: Cloudflare Workers AI의 무료 사용 범위에서
@cf/cloudflare/clef와 clef-flash
/
Claude Code 2.1.293의 claude -p --model haiku
(Haiku 5.5, Claude Max) / 측정은 2026-10-08. 추가 지불 없음
데이터는 livedoor 뉴스 코퍼스(2012년에 수집된 기사)입니다. 9개 사이트에서 헤드라인을 각각 34개씩, 난수를 고정하여 선택했습니다.
문제는 "이 헤드라인은 어떤 뉴스 사이트에 실렸던 것인가"입니다.
두 모델 모두에게 동일한 설명문을 전달했습니다. 각 사이트에는 '가전 채널: 가전・디지털 기기・IT 업계의 화제'와 같은 한 줄을 추가했습니다.
Clef: Jev와 같은 Choice 형태의 질문으로 합니다. 선택지별 확률과 confidence를 반환합니다 -
Haiku 5.5: 도구를 제외하고, 선택지별 확률을 JSON 형태로 답변해 달라고 요청했습니다
확신도는 어느 쪽 모두 '선택한 선택지의 확률'로 비교합니다. Clef의 confidence는 별도로 확인합니다.
| 정확도 | 강점 | 약점 | |
|---|---|---|
| Haiku 5.5 | 60.8% (186/306) | 스포츠 31/34 | IT 라이프핵 11/34 |
| Clef(27B) | 58.2% (178/306) | 스포츠 32/34 | 가전 채널 7/34 |
| Clef-flash(9B) | 52.0% (159/306) | 스포츠 32/34 | 가전 채널 5/34 |
가전・IT・스마트폰의 3개 사이트는 어느 것과도 읽을 수 있는 헤드라인이 있습니다. 모델 간의 차이는 여기서 역방향으로 나타났습니다 (가전은 Clef 7・Haiku 14, IT 라이프핵은 Clef 18・Haiku 11, 각 34문제 중).
TypeSafe의 문서에서도 일본어 등은 영어만큼 정확하지 않다고 적고 있습니다 (Clef도 마찬가지일 수 없습니다).
Other languages, including CJK scripts, are handled but not equally well
| 확신도 구간 | Clef의 정확도 | Haiku 5.5의 정확도 | |
|---|---|
| 0.9 이상 | 93.2% (44문제) | 89.2% (37문제) |
| 0.70.9 | 65.1% (126문제) | 75.9% (108문제) |0.7 | 45.3% (95문제) | 48.7% (115문제) |
| 0.5
| 0.5 미만 | 29.3% (41문제) | 32.6% (46문제) |
가장 위의 구간에서만 Clef, 그보다 아래는 Haiku 쪽이 더 적중했습니다.
확신도와 정확도의 차이(4개 구간으로 계산한 ECE)는 Clef 0.125, Haiku 0.072로, 전체적으로는 Haiku 쪽이 확신도를 더 솔직하게 보여주고 있습니다.
Clef의 confidence (확률과는 별도로 반환되는 값)로 자르면 위 차이가 명확해집니다.
⚠️ [IMG:N] 형식 토큰은 이미지 placeholder 입니다. 번역하지 말고 원래 위치에 그대로 유지하세요.
| 분류 기준 | 자동 결정 비율 | 해당 정답률 |
|---|---|---|
Clef의 confidence 0.5 이상 | 51% | 73.1% |
Clef의 confidence 0.8 이상 | 13% | 95.1% |
| Haiku의 확률 0.9 이상 | 12% | 89.2% |
'거의 확실한 것만 기계에 맡기고, 나머지는 사람이 확인한다'면 Clef의 confidence를 사용할 수 있습니다.
테마에서 다룬 'LLM과의 조합'도 시도해 보았습니다. Clef의 confidence가 0.5 이상이면 Clef의 답변을 사용하고, 그 외만 Haiku에게 질문합니다.
전체 정답률은 61.4%로, Haiku 단독(60.8%)과 거의 비슷했습니다. Haiku를 호출하는 비율은 49%로 줄일 수 있습니다.
| 306문제 비용 (API 환산) | 실제 비용 |
|---|---|
| Clef | $0.029 |
| ... | |
| Clef는 실측 입력 토큰(1문제당 약 400) × 단가입니다. 단가로 환산하면 두 가지를 합쳐 약 3,700 Neurons이며, 하루 무료 범위(10,000)의 4할 정도입니다. |
Haiku 비용은 Claude Code의 total_cost_usd로, Claude Code가 매번 붙이는 서론 부분까지 포함합니다.
Clef는 Jev가 아닙니다. Jev 본체는 유료이므로 측정하지 않았습니다 -
데이터는 1종류(2012년 일본어 헤드라인), 각 1회입니다. 자주 사용되는 코퍼스라 학습에 포함되었을 가능성도 있습니다 -
카테고리 설명문은 제가 작성한 것입니다. 작성 방식에 따라 정답률이 달라집니다. Clef 페이지에는 confidence의 계산 방법이 보이지 않습니다 (TypeSafe가 설명하는 Jev 공식과는 맞지 않았습니다) -
같은 '선택된 선택지의 확률'로 비교하면, 0.8 이상은 Haiku 40%・83.6%, Clef 33%・79.4%로 Haiku가 우세합니다. Clef의 강점은 confidence 값으로 나눌 때 나타납니다 - Haiku는 Claude Code를 거치기 때문에, 속도는 비교하지 않았습니다
Jev는 Cloudflare에서도 유료입니다. 호환되는 Clef라면 무료 범위에서 시도해 볼 수 있습니다 -
정답률은 Haiku 5.5가 60.8%, Clef가 58.2%입니다. 일본어 분류에서는 큰 차이가 없습니다 -
Clef의 경우, 비슷한 비율로 Haiku는 89%입니다. 확실한 것만 맡기는 사용법에 적합한 confidence
0.8 이상(13%)은 95%를 맞췄습니다. Clef로 자신 있는 절반을 처리하고, 나머지를 Haiku에게 넘기면, 정답률은 유지하면서 Haiku 호출이 절반으로 줄어듭니다.
돈을 들이지 않고 판단 AI를 시험해 보고 싶다면, 먼저 Clef와 Workers AI의 무료 범위를 이용해 보세요.
-
livedoor 뉴스 코퍼스 (주식회사 Rondhuit 배포, CC BY-ND 2.1 JP) https://www.rondhuit.com/download.html#ldcc
-
Clef: https://developers.cloudflare.com/workers-ai/models/clef/
-
TypeSafe 문서: https://docs.typesafe.ai/models.md
-
Claude Code의 Explore는 어느새 Haiku에서 본체와 같은 모델로 바뀌어 있었습니다. 되돌리면 비용이 21~35% 감소합니다 — Haiku를 저렴하게 사용하는 이야기
-
Claude Sonnet 5.5의 '최대 30% 저렴'은 절차를 거치는 작업에서만 재현되었습니다 — 발표된 수치를 실측으로 확인한 경험
JQIT 엔지니어의 95% 이상은 미경험자 채용입니다.
괜찮으시다면 기업 사이트에도 놀러 오세요.
엔지니어 채용도 진행하고 있습니다. 관심 있으시면 한번 둘러보세요.
▶ 채용 사이트
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기