Claude Haiku 5.5 vs DeepSeek V4.1 Flash: 일상 업무 실측 비교
요약
본 기사는 Claude Haiku 5.5와 DeepSeek V4.1 Flash를 대상으로 일상 업무 시나리오 기반의 실측 비교 테스트 결과를 제시합니다. 종합적인 안정성에서는 Haiku가 우위를 보였으나, 응답 속도 및 JSON 출력 처리 능력은 DeepSeek이 뛰어남을 확인했습니다. 사용자는 과제 성격에 따라 두 모델 중 적절한 것을 선택해야 합니다.
핵심 포인트
- 종합 업무 처리 시에는 Claude Haiku 5.5의 안정성이 높습니다.
- JSON 파싱이나 대량 데이터 처리는 DeepSeek V4.1 Flash가 효율적입니다.
- DeepSeek은 응답 속도와 비용 측면에서 우위를 보였습니다.
- 두 모델 모두 실제 업무 시스템에 적용 전 검증이 필수적입니다.
이번 일상 업무 테스트에서는 여러 조건을 다루는 종합 용도로는 Haiku 5.5가 안정적이었습니다. DeepSeek V4.1 Flash는 일반적인 응답 속도, 전체 테스트 비용, 불필요한 장식 없는 JSON 출력에서 우위를 보였습니다. 이는 중국어 10가지 과제를 각각 3회 실행한 결과이며, 범용적인 모델 순위는 아닙니다.
Crazyrouter는 이번에 사용된 AI API 게이트웨이입니다. 공통의 OpenAI 호환 엔드포인트를 통해 총 66건의 주 요청을 실행했으며, 객관 과제 내용 정답 수는 Haiku가 27/27, DeepSeek이 24/27이었습니다. 본 문서는 Crazyrouter 팀의 보고서입니다. 모델별로 다른 상위 경로를 고정했기 때문에 캐시와 실제 사고 모드는 완전히 통제할 수 없습니다. 결과는 이러한 연결 경로에서의 이용 경험을 보여줍니다.
주문 취합 규칙, 시차를 고려한 일정 조정, 글자 수 제한이 있는 중국어 알림을 종합적으로 처리해야 한다면, 먼저 Haiku를 시도해 보는 것이 좋습니다. 항목 추출, 문의 분류, 읽기 전용 검색을 대량으로 처리하는 경우에는 DeepSeek을 우선하여 평가할 가치가 있습니다. 어느 쪽 모두 업무 시스템에 전달하기 전에 검증이 필요합니다.
| 지표 | Haiku 5.5 | DeepSeek V4.1 Flash |
|---|---|---|
| 객관 과제 내용 정답 수 | 27/27 | 24/27 |
| JSON을 명시한 과제에서 직접 파싱 가능 | 2/21 | 15/21 |
| 내용과 지정 형식 모두 충족 | 8/27 | 18/27 |
| 중국어 알림의 사실 및 글자 수 조건 충족 | 3/3 | 0/3 |
| 완료 시간 중앙값 | 4.47초 | 2.45초 |
| 단일 턴 첫 가시 텍스트 중앙값 | 3.97초 | 1.95초 |
| 가장 느렸던 과제 | 16.31초 | 24.34초 |
| ... | ||
내용 채점은 Markdown의 감싸기 등에서 JSON을 추출하여 평가합니다. 형식 채점은 원본 출력을 그대로 확인합니다. 27/27이라 하더라도, 그대로 프로그램에 전달될 것이라고는 보장할 수 없습니다. 일정 과제는 UTC 문자열 2개만을 요구했을 뿐 JSON을 지정하지 않았기 때문에, JSON 21건에는 포함되지 않았습니다. JSON Schema나 response_format은 사용하지 않았습니다. |
실행 시각은 2026-10-09, Asia/Shanghai 기준 약 16:05–16:09입니다. 각 모델 10종 × 3회의 총 30과제였습니다. 도구 과제는 API 호출을 2번 사용했기 때문에, 각각 33요청이 되었습니다. 주 요청 66/66은 HTTP 200으로 스트림을 완료했으며, 반환된 모델 ID는 요구사항과 일치했고, 청구 기록도 고정 경로를 확인할 수 있었습니다.
같은 중국어 프롬프트와 system 지시어를 사용하고, 고정 시드를 사용하여 과제 순서를 변경하며 두 모델을 병렬 실행했습니다. 동시 실행 상한은 2였고, 클라이언트 재시도는 없었습니다. temperature는 지정하지 않아 상위의 기본값을 사용했습니다. 현재 모델 정보는 Anthropic 모델 목록과 DeepSeek 모델 목록에서 확인할 수 있습니다.
아래는 실제로 사용된 일정 과제의 payload입니다. 모델명 외 항목은 공통입니다.
{
"model": "claude-haiku-5-5",
"messages": [
...
Base URL은 https://api.crazyrouter.com/v1이고, 완전한 엔드포인트는 POST https://api.crazyrouter.com/v1/chat/completions입니다. 재현성을 위해 프롬프트는 원본 중국어로 표시했습니다.
thinking.type=disabled를 전송했다고 해서, 상위에서 사고가 무효했다는 증거가 되지는 않습니다. 로컬의 OpenAI→Claude 변환 코드는 이 필드를 복사하지 않았으며, 실제 상위에 전달된 최종 payload도 확보하지 못했습니다. Haiku 27건에서는 reasoning_content이 공백만 있었습니다. 두 모델의 reasoning_tokens
0이지만, 실제 사고 모드가 같다고 판단할 수는 없습니다. Haiku의 짧은 알림은 출력 899–1,023 토큰으로 보고되었으며, 가시 텍스트만으로는 세부 내역을 설명할 수 없습니다. DeepSeek의 사고 모드와 Claude의 구조화된 출력이 담긴 공식 문서는 제어 방법을 참고하는 자료입니다. 문서가 존재한다는 사실이 이번에 그 기능이 유효했다는 증거는 아닙니다.
| 과제 | Haiku 내용 합격 | DeepSeek 내용 합격 | Haiku 중앙값 | DeepSeek 중앙값 |
|---|---|---|---|---|
| 항목 추출 | 3/3 | 3/3 | 3.78초 | 2.91초 |
| ... | ||||
| 항목 추출, 우선순위 판정, 회의 담당 정리, 180건 규칙 검색, 메일 내 지시 공격, Python 짧은 함수, 도구 검색 등 모든 과제에서 두 모델 모두 만점을 받았습니다. 구간 병합 코드는 각 답변에 대해 40개의 케이스를 실행했습니다. 끝점이 접하는 구간을 결합하지 않는지, 공백/오류 구간, 음수, 중복, 입력 변경 여부를 확인했으며, 각 모델은 3개 답변 모두 합격했습니다. |
도구 과제는 가상의 주문 A-1048를 사용했습니다. 올바른 읽기 전용 함수를 호출한 후, 테스트 측에서 고정 정보를 반환하고 최종 답변을 확인합니다. 실제 고객의 주문이나 복잡한 다중 도구 계획은 다루지 않았습니다.
DeepSeek의 첫 번째 결과는 순수 수입 167.50였고, 유효 주문 3건과 ["A","B","D"]였습니다. B에 대한 80의 입금액은 전액 환불되었으며, 최종 순액이 양의 주문만 계산하는 규칙에서는 정답은 2건이며 ["A","D"]입니다. 나머지 2회와 Haiku의 3회는 정답이었습니다.
정답 시간대는 UTC 08:30–09:00였습니다. DeepSeek은 2회 08:15–08:45를 선택하여 참가자의 기존 일정과 15분 겹쳤습니다. Haiku는 3회 모두 정답이었습니다. 이는 일정 구간 체크로 감지할 수 있는 종류의 오류입니다.
구두점 포함 80–120자라는 요구사항에 대해, Haiku는 93, 85, 102자였고, DeepSeek은 67, 70, 69자였습니다. 6개 답변 모두 영향 시간대, 응답 지연, 복구, 오후 6시 이전 업데이트를 포함했지만, 보상이나 절대적인 데이터 안전을 약속하지는 않았습니다. DeepSeek의 실패는 글자 수에 관한 것이지 사실 조작이 아닙니다.
JSON 지정 21건 중 직접 분석할 수 있었던 것은 Haiku가 2/21, DeepSeek이 15/21이었습니다. 괄호를 제거하면 내용 자체는 맞더라도, 타입과 업무 규칙 검증은 필요합니다. 회의 과제의 '롤백 연습'과 '되돌리기 연습'은 동의어로 취급하여, 지정되지 않은 표현 차이로 감점하지 않았습니다.
DeepSeek의 완료 중앙값은 약 45% 낮았으나, 코드 과제 1건은 24.34초가 걸렸습니다. 이 느린 샘플은 제외하지 않았습니다. 30개 과제만으로는 장기적인 지연 분포나 SLA를 평가할 수 없습니다. 첫 번째 텍스트는 단일 턴 27개 과제가 대상이며, 도구 과제의 완료 시간은 2회 호출의 합계입니다.
요금은 66개 요청 ID에 대응하는 소비 기록을 대조하고, 호출별 반올림까지 포함했습니다. 각 33개 주 요청에 대한 금액이며, 통신 확인 3건은 제외되었습니다. 총액은 $0.015420이었고, DeepSeek의 부담은 약 53% 적은 결과였지만, 토큰 단가가 항상 저렴하다는 의미는 아닙니다.
Haiku는 입력/출력 25,752 / 15,858 토큰, DeepSeek은 16,392 / 2,082였습니다. DeepSeek은 추가로 8,448 캐시 토큰을 읽어 들여 입력의 약 51.5%를 읽었습니다. Haiku의 캐시 읽기 기록은 0입니다. 무작위 입력으로 캐시를 냉각시키지 않았으므로 콜드 스타트 비교가 아닙니다. 계정, 시간대, 출력량, 상위 사용량 집계도 요금에 영향을 미칩니다.
- 여러 조건을 다루는 종합 용도는 Haiku로 시도하고, JSON의 괄호와 구조를 검증합니다.
- 대량 추출, 분류, 읽기 검색은 DeepSeek으로 시도하고, 실제 데이터에서 품질과 캐시 효과를 측정합니다.
- 금액 집계, 일정 충돌, 글자 수는 모델에 관계없이 일반 프로그램으로 검증합니다.
6개 국어 기사는 같은 중국어 프롬프트 실험의 번역이며, 6개 국어 능력 테스트가 아닙니다. 각 분류는 1개의 과제를 3회 반복했을 뿐입니다. 이미지, 긴 대화, 100만 토큰 컨텍스트, 대규모 리포지토리, 고병렬 처리는 미평가입니다. 이전 네이티브 API를 사용한 Haiku/Sonnet 비교와 합쳐서 3개 모델의 순위를 매길 수도 없습니다.
아닙니다. 내용 정답 수는 27/27 대 24/27이었지만, 경로, 캐시, 실제 사고 상태에 차이나 미확인 부분이 있습니다. 문제 수 또한 적습니다.
자연어 지시에서는 DeepSeek이 15/21 대 2/21로 양호했습니다. 강제적인 구조화 출력은 미평가였으므로, 실제 환경에서 검증이 필요합니다.
세 답변 모두 80자 미만이었다는 점입니다. 필요한 사실은 유지하고 있었습니다.
프로토콜 변환 과정에서 필드가 손실될 가능성이 있기 때문입니다. 최종 상위 요청(upstream request)은 미획득이었고, 추론 토큰(reasoning token)이 0이라도 숨겨진 사고 과정이 없다고 단정할 수는 없습니다.
33건 기준 DeepSeek은 $0.004914, Haiku는 $0.010506입니다. 이는 출력량, 캐시, 시간대를 포함한 이번 청구액이며, 일반적인 요금 보장은 아닙니다.
직접적으로는 할 수 없습니다. 원래 과제는 중국어였고, 코드 과제도 짧은 함수였습니다. 사용 언어, 규모, 연결 경로를 종합하여 재평가해 주십시오.
자세한 절차와 6개 국어 버전은 원본 기사를 참조하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기