Qwen 3.8 Max vs DeepSeek V4 Flash 2026: 3가지 포인트, 345배의 비용 차이
요약
Qwen 3.8 Max와 DeepSeek V4 Flash의 성능 및 비용 효율성을 비교 분석합니다. 두 모델은 벤치마크 점수 차이가 미미하지만, 운영 비용 측면에서는 345배의 극명한 차이를 보입니다.
핵심 포인트
- Qwen 3.8 Max가 벤치마크 점수에서 근소하게 우세함
- DeepSeek V4 Flash는 Qwen 대비 출력 비용이 약 21.4배 저렴함
- 모델 간 파라미터 규모는 약 8.5배 차이가 남
- 비용 제약이 큰 대량 작업에는 DeepSeek 모델이 유리함
Qwen 3.8 Max vs DeepSeek V4 Flash 2026: 3가지 포인트, 345배의 비용 차이
복사 가능한 필드 형태의 요약 버전:
AA Intelligence Index v4.1: Qwen 3.8 Max 53 · DeepSeek V4 Flash 0731 50
Arena text Elo: 1496 ±10 vs 1436 ±4 (+60 Qwen)
Parameters: 2.4T / 95B active vs 284B / 13B active (8.5x)
...
r/DeepSeek 커뮤니티는 어제 Artificial Analysis Intelligence Index에서 두 모델이 단 3점 차이를 보이고, 한 모델이 다른 모델보다 8.5배 많은 파라미터 (Parameters)를 보유하고 있다는 차트를 두고 논쟁을 벌였습니다. 해당 스레드의 제목은 이를 "유사한 성능"이라고 불렀습니다. 상위 댓글들은 이에 동의하지 않았으며, 그들의 판단이 옳았습니다. 인덱스 3점 차이는 단순한 노이즈가 아닙니다. 하지만 그 스레드에서 아무도 고려하지 않은 것은 거래의 다른 측면입니다. 우리는 동일한 게이트웨이를 통해 세 가지 작업에 두 모델을 모두 실행해 보았고, 그 3점의 차이는 345배의 비용을 요구했습니다.
TL;DR: 어떤 것을 선택해야 할까요?
| 상황 | 선택 | 이유 |
|---|---|---|
| 비용이 제약 사항인 대량의 텍스트 작업 | DeepSeek V4 Flash | 출력 비용이 21.4배 저렴하며, 인덱스 3점 뒤처짐 |
| ... |
빠른 사양 비교
가격은 2026-08-04에 확인된 ofox 카탈로그 요율 기준입니다. 파라미터 (Parameter) 수는 각 벤더의 자체 출시 자료를 바탕으로 합니다.
| 사양 | Qwen 3.8 Max | DeepSeek V4 Flash 0731 |
|---|---|---|
| ofox 모델 ID | bailian/qwen3.8-max | deepseek/deepseek-v4-flash |
| ... |
두 줄의 데이터가 결정의 대부분을 차지합니다. Qwen은 이미지를 볼 수 있는 유일한 모델이며, DeepSeek는 단일 응답에서 2.9배 더 많은 토큰 (Tokens)을 작성합니다. 그 외의 모든 것은 인덱스 3점이 당신에게 어느 정도의 가치가 있느냐의 문제입니다.
어떤 모델이 제3자 벤치마크에서 더 높은 점수를 기록하나요?
두 모델이 모두 포함된 모든 소스에서 Qwen 3.8 Max가 우세합니다. 격차는 일관적이며 미미합니다.
| 소스 (2026-08-04 스냅샷) | Qwen 3.8 Max | DeepSeek V4 Flash 0731 |
|---|---|---|
| AA Intelligence Index v4.1 | 53 | 50 |
| ... |
이 수치들을 사용하기 전에 출처를 확인하십시오.
- AA 53은 여기서 근거가 가장 취약한 수치이며, 저희는 이를 숨기기보다 경고 표시(flagging)하고 있습니다. Artificial Analysis에는 Qwen 3.8 Max를 위한 모델 페이지가 없습니다. 해당 점수는 Intelligence Index 차트 위젯 내부에만 존재하므로, 일반적인 모델별 수치(인덱스 실행 비용, 장황함 (verbosity), 출력 속도)가 공개되지 않았습니다. 동일한 인덱스의 맥락을 위해 비교하자면, Kimi K3는 57점, GLM-5.2는 51점, Gemini 3.6 Flash는 50점, DeepSeek V4 Pro는 44점, Qwen 3.7 Max는 46점을 기록했습니다.
- Arena 수치는 보드에서 직접 읽은 값입니다. 이곳의 Elo 점수는 계속 변동되며 매일 업데이트되므로, 순위는 지속적인 부분으로 보고 정확한 수치는 스냅샷으로 취급하십시오. ±10 및 ±4 간격 내에서의 60점 차이는 실제적인 리드(lead)이지만, 동일한 보드에서 Qwen 3.6 Plus와 V4 Flash 사이에서 발견된 8점 차이는 그렇지 않습니다.
- LiveBench는 Qwen 3.8 Max를 전혀 채점하지 않았습니다. 다만 DeepSeek V4 Flash 0731은 74.2점을 기록했는데, 이는 4월 출시 버전의 65.5점에서 상승한 수치로, 7월 재학습 (retrain)이 가져온 성과를 보여주는 가장 명확한 단일 지표입니다.
Reddit 스레드를 시작한 효율성 논쟁은 타당한 산술적 근거를 가지고 있습니다. 284B의 총 파라미터 (total parameters)가 2.4T 모델의 3점 차이 이내로 접근했으며, 토큰당 활성 파라미터 (active parameters)는 95B 대비 13B입니다. 이것이 귀하에게 중요한지는 귀하가 가중치 (weights)를 구매하는지 아니면 토큰 (tokens)을 구매하는지에 달려 있습니다. 만약 토큰을 구매하는 것이라면, 파라미터 수는 공급업체의 문제이고 가격은 귀하의 문제입니다.
세 가지 실제 작업에서 어떻게 비교되는가?
두 모델 모두 작업 내용은 정확했으나, 인보이스 (invoices) 결과는 큰 차이가 있었습니다. 저희는 2026-08-04에 기본 파라미터와 시스템 프롬프트 없이 api.ofox.ai/v1/chat/completions를 통해 세 개의 프롬프트를 전송했으며, API usage 객체에서 토큰 수를 가져왔습니다.
| 작업 | Qwen 3.8 Max | DeepSeek V4 Flash 0731 |
|---|---|---|
| JSON으로 영수증 추출 (Receipt extraction to JSON) | 1,332 출력, 26.0초, 정확함 | 133 출력, 13.6초, 정확함 |
| ... |
합계보다 더 가치 있는 세 가지 관찰 사항입니다.
- 두 모델 모두 추론(Reasoning)에서 틀리지 않았습니다. 영수증에 대한 JSON 결과가 동일했으며, 두 모델 모두 정확한 행 산술(line arithmetic)을 수행했습니다. 두 모델 모두 작동 가능한 짝수 길이의 중앙값(even-length median)을 반환했으며, 우리는 이를 정확하다고 판단하기 전 네 가지 사례에 대해 실행해 보았습니다. 세 개의 인덱스 지점은 이 정도 규모의 작업에서는 정답 여부를 가르는 차이로 나타나지 않았는데, 이는 예상했던 바와 같습니다. 벤치마크 격차는 일상적인 작업이 아닌 어려운 꼬리 부분(hard tail)에서 발생합니다.
- 엄격한 형식(Strict-format) 작업은 Qwen의 압도적인 승리였습니다. 상태 코드 400부터 439까지를 포함하는 40개의 행을 요청했을 때, Qwen은 할당되지 않은 코드를 플레이스홀더(placeholder)로 채워 정확히 40개를 생성했습니다. 반면 DeepSeek는 29개만 생성했으며, 할당되지 않은 모든 코드를 조용히 건너뛰고 범위를 벗어나 451까지 포함하는 오류를 범했습니다. 만약 다운스트림(downstream) 파서가 고정된 형태(fixed shape)를 기대한다면, 이는 스타일의 선호 문제가 아니라 정확성 실패(correctness failure)입니다.
- 지연 시간(Latency)은 장황함(Verbosity)과 결합되며, 6배라는 수치는 처리량(Throughput)에 대한 주장이 아닙니다. 우리의 수치는 세 번의 호출에 걸친 엔드 투 엔드(end-to-end) 실제 시간(wall clock)이며, 이는 속도보다는 토큰 수에 의해 결정되었습니다. Qwen이 19.7배 더 많은 출력을 내보냈기 때문입니다. 초당 수치는 다른 측정 방식이며, 이번 대결에서는 한쪽 모델만 해당 수치를 가지고 있습니다. Artificial Analysis는 DeepSeek V4 Flash 0731을 초당 122.7 출력 토큰(해당 뷰에서 101개 중 8위, 2026-08-04 기준)으로 나열하고 있으나, Qwen 3.8 Max는 모델 페이지가 없기 때문에 처리량 수치를 게시하지 않았습니다. 따라서 6배라는 수치는 "이 모델이 토큰당 6배 더 빠르다"가 아니라 "이 워크로드가 6배 더 빨리 끝났다"로 이해해야 합니다. 배치 작업(Batch job)의 경우 이는 비용 항목이 되며, 대화형(Interactive) 작업의 경우 이는 제품 결정 사항이 됩니다.
세 개의 프롬프트는 표본일 뿐 연구는 아닙니다. 세 가지 모두에서 일관된 방향성이 유지되었으며, 이것이 귀하의 작업에서도 유지되는지 확인하는 가장 저렴한 방법은 이 기사 끝에 있는 루프(loop)를 사용하는 것입니다.
코딩에는 어떤 모델이 더 나은가?
Qwen 3.8 Max는 성능 지표에서 앞서고, DeepSeek V4 Flash는 청구서에서 앞섭니다. 인간이 생성된 프론트엔드 코드 (front-end code)를 나란히 비교하는 Arena WebDev 리더보드(leaderboard)에서, qwen3.8-max는 1668 (+18/-18)을 기록하며 deepseek-v4-flash-high의 1577에 비해 앞서 있습니다. 이 91점의 격차는 일반 텍스트 리더보드에서 두 모델 사이의 60점 차이보다 더 큽니다. 따라서 Qwen의 추가적인 파라미터 (parameters)가 무엇을 얻어내고 있든, 프론트엔드 생성 능력이 그 일부임은 분명합니다.
이 1668점이라는 수치에 대한 맥락을 살펴보면: 동일한 리더보드에서 kimi-k3-max는 1676, claude-opus-5-high는 1669를 기록하고 있으며, 세 모델 모두 중첩되는 오차 범위 내에 있습니다. Qwen 3.8 Max는 이 작업에서 진정으로 최상위 그룹에 속해 있으며, 이는 보통 2달러의 입력 가격 (input price)으로는 기대하기 어려운 결과입니다.
저희가 직접 수행한 코딩 작업에서는 이러한 격차가 재현되지 않았으나, 이는 모순이라기보다 유익한 정보입니다. 두 모델 모두 짝수 길이의 중앙값 (even-length median) 버그를 첫 번째 시도에서 정확히 수정했으며, 수정 사항은 단 6줄이었습니다. 일상적인 수리 작업은 53점과 50점을 가르는 기준이 되지 못합니다. 두 모델을 가르는 것은 '롱테일 (long tail)' 영역입니다: 생소한 프레임워크 (framework), 모호한 사양 (spec), 여러 파일에 걸쳐 유지되어야 하는 리팩토링 (refactor) 등이 이에 해당합니다. 만약 귀하의 코딩 작업이 대부분 일상적인 종류라면, 나타나지도 않을 차이를 위해 21배의 비용을 지불하고 있는 셈입니다. 하지만 작업이 대부분 난도가 높은 종류라면, WebDev 리더보드는 그 비용이 제 역할을 하고 있음을 보여줍니다.
0731 재학습 (Retrain)은 실제로 무엇을 바꾸었는가?
DeepSeek V4 Flash를 명백한 열세에서 단 3점 차이의 추격자로 이동시켰습니다. 모델 ID도 바뀌지 않았고, 아키텍처 (architecture)도 바뀌지 않았으며, 가격도 바뀌지 않았습니다. 바뀐 것은 가중치 (weights)입니다.
LiveBench는 두 릴리스 (releases)를 별도로 점수화하여 그 차이를 명확히 보여줍니다:
| LiveBench 2026-06-25 | 글로벌 평균 |
|---|---|
| DeepSeek V4 Flash 0731 | 74.2 |
| ... |
동일한 평가에서 8.7점의 상승을 기록했으며, 이는 저가형 모델을 DeepSeek 자체의 플래그십 (flagship) 모델보다 앞서게 만들었습니다. Artificial Analysis 인덱스에서도 동일한 역전 현상이 나타납니다: V4 Pro의 44점에 비해 V4 Flash 0731은 50점을 기록했습니다.
두 가지 실질적인 결과는 다음과 같습니다:
- ofox 엔트리는 이미 0731로 해결되었습니다.
deepseek/deepseek-v4-flash의 카탈로그 페이지에는 2026-07-31 출시일이 명시되어 있으므로, 날짜 접미사를 고정하지 않아도 재학습된 가중치 (retrained weights)를 얻을 수 있습니다. 8월 이전에 작성된 V4 Flash에 관한 모든 내용은 실질적으로 더 약한 모델을 설명하고 있는 것입니다. - 6월에 작성된 비교는 틀린 것이 아니라 구식(stale)인 것입니다. Qwen이 큰 차이로 앞선다고 기술한 6월의 글은 당시에는 정확했습니다. 오늘날까지 유지되는 격차는 인덱스 3포인트이며, 이 글은 바로 그 숫자에 대해 다루고 있습니다.
두 모델 모두 Anthropic 프로토콜에서 작동하나요?
네, 두 모델 모두 POST https://api.ofox.ai/anthropic/v1/messages에서 응답합니다. 저희는 2026-08-04에 각 모델에 동일한 한 단어 명령을 보냈습니다:
curl https://api.ofox.ai/anthropic/v1/messages \
-H "x-api-key: $OFOX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
...
두 모델 모두 ok라고 응답했습니다. 하지만 사용량 객체 (usage objects)는 일치하지 않았습니다: Qwen 3.8 Max는 입력 98개, 출력 27개의 토큰 (tokens)을 보고했고, DeepSeek V4 Flash는 입력 15개, 출력 2개의 토큰을 보고했습니다. 동일한 두 글자 답변임에도 불구하고, 21.4배의 요율 (rate) 차이를 적용하기 전 이미 출력 토큰은 13배, 입력 토큰은 6.5배 더 많았습니다.
이 점은 귀하의 팀이 Anthropic 형태의 툴링 (tooling)을 실행하면서 더 저렴한 모델로 연결하고자 할 때 중요합니다. 요청 형태 (request shape)는 변경되지 않으며, cache_creation_input_tokens 및 cache_read_input_tokens가 응답에 포함되며, 오직 모델 문자열 (model string)만 바뀌기 때문입니다.
각 모델의 월간 비용은 얼마인가요?
요율표 (rate card)를 기준으로 하느냐, 실제로 돌려받는 토큰을 기준으로 하느냐에 따라 15배에서 82배 사이입니다. 아래의 두 시나리오 모두 한 달을 30일로 계산한 ofox 목록 요율을 사용합니다. 이는 실제 청구서 (invoices)가 아닌 공표된 가격에 기반한 산술 계산입니다.
워크로드 A, 요율표 기준 가격. 캐싱 (caching) 없이 하루에 5M 입력 및 0.5M 출력 토큰 사용.
| 모델 | 일일 비용 | 월간 비용 | DeepSeek 대비 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.84 | $25.20 | 기준 (baseline) |
| Qwen 3.8 Max | $13.00 | $390.00 | 15.5x |
Workload B, 우리가 측정한 토큰 비율로 가격을 책정한 동일한 작업. Qwen은 19.7배 더 많은 출력을 반환하므로, Qwen의 0.5M은 하루에 9.85M이 되는 반면 DeepSeek는 0.5M에 머뭅니다.
| 모델 | 일일 비용 | 월간 비용 | DeepSeek 대비 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.84 | $25.20 | 기준 (baseline) |
| Qwen 3.8 Max, 측정된 비율 적용 | $69.10 | $2,073.00 | 82x |
각 모델이 실제로 반환하는 양을 계산하면, 요금표(rate card)는 그 격차를 5배 정도 과소평가하고 있는 셈입니다.
캐시(cache) 항목에 대해 한 가지 주의할 점이 있습니다. ofox는 DeepSeek V4 Flash에 대해 세 가지 제공업체(provider)를 나열하고 있으며, 이들은 캐싱 가격을 동일하게 책정하지 않습니다:
| ofox의 제공업체 행 | 입력 / 출력 | 캐시 읽기 (Cached read) |
|---|---|---|
| DeepSeek | $0.14 / $0.28 | $0.0028 |
| ... |
Qwen의 $0.25와 비교했을 때 DeepSeek 행에서 나타나는 89배의 캐시 우위는 유지되며, 이는 Artificial Analysis가 캐시 히트(cache-hit) 순위에서 백만 토큰당 $0.003으로 반영하고 있는 수치와도 일치합니다. BaiLian 행을 보면 동일한 비교 수치가 8.9배로 나타나는데, 여전히 큰 격차이긴 하지만 차수가 하나 낮습니다(an order of magnitude smaller). 최하단 수치를 기준으로 예산을 세우기 전에, 귀하의 트래픽이 어떤 제공업체로 연결되는지 확인하십시오.
Qwen 3.8 Max는 DeepSeek V4 Flash가 할 수 없는 무엇을 할 수 있는가?
보여주는 것(See)입니다. ofox 카탈로그에 따르면 bailian/qwen3.8-max에는 Vision (시각), Video Input (비디오 입력), Web Search (웹 검색) 기능이 나열되어 있고, deepseek/deepseek-v4-flash에는 Function Calling (함수 호출) 및 Prompt Caching (프롬프트 캐싱) 기능이 나열되어 있습니다. 이것이 기능의 경계선이며, 그 어떤 가격적 우위도 이 경계를 넘을 수는 없습니다.
한계에 부딪히는 작업들:
- 스크린샷 분류(triage), UI 검토, 또는 렌더링된 자신의 출력을 검사하는 모든 에이전트 (agent)
- 스캔된 문서, 영수증, 양식, 사진 형태로 들어오는 모든 것
- 비디오 입력 경로가 구체적으로 필요한 비디오 키프레임 태깅 (Video keyframe tagging)
- 숫자가 오직 그림 안에만 존재하는 차트 및 다이어그램
- 슬라이드 덱, 대시보드, 문서 레이아웃 작업 (Alibaba가 출시 데모에서 강조한 부분)
해당 Reddit 스레드의 한 댓글 작성자는 이 점을 가장 날카롭게 지적했습니다. 이미지 입력(image input)이 가능한 모델은 UI를 작성하고, 이를 스크린샷으로 찍은 뒤, 자신의 작업물을 스스로 검토할 수 있습니다. 텍스트 전용(text-only) 모델은 어떤 비용을 지불하더라도 이러한 루프(loop)에 진입할 수 없습니다.
반대의 격차는 더 좁지만 분명히 존재합니다. Qwen의 131K와 비교되는 DeepSeek의 384K 최대 출력(max output)은 2.9배 차이가 나며, 이는 긴 번역, 전체 테스트 스위트(test suite), 또는 대규모 구조화된 추출(structured extraction) 작업을 한 번의 응답으로 처리할지, 아니면 사용자가 청킹 로직(chunking logic)을 직접 작성해야 할지를 결정짓는 요소가 됩니다.
r/DeepSeek에서는 실제로 무엇을 두고 논쟁했는가?
해당 스레드는 스스로의 헤드라인을 거부했으며, 그 거부 과정이 오히려 유익한 부분이었습니다. 게시물은 53 모델과 50 모델을 파라미터(parameters)가 8.5배 차이 나는
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기