DeepSeek V4 Flash vs Gemini 3.6 Flash: 동일한 점수, 10배의 가격 차이
요약
DeepSeek V4 Flash와 Gemini 3.6 Flash의 성능 및 비용 효율성을 비교 분석합니다. 두 모델은 유사한 벤치마크 점수를 기록했으나, 실제 워크로드 실행 시 DeepSeek가 Gemini 대비 약 10배 저렴한 비용 효율성을 보여줍니다.
핵심 포인트
- DeepSeek V4 Flash는 Gemini 3.6 Flash와 유사한 성능을 내면서도 비용은 10배 저렴함
- 텍스트 중심의 대량 처리 워크로드에는 DeepSeek가 압도적으로 유리함
- 이미지 입력이 포함된 파이프라인 환경에서는 두 모델 모두 효율성이 떨어짐
- DeepSeek의 0731 빌드는 사후 학습을 통해 성능이 크게 향상됨
DeepSeek V4 Flash vs Gemini 3.6 Flash: 동일한 점수, 10배의 가격 차이
요약 (TL;DR): DeepSeek V4 Flash 0731과 Gemini 3.6 Flash는 모두 Artificial Analysis Intelligence Index v4.1에서 50점을 기록했으며, GPT-5.6 Luna가 51점으로 1점 앞서 있습니다. 이들의 리스트 가격(List price)은 10배 이상의 차이가 납니다. 흥미로운 점은 가격표를 비교하는 것을 멈추고, 동일한 평가 워크로드(Workload)에 대해 실제 청구된 인보이스(Invoice)를 비교할 때 발생하는 현상입니다. Artificial Analysis는 각 모델을 실행하는 데 지불한 비용을 공개했습니다: DeepSeek는 $72.02, Luna는 $190.87, Gemini는 $726.70였습니다. 출력 가격(Output price)의 표면적인 격차는 27배입니다. 하지만 실제 청구 금액의 격차는 10.1배인데, 이는 DeepSeek가 해당 실행에서 2억 1천만 개의 출력 토큰(Output tokens)을 소모한 반면 Gemini는 5천 9백만 개를 소모했기 때문입니다. 두 수치 모두 워크로드가 텍스트라면 DeepSeek를 구매하라고 말하고 있습니다. 다만, 두 모델 모두 이미지를 전송하는 파이프라인(Pipeline) 환경에서는 살아남지 못합니다.
요약 (TL;DR): 어떤 것을 선택해야 할까요?
| 상황 | 선택 | 이유 |
|---|---|---|
| 텍스트 전용, 대량 처리, 비용이 제약 사항인 경우 | DeepSeek V4 Flash 0731 | 토큰당 비용이 약 10배 저렴하며, 추가로 98%의 캐시 할인(Cache discount) 제공 |
| ... | ||
| 여기서 읽기를 멈출 수 있는 두 가지 방법이 있습니다. 만약 워크로드가 텍스트가 아닌 입력을 전송한다면, 두 번째 행에서 결정이 내려지며 이 글의 나머지 내용은 배경 지식에 불과합니다. 만약 워크로드가 텍스트이고 월간 약 2,000만 토큰 미만으로 실행된다면, 위에서 언급한 가장 저렴한 옵션과 가장 비싼 옵션 사이의 연간 비용 차이는 엔지니어링 업무 하루 치 시간보다 적으므로, 지연 시간(Latency)을 기준으로 선택하고 넘어가십시오. 아래의 모든 내용은 청구 금액이 논쟁할 가치가 있을 만큼 클 경우를 위해 작성되었습니다. |
7월 31일에 실제로 변경된 사항
DeepSeek는 2026-07-31에 V4 Flash의 새로운 빌드(Build)를 출시했지만, 모델 자체를 변경하지는 않았습니다. 총 파라미터(Parameters) 284B, 활성(Active) 파라미터 13B, 컨텍스트(Context) 1M, 가격 $0.14 / $0.28 모두 동일합니다. API 모델 이름 또한 deepseek-v4-flash로 변경되지 않았으며, DeepSeek 문서에서는 해당 빌드를 모델 버전 DeepSeek-V4-Flash-0731로 식별합니다. 변경된 점은 사후 학습(Post-training) 단계입니다.
측정된 효과는 일반적으로 "사후 학습 (Post-training)만"이 시사하는 것보다 더 큽니다. Artificial Analysis Intelligence Index v4.1에서 점수는 40점에서 50점으로 상승했습니다. AA의 에이전트 평가(agentic evaluation)인 GDPval-AA v2는 1189 Elo에서 1559 Elo로 이동했습니다. Terminal-Bench 2.1은 17포인트를 획득하여 79%에 도달했습니다. 또한 AA는 0731 빌드를 DeepSeek의 자체 플래그십 모델인 DeepSeek V4 Pro보다 6점 앞선 것으로 배치했는데, 이는 Pro 모델이 어려운 케이스를 처리할 것이라는 가정하에 라우팅 규칙(routing rules)을 작성한 누구에게나 당혹스러운 결과입니다.
저희도 그들 중 하나였습니다. 지난 5월에 작성한 저희의 DeepSeek V4 Pro vs Flash 라우팅 가이드에서는 다중 파일 작업(multi-file work)과 긴 에이전트 루프(long agent loops)는 Pro 모델에 적합하다고 결론지었습니다. 0731 빌드에서는 그 결론이 더 이상 유효하지 않으며, 솔직한 버전은 이제 Flash가 기본값(default)이고 Pro는 정당화가 필요한 예외 사항이라는 것입니다.
가중치(weights)는 예상보다 훨씬 빠르게 공개되었습니다. AA의 출시 보도에서는 전체 가중치가 예상대로 "향후 몇 주 내에" 공개될 것이라고 설명했으며, 대부분의 2차 보도들도 여전히 이를 반복하고 있습니다. 2026-08-01에 확인한 결과, Hugging Face의 deepseek-ai/DeepSeek-V4-Flash-0731에는 이미 MIT 라이선스 하에 게이트가 없는(ungated) 48개의 safetensors 샤드(shards)로 모델이 올라와 있습니다. 만약 어디선가 0731이 API 전용이라고 읽으셨다면, 그것은 약 하루 동안만 사실이었습니다.
수치를 살펴보기 전에 언급할 주의 사항이 하나 있습니다. Intelligence Index는 계속 변하는 리더보드(rolling leaderboard)이며, 아래의 모든 내용은 2026-08-01 기준의 스냅샷입니다. 순위는 지속적인 사실로 간주하되, 절대 점수는 특정 날짜에 측정된 값으로 취급하십시오.
빠른 사양 비교 (Quick Specs Comparison)
| 기능 (Feature) | DeepSeek V4 Flash 0731 | Gemini 3.6 Flash | GPT-5.6 Luna |
|---|---|---|---|
| ofox 모델 ID | deepseek/deepseek-v4-flash | google/gemini-3.6-flash | openai/gpt-5.6-luna |
| ... |
두 행은 다시 한번 살펴볼 가치가 있습니다. 최대 출력 (Max output)은 실질적인 구분점입니다. 384K 대 64K의 차이는 단 한 번의 호출로 긴 파일을 생성할 수 있는지, 아니면 계속 이어 쓰기 루프 (continuation loop)를 구축해야 하는지의 차이입니다. 그리고 비어 있는 지연 시간 (latency) 셀은 서식 오류가 아닙니다. AA의 0731 빌드 제공자 페이지에는 2026-08-01 스냅샷 시점에 속도나 첫 번째 토큰 생성 시간 (time-to-first-token) 데이터가 나열되지 않았으므로, 이 빌드에 대해 초당 토큰 수 (tokens-per-second) 수치를 인용하는 사람은 다른 것을 인용하고 있는 것입니다.
벤치마크 현황: 세 모델을 가르는 단 1점 차이
다음은 AA가 수치를 공개했던 4월 빌드와의 차이(delta)를 포함한 0731 빌드의 AA 세부 점수입니다.
| 평가 (Evaluation) | DeepSeek V4 Flash 0731 | 4월 빌드 대비 변화 (Change vs April build) |
|---|---|---|
| 지능 지수 (Intelligence Index) v4.1 | 50 | +10 |
| ... |
전지성 (Omniscience) 행은 사람들이 그냥 지나치는 부분입니다. AA는 이러한 개선이 더 많이 아는 것이 아니라 환각 (hallucinations)이 줄어든 데서 기인했다고 보고했으며, 정확도 (accuracy)는 평이한 수준입니다. 곧 실제 운영 트래픽 (production traffic)에 투입할 모델의 경우, "더 많이 아는 것"보다 "덜 틀리는 것"이 더 유용한 업그레이드이며, 이는 단일 종합 점수 (composite score)가 숨기는 종류의 특성입니다.
이번 릴리스에는 떠도는 수치 세트가 하나 이상 존재하므로, 두 가지 출처 노트를 남깁니다.
DeepSeek 자체 출시 자료는 Terminal-Bench 2.1에서 82.7, DeepSWE에서 54.4, Cybergym에서 76.7을 기록했다고 보고합니다. Artificial Analysis(AA)는 Terminal-Bench 2.1을 79%로 보고합니다. 두 수치 모두 맞을 수 있습니다. 하네스 (harnesses), 스캐폴드 (scaffolds), 그리고 노력 설정 (effort settings)이 다르며, 스냅샷 시점에 DeepSWE 및 Cybergym 수치에 대한 제3자의 재현은 없었습니다. 우리는 여기 있는 세 모델 모두에서 동일한 방식으로 측정된 유일한 수치인 AA의 수치를 전체적으로 사용합니다. 만약 어디선가 82.7이라는 수치를 보게 된다면, 그것은 벤더의 하네스(vendor's harness)를 사용한 것이지 모순이 아닙니다.
다른 하나는 다음과 같습니다. 저희를 포함한 대부분의 카탈로그 페이지에 DeepSeek V4 Flash와 연결된 LMArena 점수는 2026-07-12에 업데이트된, 70위권 순위와 함께 Overall 1438로 표시됩니다. 이는 0731 빌드보다 19일 앞선 것입니다. 즉, 4월 모델을 측정하고 있습니다. 새 빌드에 대한 Arena 점수는 새로운 투표가 필요하며, 그때까지 어떤 비교 페이지에서든 "DeepSeek V4 Flash" 옆에 놓인 숫자는 AA에서 10점 더 낮은 점수를 기록한 모델을 설명하고 있는 것입니다.
장황함의 세금 (The Verbosity Tax): 왜 표기 가격과 실제 청구 금액의 차이가 발생하는가
이 두 모델에 대한 모든 비교는 $0.14 대 $1.50라는 수치로 시작하여 거기서 멈춥니다. 그 비율은 실제이지만, 이 글에서 가장 신뢰할 수 없는 수치이기도 합니다. 왜냐하면 그것은 작업(job)이 아닌 토큰(token)당 가격을 매기기 때문입니다.
Artificial Analysis는 더 나은 것을 발표합니다. 즉, 각 모델을 동일한 Intelligence Index 제품군을 통해 실행하는 데 실제로 지불한 비용을 송장(invoice)과 함께 공개합니다.
| 모델 | 인덱스 실행을 위한 출력 토큰 (Output tokens) | AA의 실행 총 비용 |
|---|---|---|
| DeepSeek V4 Flash 0731 | 210M | $72.02 |
| ... |
동일한 평가에 대해 세 개의 실제 청구서가 나왔습니다. Gemini는 DeepSeek 비용의 10.1배이며, Luna는 2.7배입니다. 출력 가격 기준의 표기 비율인 27배 및 4.3배와 비교했을 때, 이는 가격표와 실제 송장 사이의 어딘가에서 DeepSeek의 서류상 이점 중 약 60%가 사라졌음을 의미합니다.
그 차이가 발생하는 지점은 토큰입니다. DeepSeek는 해당 제품군에 대해 210M의 출력 토큰을 사용한 반면, Gemini는 59M를 사용했으며, AA는 이를 업계 대비 매우 장황한(verbose) 것으로 표시합니다. 출력 부분만 정가로 계산하면 DeepSeek는 $58.80, Luna는 $156.00, Gemini는 $442.50가 되어, 해당 구간에서 7.5배의 격차가 발생합니다. 이에 따라 두 청구서의 구조도 달라집니다. 출력 비용은 DeepSeek 실행 비용의 약 82%, Gemini 실행 비용의 약 61%를 차지합니다. 이는 동일한 점수에 도달하기 위해 3.5배 더 많은 양을 쓰는 모델의 특징입니다. AA는 모델별 입력 토큰(input token) 수를 공개하지 않으므로, 나머지는 공개된 수치로부터 더 이상 분해할 수 없습니다.
어떤 수치를 기준으로 삼을지는 귀하의 트래픽에 달려 있습니다. 주로 프롬프트(prompt) 위주인 워크로드(workload)는 입력 비율인 10.7배를 따릅니다. 주로 생성(generation) 위주인 워크로드는 장황함(verbosity)으로 인해 7.5배 쪽으로 압축됩니다. AA의 엔드 투 엔드(end-to-end) 수치인 10.1배는 그 자체로 혼합된 형태인 테스트 스위트(suite) 상에서 그 사이의 값을 나타냅니다. 이것이 바로 예산 검토 시 방어해야 하는 어떤 작업에 대해서도 27배보다는 10배가 더 나은 기본값인 이유입니다.
토큰 수에 대한 두 가지 주의 사항이 있습니다. 이 수치들은 각 모델의 일반적인 프로덕션(production) 설정이라기보다는, AA의 최대 노력(max-effort) 및 높은 노력(high-effort) 구성에서 도출된 것으로 각 모델 범위 내에서 비용이 많이 드는 쪽입니다. 그리고 장황함(verbosity)은 워크로드에 따라 달라집니다. 어려운 추론 문제로 가득 찬 스위트는 짧게 추론하는 모델에 유리하게 작용하며, 귀하의 추출 파이프라인(extraction pipeline)은 그러한 스위트가 아닙니다.
두 가지 AA 수치가 유통되고 있으므로, 210M에 대한 각주를 하나 남깁니다. 모델 페이지에는 인덱스 실행(index run)에 대해 210M의 출력 토큰(output tokens)이 보고되어 있습니다. AA의 출시 기사에는 약 206M로 보고되어 있는데, 더 흥미로운 사실은 이것이 이전 V4 Flash 빌드가 사용한 것(~234M)보다 12% 적은 출력 토큰이라는 점입니다. 따라서 0731은 동급 모델들보다는 더 장황하지만, 이전 버전보다는 덜 장황합니다. 저희는 모델 페이지의 수치가 여기 있는 세 모델 모두에 대해 동일한 방식으로 게시되었기 때문에 전체적으로 210M를 사용합니다.
하지만 조절 가능한 레버(lever)는 실재하며, 이는 하나의 플래그(flag)입니다. DeepSeek의 문서에는 deepseek-v4-flash가 비사고(non-thinking) 모드와 사고(thinking) 모드를 모두 지원하며, 사고 모드가 기본값이고 추론 토큰(reasoning tokens)이 출력으로 청구된다고 명시되어 있습니다. 제한된 작업의 경우, 사고 모드를 끄는 것이 장황함 세금(verbosity tax)을 없애는 방법입니다.
귀하의 트래픽으로 직접 측정해 보세요
AA의 비율은 시작 단계의 추정치일 뿐, 귀하의 수치가 아닙니다. 귀하만의 수치를 얻으려면 실제 프롬프트 샘플을 대상으로 한 번 실행해 보면 됩니다. 모든 OpenAI 호환 응답에는 필요한 토큰 수(token counts)가 포함되어 있기 때문입니다:
import collections
from openai import OpenAI
...
50개의 대표적인 프롬프트(prompts)를 실행하는 데 드는 비용은 세 모델 모두 몇 센트에 불과하며, 이는 그 어떤 리더보드(leaderboard)보다 더 많은 것을 알려줄 것입니다. 주의 깊게 살펴봐야 할 두 가지가 있습니다. DeepSeek의 경우, 사고(thinking) 플래그를 켜고 끄는 것에 따라 출력 결과가 모델 선택보다 더 크게 변하므로 두 번 실행해 보십시오. 그리고 가장 어려운 케이스가 아닌, 실제 트래픽 분포에서 샘플을 추출하십시오. 어려운 추론 문제에서 측정된 장황함 비율(verbosity ratios)은 두 줄짜리 분류 작업으로 가득 찬 대기열에는 적용되지 않기 때문입니다.
가격 계산: 두 가지 실제 월간 청구서
아래의 모든 가격은 2026-08-01 스냅샷 기준, 벤더(vendor) 리스트의 1M 토큰당 가격입니다.
시나리오 A, 추출 파이프라인 (extraction pipeline). 캐싱(caching) 없이, 짧은 구조화된 출력(structured outputs)을 사용하는 월간 200M 입력 토큰 및 10M 출력 토큰.
| 모델 | 입력 비용 | 출력 비용 | 월간 총액 |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | $28.00 | $2.80 | $30.80 |
| ... | |||
| 입력 비용이 지배적이므로, 이 시나리오는 입력 가격 비율을 밀접하게 따릅니다. Gemini는 DeepSeek의 12배, Luna는 1.7배의 비용이 듭니다. 7월 30일의 가격 인하가 여기서 Luna의 위치를 얼마나 변화시켰는지 주목하십시오. 기존 가격인 $1 / $6 기준으로는 동일한 작업량이 월 $260였습니다. |
시나리오 B, 코딩 에이전트 루프 (coding agent loop). 70%의 캐시 히트율(cache hit rate)을 가진 100M 입력 토큰 및 월간 40M 출력 토큰.
| 모델 | 캐시된 입력 | 신규 입력 | 출력 | 월간 총액 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.20 | $4.20 | $11.20 | $15.60 |
| ... | ||||
| 해당 표는 토큰 수를 일정하게 유지하고 있는데, 이는 세 모델 모두 동일한 작업을 수행하기 위해 동일한 양을 작성한다는 점을 암묵적으로 가정하고 있습니다. 실제로는 그렇지 않습니다. 대신 '작업량(work)'을 일정하게 유지하고, 인덱스 실행에서 얻은 장황함 비율(verbosity ratios)에 따라 출력을 조정하면 동일한 에이전트 루프에 대해 더 공정한 그림을 얻을 수 있습니다: |
| 모델 | 동일 작업에 필요한 출력 토큰 | 월간 총액 |
|---|---|---|
| DeepSeek V4 Flash 0731 | 142M | $44.16 |
| ... | ||
| DeepSeek는 23배 저렴한 수준에서 8배 저렴한 수준으로 변합니다. 결정 자체는 바뀌지 않습니다. 하지만 슬라이드에 기입해야 할 숫자는 바뀌어야 합니다. |
DeepSeek에 대한 이 산술적 계산의 더 심층적인 버전, 즉 캐시 미스(cache misses)가 실제 청구서에 미치는 영향을 포함한 내용은 당사의 V4 Pro 비용 분석 및 DeepSeek V4 API 가격 가이드를 참조하십시오.
귀하의 청구서를 변화시킬 두 가지 가격 세부 사항
DeepSeek이 피크 시간대 가격제(peak-hour pricing)를 도입할 예정입니다. 해당 가격 문서에는 다음과 같은 각주가 달려 있습니다: API는 피크/오프피크(peak/off-peak) 정책을 채택할 예정이며, 이에 따라 피크 시간대 가격은 모든 청구 항목에 대해 일반 가격의 2배가 적용됩니다. 시행일은 공식 발표를 기다리는 중입니다. 피크 시간대는 베이징 시간(UTC+8) 기준 09:0012:00 및 14:0018:00입니다.
이것이 무해하다고 가정하기 전에 귀하의 시간대로 변환해 보십시오. 해당 시간대는 미국 동부 시간(US Eastern) 기준으로 21:0000:00 및 02:0006:00에 해당하며, 이는 미국 낮 시간대 워크로드(workload) 기준으로는 한밤중입니다. 또한 중앙 유럽 시간(Central European) 기준으로는 03:0006:00 및 08:0012:00에 해당하여 유럽 팀의 오전 시간 전체를 잡아먹습니다. 만약 귀하가 유럽에서 운영 중이고 DeepSeek이 이를 시행한다면, 귀하의 $0.14는 업무 시간의 전반부 동안 $0.28가 됩니다. 이는 여전히 Gemini보다는 저렴하지만, 귀하가 예산(budget)을 세웠던 숫자는 아닙니다.
귀하가 구매하는 경로에 따라 벤더의 리스트 가격(list price)이 다를 수 있습니다. OpenAI는 2026-07-30에 GPT-5.6 Luna의 가격을 $1 / $6에서 $0.20 / $1.20로 80% 인하했습니다. Azure를 통해 Luna를 제공하는 리스트는 2026-08-01 스냅샷 시점까지 변동이 없었으며, 당사의 데이터도 마찬가지입니다. 여기서 openai/gpt-5.6-luna는 $1 / $6의 리스트 가격을 보여주는 Azure 경로입니다. 동일한 모델 ID임에도 불구하고, 단순히 어떤 업스트림(upstream)에 접속하느냐에 따라 5배의 차이가 발생합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기