DeepSeek V4 Flash 0731: $0.14/M의 프런티어 코딩 성능
요약
DeepSeek V4 Flash 0731은 매우 저렴한 비용으로 프런티어급 코딩 성능을 제공하는 소형 에이전트 모델입니다. 동일한 아키텍처임에도 훈련 및 사후 훈련 최적화를 통해 벤치마크 성능을 대폭 향상시켰습니다.
핵심 포인트
- Terminal-Bench 2.1에서 82.7점을 기록하며 높은 에이전트 성능 증명
- 입력 토큰 100만 개당 $0.14의 압도적인 비용 효율성 제공
- 아키텍처 변경 없이 훈련 최적화만으로 성능을 21점 끌어올림
- Codex 호환성 추가로 기존 에이전트 환경에 즉시 교체 가능
DeepSeek V4 Flash 0731은 2026년 7월 31일에 출시된 DeepSeek의 소형 에이전트 모델(small agentic model)의 프로덕션 버전입니다. 이 모델은 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28를 부과하면서 Terminal-Bench 2.1에서 82.7점을 기록했습니다. 이는 에이전트 벤치마크에서 DeepSeek 자체의 1.6조 파라미터(parameter) 규모인 Pro 모델을 능가하며, GPT-5.6 Sol과 약 3점 차이 이내로 근접하면서도 입력 비용은 약 1/35 수준입니다. 만약 프로덕션 환경에서 코딩 에이전트(coding agent)를 운영하고 있다면, 이 출시는 여러분의 단위 경제성(unit economics)을 변화시킬 것입니다.
여러분을 멈춰 세워야 할 숫자는 82.7이 아닙니다. 바로 그 차이(delta)입니다. 동일한 모델의 프리뷰 빌드는 61.8점을 기록했습니다. 동일한 아키텍처(architecture), 동일한 파라미터 수, 모든 것이 동일함에도 불구하고 — DeepSeek는 순수하게 훈련(training) 및 사후 훈련(post-training) 작업을 통해 어려운 에이전트 벤치마크에서 모델 성능을 21점 끌어올렸습니다. 이는 소형 모델의 남은 잠재력이 실제로 어디에 있는지를 보여주는 매우 강력한 메시지입니다.
아래에서는 전체 벤치마크 현황, 프런티어 연구소(frontier labs)들과의 실제 가격 비교, "동일한 아키텍처"가 실제로 의미하는 바, 그리고 전환하지 말아야 할 솔직한 이유를 다룹니다.
핵심 요약 (Key Takeaways)
- DeepSeek V4 Flash 0731은 Terminal-Bench 2.1에서 82.7점을 기록했으며, 이는 프리뷰 빌드의 61.8점과 V4-Pro-Preview의 72.1점보다 높은 수치입니다.
- 가격은 캐시 미스(cache miss) 시 입력 $0.14/M, 캐시 히트(cache hit) 시 $0.0028/M, 출력 $0.28/M이며, 2,500개 요청의 동시성 제한(concurrency limit)이 있습니다.
- 아키텍처는 프리뷰와 동일하게 유지되었습니다: 총 284B 파라미터, 13B 활성 파라미터, 1M 토큰 컨텍스트(context). 이는 새로운 모델이 아닌 훈련 업그레이드였습니다.
- 동일한 벤치마크에서 Z.AI의 GLM-5.2(81.0)를 능가하며, Claude Opus 4.8(85.0)에는 약 2점 뒤처집니다.
- 이번 출시로 Codex 호환성이 추가되어, 기존 에이전트 하네스(agent harnesses)에 거의 그대로 교체하여 사용할 수 있습니다.
DeepSeek V4 Flash 0731이란 무엇인가?
DeepSeek V4 Flash 0731은 공개 프리뷰 기간을 거쳐 2026년 7월 31일에 출시된 DeepSeek V4 제품군 중 Flash 계층의 0731 날짜 기준 프로덕션 체크포인트 (production checkpoint)입니다. V4 라인업은 2026년 4월 두 가지 모델로 출시되었습니다: 총 파라미터(total parameters) 1.6조 개 중 토큰당 약 490억 개가 활성화되는 V4 Pro, 그리고 총 2,840억 개 중 약 130억 개가 활성화되는 V4 Flash입니다. 두 모델 모두 100만 토큰의 컨텍스트 윈도우 (context window)를 공유합니다.
DeepSeek는 이번 출시가 프리뷰 버전과 아키텍처(architecture) 및 파라미터 수(parameter count)가 동일하다는 점을 이례적일 정도로 명확히 밝혔습니다. MarkTechPost의 보도에 따르면, 성능 향상은 더 큰 네트워크가 아닌 학습(training) 및 사후 학습(post-training)에서 비롯되었습니다. 리더보드(leaderboards)를 쫓기 위해 실험실(labs)들이 조용히 파라미터 수를 부풀리는 것을 지켜봐 온 사람들에게, 이러한 투명성 그 자체만으로도 충분한 가치가 있습니다.
우리는 이 제품군이 출시되었을 때 DeepSeek V4와 하이브리드 희소 어텐션 (hybrid sparse attention)에서 기반 아키텍처를 다룬 바 있습니다. 이 가격대에서 100만 토큰 윈도우를 저렴하게 사용할 수 있게 만드는 메커니즘이 바로 여기서도 작동하고 있습니다.
DeepSeek V4 Flash의 벤치마크 및 가격 비교는 어떠한가?
Terminal-Bench 2.1에서 DeepSeek V4 Flash 0731은 82.7점을 기록하여, Z.AI의 GLM-5.2(81.0점)보다는 높고 Claude Opus 4.8(85.0점)보다는 낮은 점수를 받았습니다. 가격 측면에서는 비교 대상이 없습니다. 100만 토큰당 입력 $0.14, 출력 $0.28라는 가격은 모든 프런티어 모델 (frontier model)보다 한 자릿수(order of magnitude) 이상 저렴합니다.
| 모델 | Terminal-Bench 2.1 | 입력 $/M | 출력 $/M |
|---|---|---|---|
| Claude Opus 4.8 | 85.0 | — | — |
| ... |
현실적인 에이전트 워크로드 (agent workload)에 대해 산술적 계산을 해보겠습니다. 하루에 8M의 입력 토큰과 2M의 출력 토큰을 사용하는 코딩 에이전트 (coding agent)를 GPT-5.6 Sol의 정가로 운영할 경우 하루 비용은 약 $100입니다. V4 Flash 0731에서 동일한 워크로드를 실행하면 비용은 약 $1.68입니다. 한 달로 계산하면 약 $50 대 $3,000이며, 캐시 히트 (cache hits)가 $0.0028/M인 경우, 대규모의 안정적인 시스템 접두사 (system prefix)를 가진 워크로드는 비용이 훨씬 더 낮아집니다.
시장 최상위 모델에서 무엇을 포기하게 되는지에 대한 맥락은 Claude Opus 5와 Grok 4.5에 대한 분석 내용을 참조하십시오. 프런티어 (frontier)는 여전히 프런티어입니다. 2026년의 질문은 당신이 실제로 그것을 얼마나 자주 필요로 하느냐입니다.
왜 학습 전용 업데이트가 21포인트를 올렸을까요?
Terminal-Bench는 지식이 아니라 에이전트 역량 (agentic competence)을 측정하며, 에이전트 역량은 대부분 사후 학습 (post-training)의 문제이기 때문입니다. 이 벤치마크는 실제 터미널 (terminal) 내부에서 모델을 실행하여 실제 다단계 작업 (multi-step tasks) — 출력 읽기, 오류로부터의 복구, 작업 완료 시점 결정 — 을 수행하게 합니다. 모델이 bash에 대해 모든 것을 알고 있더라도, 언제 재시도를 멈춰야 할지를 모른다면 실패할 수 있습니다.
이러한 기술 세트는 궤적 (trajectories)에 대한 강화학습 (reinforcement learning), 도구 사용 (tool-use) 포맷팅, 그리고 실패 복구 데이터에 매우 크게 반응합니다. 이 중 어떤 것도 더 많은 파라미터 (parameters)를 필요로 하지 않습니다. 61.8에서 82.7로의 도약은 소형 모델의 에이전트 성능이 용량 (capacity)이 아닌 사후 학습 데이터에 의해 병목 현상 (bottleneck)을 겪고 있었다는 가장 명확한 공개적 증거이며, 이는 직접적인 함의를 갖습니다: 에이전트 작업에서 오픈 모델 (open models)과 폐쇄형 모델 (closed models) 사이의 격차는 파라미터 수로 추정하는 것보다 더 좁고 변동성이 크다는 것입니다.
에이전트를 V4 Flash 0731로 전환해야 할까요?
대량의 잘 정의된 범위(well-scoped)를 가진 에이전트 작업의 경우: 네, 이번 주에 평가를 실행해 보십시오. 양이 적고 어렵고 모호한 작업의 경우: 아마도 아닐 것입니다. 그 이유는 벤치마크 점수 때문이 아닙니다.
이전(migrate)하기 전에 확인해야 할 세 가지 사항:
- 동시성 상한 (Concurrency ceiling). 공표된 제한은 2,500개의 동시 요청(concurrent requests)입니다. 이는 대부분의 팀에게는 관대한 수준이지만, 일부 팀에게는 거대한 벽이 될 수 있습니다. 귀사의 피크 팬아웃(peak fan-out)이 이 범위 내에 있는지 확인하십시오.
- Codex 호환성, 그러나 테스트 환경(harness)을 검증하십시오. 0731 릴리스는 Codex 지원을 추가하여 기존 에이전트 스캐폴드(agent scaffolds)에 즉시 적용(drop-in)할 수 있는 수준에 근접했습니다. 이 문장에서 "근접했다"는 표현은 매우 중요합니다. 도구 호출(tool-call) 형식의 예외 케이스(edge cases)가 바로 마이그레이션이 실패하는 지점이기 때문입니다.
- 데이터 거주성 (Data residency). DeepSeek의 API는 중국에서 호스팅됩니다. 많은 기업 구매자들에게 이는 가격이나 점수와 관계없이 강력한 차단 요소(hard blocker)이며, 이는 우리가 중국 AI 모델이 현재 기업 API 트래픽의 최대 46%를 차지하고 있다고 기록한 내용과 정확히 일치하는 분기점입니다.
세 번째 사항은 실제 조달(procurement) 논의의 대부분을 결정짓는 요소이지만, 벤치마크 관련 보도에서는 거의 언급되지 않습니다.
코드로 DeepSeek V4 Flash 0731 호출하기
API는 OpenAI와 호환되므로, 기존 클라이언트를 마이그레이션하는 것은 베이스 URL(base-URL)과 모델 이름(model-name)을 변경하는 작업입니다. 다음은 최소한의 요청 예시입니다:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
...
시스템 프롬프트(system prompt)는 의도적으로 첫 번째 메시지로 설정되어 있으며 의도적으로 안정적입니다. 이것이 캐시 히트(cache hits)를 가능하게 만드는 핵심입니다. 캐시 미스(miss) 시 100만 토큰당 $0.14인 것에 비해, 캐시된 입력 토큰은 $0.0028이므로, 안정적인 접두사(prefix)를 사용하면 매 호출의 반복되는 부분에 대해 50배의 할인 효과를 얻을 수 있습니다. 불변하는 부분(invariant part)이 항상 먼저 오도록 메시지 순서를 구성하십시오.
엔지니어링 작업을 시작하기 전, 마이그레이션의 가치를 빠르게 검증(sanity-check)할 수 있는 방법은 다음과 같습니다:
# 에이전트 워크로드의 대략적인 월간 비용, 2026년 8월 기준 정가
def monthly_cost(in_tok_per_day, out_tok_per_day, in_price, out_price, days=30):
return days * (in_tok_per_day / 1e6 * in_price + out_tok_per_day / 1e6 * out_price)
...
벤치마크 점수를 두고 논쟁하기 전에, 여러분의 실제 토큰 사용량으로 직접 실행해 보십시오. 대부분의 에이전트 워크로드(agent workloads)에서는 출력 토큰(output-token) 가격이 지배적이며, 바로 그 지점에서 100배 이상의 가격 차이가 발생합니다.
이러한 마이그레이션을 수행하며 얻은 실질적인 경고 사항은 다음과 같습니다: 저렴한 모델은 실패를 덜 하는 것이 아니라, '다르게' 실패합니다. 혼란을 겪는 프런티어 모델(frontier model)은 대개 그렇다고 말하는 경향이 있습니다. 반면 혼란을 겪는 소형 모델(small model)은 그럴듯해 보이는 잘못된 패치(patch)를 자신 있게 생성하는 경향이 있습니다. 더 강력한 검증(verification) — 테스트 실행, 차이점 검토(diff review) 단계, 두 번째 모델을 통한 확인 — 을 위한 예산을 책정하십시오. 그리고 절약한 비용의 일부를 이러한 실패 모드(failure mode)를 잡아내는 데 사용하십시오.
모두가 놓치고 있는 관점: 이것은 채팅창이 아니라 에이전트 루프(agent loop)의 가격을 재설정한 것입니다
대부분의 보도는 V4 Flash를 다른 모델과 토큰당 가격 기준으로 비교합니다. 그러한 프레임워크는 실제로 일어난 일을 과소평가합니다.
에이전트 워크로드는 채팅과는 다른 방식으로 토큰을 갈구합니다(token-hungry). 에이전트는 매 단계마다 컨텍스트(context)를 다시 읽고, 다시 계획하고, 재시도하며, 실패한 분기(branches)에서 토큰을 소모합니다. 단 하나의 사소하지 않은 작업도 50에서 200번의 모델 호출(model calls)이 필요할 수 있습니다. 입력(input) 비용이 1M당 $5일 때, 팀들은 비용을 제어하기 위해 반복 횟수를 제한하고, 컨텍스트를 줄이며, 검증 단계를 건너뛰는 방식으로 설계를 합니다. 하지만 1M당 $0.14라면, 이러한 제약 사항들은 더 이상 구속력을 갖지 않습니다.
이는 실제 효과가 "같은 에이전트를 더 저렴하게 사용하는 것"이 아님을 의미합니다. 그것은 _다른 에이전트_를 의미합니다. 즉, 자신의 작업을 재확인하고, 세 가지 후보 솔루션을 실행하여 최선의 것을 선택하거나, 요약본을 보고 추측하는 대신 전체 리포지토리(repo)를 다시 읽을 여유가 있는 에이전트 말입니다. 저렴한 토큰은 단순히 청구 금액을 줄이는 것에 그치지 않습니다. 이전에는 경제성이 없었던 전략들을 해제(unlock)합니다. 이번 릴리스를 통해 승리하는 팀은 단순히 베이스 URL(base URL)을 교체하는 팀이 아니라, 자신들의 루프(loop)를 재설계하는 팀이 될 것입니다.
이는 로컬 추론 (local inference)을 흥미롭게 만들었던 것과 동일한 역학입니다. 동일한 논거에 대한 셀프 호스팅 (self-hosted) 버전을 보려면 vLLM vs Ollama를 참조하세요.
자주 묻는 질문 (Frequently Asked Questions)
DeepSeek V4 Flash 0731은 무엇인가요?
DeepSeek V4 Flash 0731은 2026년 7월 31일에 출시된 DeepSeek의 소형 에이전트 모델 (small agentic model)의 프로덕션 릴리스 (production release)입니다. 총 파라미터 수는 2,840억 개이며 활성 파라미터는 130억 개입니다. 1M 토큰의 컨텍스트 윈도우 (context window)를 제공하며, 입력/출력 토큰 100만 개당 $0.14/$0.28의 비용으로 Terminal-Bench 2.1에서 82.7점을 기록했습니다.
DeepSeek V4 Flash의 비용은 얼마인가요?
캐시 미스 (cache miss) 시 입력 토큰 100만 개당 $0.14, 캐시 히트 (cache hit) 시 100만 개당 $0.0028이며, 출력 토큰 100만 개당 $0.28입니다. 이는 $5.00/M인 GPT-5.6 Sol과 비교했을 때 입력 비용이 대략 35배 저렴합니다.
DeepSeek V4 Flash가 DeepSeek V4 Pro보다 나은가요?
에이전트 벤치마크 (agent benchmarks) 기준으로는 그렇습니다. V4 Flash 0731은 크기가 약 5분의 1 수준임에도 불구하고, V4 Pro 프리뷰 (preview)의 72.1점에 비해 Terminal-Bench 2.1에서 82.7점을 기록했습니다. Pro는 지식 집약적인 일부 작업에서 우위를 유지하지만, 터미널 기반의 에이전트 작업에서는 이제 더 작은 모델이 앞서고 있습니다.
DeepSeek V4 Flash 0731은 Codex와 호환되나요?
네. 0731 릴리스에서 Codex 호환성이 추가되어, 기존 에이전트 하네스 (agent harnesses)에서 즉시 교체 가능한 수준에 근접했습니다. 프로덕션 파이프라인 (production pipeline)을 마이그레이션하기 전에 도구 호출 (tool-call) 포맷을 테스트하십시오.
Terminal-Bench 2.1은 무엇인가요?
Terminal-Bench는 실제 터미널 내에서 모델을 실행하여 다단계 엔지니어링 작업에 대해 수행하며, 작업이 실제로 완료되었는지 여부를 점수화하는 에이전트 벤치마크 (agentic benchmark)입니다. 이는 회상 (recall)보다는 오류 복구 (error recovery)와 도구 사용 (tool use)을 측정하며, 이것이 사후 학습 (post-training) 개선이 점수를 급격히 끌어올리는 이유입니다.
DeepSeek V4 Flash는 오픈 웨이트 (open weights)인가요?
DeepSeek는 역사적으로 모델의 오픈 웨이트를 공개해 왔으나, 0731 체크포인트 (checkpoint)는 주로 API를 통해 배포됩니다. 2026년의 진정한 오픈 웨이트 프런티어 (open-weight frontier) 대안을 찾는다면, Apache 2.0 라이선스로 출시된 Thinking Machines의 Inkling을 살펴보십시오.
결론 (The verdict)
DeepSeek V4 Flash 0731은 2026년 8월 기준으로 에이전트 기반 코딩 (agentic coding)을 위해 사용할 수 있는 최고의 가성비 모델이며, 경쟁 모델들과의 격차는 매우 큽니다. 프런티어 모델 가격 대비 오차 범위 수준의 비용으로 Terminal-Bench에서 Claude Opus 4.8보다 단 두 점 뒤처진다는 것은, 시장 세그먼트를 단순히 자극하는 수준이 아니라 시장의 판도를 재편하는 결과입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기