DeepSeek V4 Flash: 벤치마크, 가격 책정, 그리고 콘텐츠 에이전트에게 갖는 의미
요약
DeepSeek가 새로운 모델 V4-Flash를 출시하며 퍼블릭 베타를 시작했습니다. 이 모델은 높은 지능과 매우 낮은 가격을 동시에 갖추었으며, 특히 터미널 사용 및 도구 호출과 같은 에이전트적 작업에서 뛰어난 성능을 보입니다.
핵심 포인트
- V4-Flash는 높은 지능과 최저 수준의 가격 경쟁력을 동시에 보유함
- 터미널 사용, 도구 호출, 다단계 엔지니어링 작업에서 강력한 성능 발휘
- 사후 학습(Post-training)을 통해 이전 프리뷰 모델 대비 성능 대폭 향상
- 텍스트 입출력 전용 모델로 이미지나 오디오 입력은 지원하지 않음
원문은 the Cosmic blog에 처음 게시되었습니다.
DeepSeek는 2026년 7월 31일에 V4-Flash를 출시했으며, API를 통해 deepseek-v4-flash라는 모델명으로 퍼블릭 베타 (public beta)를 시작했습니다. 이 모델은 출시 몇 시간 만에 Hacker News의 메인 페이지에 두 번이나 올랐습니다.
헤드라인은 요약하기 쉽습니다: 지능 순위에서는 최상위권에, 가격 순위에서는 최하위권에 위치한다는 것입니다. 세부 사항은 헤드라인보다 더 흥미로우며, 그중 하나는 토큰당 가격(per-token price)이 보여주지 못하는 방식으로 비용 계산 방식을 변화시킵니다.
무엇이 출시되었는지, 수치가 무엇을 말하는지, 그리고 이와 같은 모델이 콘텐츠 파이프라인 (content pipeline)에서 어디에 위치하는지 설명하겠습니다.
실제로 출시된 것
DeepSeek의 공식 변경 로그 (changelog)에 따르면, V4-Flash는 이전의 V4-Flash-Preview와 **동일한 아키텍처 (architecture) 및 동일한 파라미터 크기 (parameter size)**를 사용합니다. 유일한 변화는 사후 학습 (post-training)입니다. DeepSeek는 모델을 다시 사후 학습시켰으며, V4-Pro-Preview보다 크게 도약한 점수를 보고했습니다.
출시와 관련된 몇 가지 실질적인 참고 사항은 다음과 같습니다:
- 이 모델은 API에서 퍼블릭 베타 (public beta) 상태입니다.
- **Responses API 형식을 네이티브로 지원 (natively supports)**하며 Codex에 맞춰 조정되었습니다.
- V4-Pro API, 앱 및 웹 환경은 변경되지 않았습니다. 공식적인 V4-Pro 출시는 아직 예정되어 있습니다.
- 독립적인 측정에 따르면 **284B 파라미터 (parameters)**를 보유하고 있으나, 가중치 (weights)는 공개되지 않았습니다.
- 텍스트 입력, 텍스트 출력 (text in, text out) 방식입니다. 이미지, 오디오 또는 비디오 입력은 지원하지 않습니다.
스크린샷이나 PDF를 처리하는 워크플로 (workflow)에 이 모델을 투입하기를 기대했다면 마지막 항목이 중요합니다. 적어도 직접적으로는 불가능합니다.
벤치마크 수치
DeepSeek는 자체적인 DeepSeek Harness를 사용하여 최대 노력 모드, top_p 0.95, temperature 1.0 환경에서 평가된 다음 점수들을 공개했습니다:
| 벤치마크 (Benchmark) | 점수 (Score) |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| ... | ... |
단일 행의 수치보다는 해당 표의 전반적인 형태를 읽어야 합니다. 가장 강력한 결과들은 터미널 사용 (terminal use), 도구 호출 (tool calling), 그리고 다단계 엔지니어링 작업 (multi-step engineering work) 부근에 집중되어 있습니다. 82.7점을 기록한 Terminal Bench와 70.3점을 기록한 Toolathlon은 단순한 상식 암기 테스트가 아닌 에이전트적 평가 (agentic evaluations)입니다. 이는 소프트웨어를 작동시키도록 튜닝된 모델임을 의미합니다.
하단의 두 행은 솔직한 주의 사항이 필요합니다. Agent Last Exam과 Automation Bench는 의도적으로 매우 가혹하게 설계된 장기적 관점 (long-horizon)의 평가로, 현재 프런티어 (frontier) 모델들 사이에서도 20점대의 점수가 일반적입니다. 25.2점은 실패가 아닙니다. 이는 완전히 자율적으로 몇 시간 동안 작업을 완료하는 것이 아직 모든 이들에게 해결되지 않은 과제임을 상기시켜 주는 지표입니다.
명확히 언급할 가치가 있는 주의 사항이 하나 더 있습니다. 이 수치들은 벤더 (vendor)가 자체적인 하네스 (harness)를 사용하여 최대 노력 설정으로 산출하여 발표한 수치입니다. 이를 강력한 신호로 받아들이되, 중요한 작업을 이전하기 전에는 반드시 자체 평가 (evals)를 통해 검증하십시오.
Artificial Analysis의 독립적인 측정에 따르면, V4-Flash는 지능 지수 (Intelligence Index) 50를 기록하며, 해당 클래스 내 162개 모델 중 2위를 차지했습니다 (해당 클래스 중앙값은 17입니다).
가격 이야기, 그리고 사람들이 놓칠 부분
순수 API 가격 측면에서 V4-Flash는 해당 클래스 내 162개 모델 중 1위를 차지합니다:
- 입력 토큰 100만 개당 $0.14
- 출력 토큰 100만 개당 $0.28
- 캐시된 입력 토큰 100만 개당 $0.003 (캐시 히트 시 98% 할인)
- 혼합 토큰 100만 개당 $0.06
- 100만 토큰 컨텍스트 윈도우 (context window)
주의 깊게 봐야 할 숫자는 바로 그 캐시 히트 (cache-hit) 가격이며, 사람들은 대개 이 부분을 그냥 지나칩니다. 동일한 시스템 프롬프트 (system prompt), 동일한 스키마 정의 (schema definitions), 그리고 동일한 스타일 가이드를 사용하여 반복적으로 실행되는 에이전트의 경우, 모든 요청의 고정된 접두사 (prefix)는 동일합니다. 캐싱은 이 접두사를 반복되는 비용에서 무시해도 될 수준의 오차 (rounding error)로 바꿔 놓습니다.
이제 함정이 있습니다.
Artificial Analysis는 또한 **장황함 (verbosity)**을 측정했으며, V4-Flash는 Intelligence Index를 완료하기 위해 중앙값인 62M 토큰에 비해 **210M 출력 토큰 (output tokens)**을 소비했습니다. 이는 출력 효율성 측면에서 162개 모델 중 58위에 해당합니다. 점수에 도달하기 위해 중앙값보다 약 3.5배 더 많은 토큰을 생성한 것입니다.
저렴한 토큰과 저렴한 작업은 서로 다른 두 가지 측정 기준입니다. 토큰당 가격이 3분의 1인 모델이 3배의 토큰을 배출한다면, 당신의 절약분은 이미 소진된 것입니다. Intelligence Index에서 V4-Flash를 평가하는 데 드는 총 비용은 $72.02로, 이는 진정으로 낮은 수준이기에 경제성은 여전히 잘 맞아떨어집니다. 여기서 얻을 수 있는 교훈은, 단순히 백만 토큰당 가격 (price-per-million) 열만 읽고 멈추는 대신, 당신의 워크로드(workload)에 대해 **완료된 작업당 비용 (cost per completed task)**을 벤치마크해야 한다는 것입니다.
만약 당신의 워크로드가 지연 시간 (latency)에 민감하다면, 장황함 수치는 처리량 (throughput)에 대한 경고이기도 합니다. 더 많은 토큰은 마지막 토큰까지 도달하는 데 더 많은 시간이 걸림을 의미합니다.
콘텐츠 파이프라인에서의 위치
강력한 도구 호출 (tool-calling) 점수, 1M 토큰 컨텍스트 창 (context window), 그리고 98%의 캐시 할인 (cache discount)은 특정한 종류의 유용함을 설명합니다: 바로 **구조화된 콘텐츠를 읽고 쓰는 장기 실행 에이전트 (long-running agents)**입니다.
이것은 실제적인 워크로드입니다. 콘텐츠 라이브러리를 6개의 로케일 (locales)로 번역하는 것, 폐기된 제품 주장(product claim)이 있는지 모든 게시물을 감사하는 것, 수천 개의 객체에 걸쳐 메타 설명 (meta descriptions)을 재생성하는 것, 릴리스 노트와 변경 로그 (changelog)를 동기화하는 것 등이 있습니다. 이러한 작업들은 반복적이고, 스키마에 종속적이며, 최첨단 (frontier) 모델 가격으로는 비용이 많이 듭니다. 이는 바로 저렴하고, 캐시 친화적이며, 도구 사용 능력을 갖춘 모델이 제 자리를 잡을 수 있는 전형적인 프로필입니다.
여기서 1M 컨텍스트 창이 중요한 특정 이유가 있습니다. 콘텐츠 운영은 대개 넓지만 얕은 (broad but shallow) 컨텍스트를 필요로 하는 경향이 있습니다: 즉, 각 객체는 상당히 작지만 레코드의 수는 매우 많은 형태입니다. 작은 컨텍스트 창을 우회하기 위해 검색 레이어 (retrieval layer)를 구축하는 대신, 전체 콘텐츠 모델과 수백 개의 객체를 단일 요청에 넣어 모델이 그 전체를 가로질러 추론하게 할 수 있습니다.
Cosmic를 사용하면, 해당 루프의 읽기 측면은 몇 줄로 끝납니다. 필요한 객체와 필드를 가져오면 됩니다:
import { createBucketClient } from '@cosmicjs/sdk';
const cosmic = createBucketClient({
...
.props()가 실제 요청한 필드로만 페이로드 (payload)를 제한하기 때문에, 소스 단계에서 직접 토큰 비용을 제어할 수 있습니다. 200개의 슬러그 (slug)와 메타 설명 (meta description)을 보내는 비용은 200개의 전체 포스트 본문을 보내는 비용의 아주 일부분에 불과합니다.
그 다음 이 배치 (batch)를 모델에 전달합니다. API가 OpenAI와 호환되므로, 이미 사용 중인 클라이언트를 그대로 사용할 수 있습니다:
const response = await fetch('https://api.deepseek.com/chat/completions', {
method: 'POST',
headers: {
...
STYLE_GUIDE를 실행 간에 바이트 단위로 동일하게 유지하여 캐싱 (cacheable)이 가능하도록 하세요. 가변적인 콘텐츠는 사용자 메시지 (user message)에 넣으십시오. 이 한 가지 원칙을 지키는 것이 실제 청구서에서 98%의 캐시 할인 혜택을 실현하는 핵심입니다.
SDK를 통해 결과를 다시 기록하면 루프가 완성됩니다. 모든 변경 사항은 데이터베이스에 직접 쓰는 대신 버전이 지정된 객체 (versioned object)로 저장되므로, 에이전트가 무엇을 변경했는지에 대한 감사 추적 (audit trail)을 유지할 수 있습니다.
전환해야 할까요?
현재 시점에서의 합리적인 판단은 다음과 같습니다:
V4-Flash에 적합한 경우
- 작업당 비용이 지배적인 대량의 반복적인 콘텐츠 작업
- 벤치마크 성능이 가장 강력한 에이전트 중심 (Agentic) 및 터미널 지향적 작업
- 캐시를 활용할 수 있는 크고 안정적인 프롬프트 접두사 (prompt prefix)를 가진 워크로드
- 많은 레코드에 걸쳐 광범위한 컨텍스트 (context)가 필요한 작업
다른 대안을 찾아야 하는 경우
- 모델이 텍스트 전용이므로 이미지, 오디오 또는 비디오 입력이 필요한 모든 경우
- 상세함 (verbosity) 수치를 고려할 때, 지연 시간 (latency)에 민감한 사용자 대면 상호작용
- 퍼블릭 베타 API를 허용할 수 없는 프로덕션 시스템
- 여기서는 제공되지 않는 오픈 웨이트 (open weights)가 필요한 배포
솔직한 요약: 이 모델은 강력하고 저렴하며 도구 사용 능력을 갖춘 텍스트 모델로, 백그라운드 콘텐츠 작업에 매우 적합하지만, 멀티모달 (multimodal) 또는 지연 시간에 민감한 경로에는 아직 적절한 선택이 아닙니다. 확정하기 전에 자체 평가 (evals)를 통해 실행해 보십시오.
모델이 연결될 파이프라인 구축하기
모델 리더보드(Model leaderboards)는 계속해서 변동될 것입니다. 이러한 출시 모델을 제대로 활용할 수 있는지 여부를 결정하는 것은 귀하의 콘텐츠 레이어(content layer)가 API 우선(API-first) 방식인지 여부입니다. 그래야만 모델을 교체하는 것이 마이그레이션(migration)이 아닌 단순한 설정 변경(config change)이 될 수 있습니다.
그것이 바로 Cosmic이 존재하는 이유입니다. 귀하의 콘텐츠는 REST API와 TypeScript SDK를 갖춘 헤드리스 CMS(headless CMS)에 저장되므로, 어떤 모델, 에이전트(agent), 또는 프레임워크라도 이를 읽고 쓸 수 있습니다. 다음 달에 더 저렴하거나 더 똑똑한 모델이 출시되면, 그 모델을 지정하기만 하면 됩니다.
- 무료로 구축을 시작하고 몇 분 안에 버킷(bucket)을 연결하세요
- 내장된 기능을 확인하려면 **AI 기능 개요**를 읽어보세요
- 코딩 에이전트(coding agents)도 비교 중이신가요? 저희의 **Claude Code vs GitHub Copilot vs Cursor 분석**을 확인하세요
- 팀 규모로 운영하시나요? 저희 CEO와 15분 상담을 예약하세요
이 포스트의 벤치마크(Benchmark) 점수는 2026년 7월 31일 자 DeepSeek의 공식 변경 로그(changelog)를 바탕으로 합니다. 가격, 지능 지수(Intelligence Index), 파라미터 수(parameter count), 그리고 상세도(verbosity) 수치는 Artificial Analysis의 자료입니다. 공급업체가 발표한 벤치마크는 DeepSeek 자체 하네스(harness)를 사용하여 최대 노력 설정(max effort settings)으로 생성되었으므로, 귀하의 워크로드(workload)를 통해 직접 검증하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기