DeepSeek V4 Flash 공식 출시: 모델 카드와 config.json을 통한 'Flash가 Pro를 능가한다'는 주체 검증
요약
DeepSeek V4 Flash 모델의 공식 출시와 함께 모델 카드 및 config.json을 통한 아키텍처 분석을 수행합니다. Flash 모델이 이전 Pro 버전보다 적은 활성화 파라미터로도 우수한 벤치마크 성능을 보임을 검증합니다.
핵심 포인트
- DeepSeek V4 Flash는 9개 에이전트 벤치마크에서 V4-Pro를 능가함
- config.json 분석 결과 100만 토큰의 컨텍스트 길이를 지원함
- MoE 구조를 통해 전체 284B 파라미터 중 토큰당 약 3.5%만 활성화
- FP8 및 FP4 양자화 기술을 적용하여 효율적인 추론 설계
주장
DeepSeek-V4-Flash-0731이 이제 공식 V4 Flash 버전으로 출시되어 프리뷰 버전을 대체했습니다. 모델 카드는 나열된 9가지 에이전트 벤치마크 모두에서 Flash-0731이 '훨씬 작은 활성화 파라미터 수에도 불구하고' V4-Pro (Preview)를 능가한다고 명시하고 있습니다. 이는 강력한 주장인 만큼, 저는 두 가지 방식으로 이를 확인했습니다: 표의 산술 계산과 config.json에 명시된 아키텍처 분석입니다.
9/9, 행별 검증
| Benchmark | Flash-0731 | V4-Pro (Preview) | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 72.1 | 81.0 | 85.0 |
| ... |
Flash-0731은 V4-Pro (Preview)를 상대로 9/9로 승리하고, GLM-5.2가 점수를 기록한 8개 행 모두에서 승리하며, Opus-4.8에게는 9개 행 모두 패배했습니다. 가장 근접했던 마진은 Agents' Last Exam(25.2 대 25.7)과 AutomationBench(25.1 대 27.2)였습니다. '광범위하게 경쟁적이다(Broadly competitive)'라는 표현이 정확합니다: 앞서가기보다는 근접하다는 의미입니다. 카드 자체의 주의사항도 있습니다: 모든 수치는 DeepSeek 자체 평가(DeepSeek Harness 최소 모드, 최대 추론 노력)이며, 두 DSBench 세트는 내부 DeepSeek 테스트 세트임을 나타내는 † 표시가 되어 있습니다. 이 중 어느 것도 독립적으로 재현되지 않았습니다.
config.json이 말하는 것
공개된 config를 살펴보면: model_type은 deepseek_v4, 층(layers)은 43개, hidden_size는 4096, 어텐션 헤드(attention heads)는 단일 KV 헤드를 가진 64개가 사용되었으며, vocab은 129,280, max_position_embeddings는 1,048,576 — 즉 $2^{20}$이므로 논문의 제목에 언급된 '백만 토큰 컨텍스트'가 문자 그대로 사실임을 알 수 있습니다. MoE(Mixture-of-Experts) 구조는 레이어당 256개의 라우팅 전문가와 1개의 공유 전문가로 구성되어 있으며, 토큰당 6개의 라우팅 전문가가 활성화되고 전문가 중간 크기(expert intermediate size)는 단지 2048입니다. 밀집 가중치(Dense weights)는 FP8 (E4M3, 동적 활성화)이며, expert_dtype은 fp4입니다 — 전문가는 설계상 4비트로 전송됩니다.
284B와 304B의 조화
전문가 1개 = up (4096×2048) + gate (4096×2048) + down (2048×4096) = 25,165,824개의 파라미터 (parameters). 43 × 256 = 11,008개의 라우팅된 전문가 (routed experts)를 고려하면, 라우팅된 전문가만으로 약 277.0B에 달합니다. 공유 전문가 (shared experts), 밀집 어텐션 (dense attention), 그리고 (비공유) 임베딩 (embeddings) 및 헤드 (head)를 더하면 약 284B가 되며, 이는 unsloth의 284B 수치와 일치합니다. 모델 카드의 "safetensors 기준 304B"에는 체크포인트 내에 포함된 DSpark 투기적 디코딩 (speculative-decoding) 모듈 (BF16 기준 11.3 GB)과 양자화 스케일 텐서 (quantization scale tensors)가 포함되어 있습니다. 이는 계산 방식의 차이일 뿐 모순이 아닙니다.
토큰당 활성화되는 파라미터: 레이어당 7개의 전문가 (라우팅된 6개 + 공유 1개) × 43개 레이어 ≈ 7.6B, 여기에 밀집 어텐션 (dense attention) 및 임베딩 (embeddings) ≈ 10B를 더하면 모델 전체의 약 3.5% 수준입니다. "훨씬 적은 활성화 파라미터 수"라는 설명은 아키텍처와 일치합니다.
엔지니어링 뉴스: 투기적 디코딩 (Speculation)이 체크포인트 내에 포함됨
DSpark는 메인 체크포인트 내에 탑재되어 제공됩니다: 7개의 투기적 토큰 (speculative tokens), 탐욕적 초안 샘플링 (greedy draft sampling) 방식을 사용하며, 별도로 배포해야 하는 초안 모델 (draft model)이 없습니다. vLLM: --speculative-config '{"method":"dspark","num_speculative_tokens":7}'; SGLang: --speculative-algorithm DSPARK; llama.cpp 사용자는 이를 모듈로 추가할 수 있습니다 (Q8_0, 10.9 GB). 또한 이번 릴리스에는 3단계 추론 노력 (reasoning_effort: low/high/max, high/max 설정 시 최대 384K 출력 토큰 지원) 기능이 추가되었으며, Jinja 채팅 템플릿 (chat template)이 Python 헬퍼 함수들이 담긴 encoding/ 폴더로 대체되었습니다. transformers를 직접 사용하는 팀은 마이그레이션이 필요할 것입니다.
로컬 배포, 정직한 규모
unsloth의 GGUF: UD-Q4_K_XL 155 GB, UD-Q8_K_XL 162 GB — unsloth의 노트에 따르면 "손실 없는 (lossless)" Q8 버전은 Q4 버전보다 단 7 GB 더 큽니다. Ollama: ollama run hf.co/unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q4_K_XL. llama.cpp: llama serve -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q4_K_XL. 155 GB 크기의 Q4 파일은 대용량 RAM 워크스테이션이나 멀티 GPU 서버를 의미합니다. 대부분의 제품 팀에게는 호스팅된 Flash 티어 (hosted flash tier)가 경제적인 경로가 될 것입니다.
시사점
- Flash 티어의 경제성은 이제 벤더(vendor) 자체의 벤치마크(benchmarks)에 의해 뒷받침되지만, 이를 벤더의 관점으로 해석하여 읽어야 합니다.
- FP8 dense + FP4 experts + in-checkpoint speculation 조합은 지연 시간(latency)과 비용에 민감한 에이전트 워크로드(agent workloads)를 위해 복제할 가치가 있는 배포 레시피(deployment recipe)입니다.
- 384K의 출력 예산(output budget)을 가진 1M-토큰 컨텍스트(context)는 단일 에이전트 호출(agent call)에 담을 수 있는 내용의 범위를 변화시킵니다.
Model card: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 (MIT) · config.json: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/resolve/main/config.json · GGUF: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF · Paper: https://arxiv.org/abs/2606.19348
테스트되지 않음 / 실행되지 않음 — 추론(inference)이나 벤치마크 재현(benchmark reproduction)은 수행되지 않았습니다. 벤치마크 수치는 벤더의 것이며, 산술 연산(arithmetic) 및 설정(config) 판독은 본인의 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기