DeepSeek V4 Flash 0731: 오늘날의 열풍 뒤에 숨겨진 에이전트 벤치마크
요약
DeepSeek가 에이전트 성능 최적화에 집중한 V4 Flash 0731 모델을 출시했습니다. 동일한 아키텍처를 유지하면서 사후 학습(Post-training)만으로 에이전트 및 코드 벤치마크 성능을 비약적으로 향상시켰습니다.
핵심 포인트
- 사후 학습을 통해 Terminal Bench 및 DeepSWE 성능 대폭 향상
- Responses API 네이티브 지원으로 에이전트 툴링 호환성 확보
- 매우 저렴한 API 비용 및 캐시 히트 기반의 경제적 구조
- MIT 라이선스로 가중치 공개되어 로컬 실행 가능
DeepSeek는 오늘 DeepSeek-V4-Flash-0731이라는 이름의 V4 Flash 공식 빌드를 출시했습니다. 흥미로운 점은 단순히 새로운 모델이 출시되었다는 사실이 아닙니다. 바로 사후 학습 (Post-training)만으로 에이전트 성능이 어떻게 변화했는가 하는 점입니다.
동일한 모델, 새로운 역할
0731 빌드는 4월 프리뷰 버전과 정확히 동일한 아키텍처와 크기를 유지합니다: 총 파라미터(Parameters) 284B, 활성 파라미터(Active parameters) 13B, 1M 토큰 컨텍스트(Context)를 제공합니다. DeepSeek는 오직 에이전트 워크로드 (Agent workloads)를 겨냥하여 사후 학습 (Post-training)만을 다시 수행했습니다. 그 차이는 다음과 같습니다:
| 벤치마크 (Benchmark) | 프리뷰 (Preview) | 0731 |
|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 |
| ... |
베이스 모델을 건드리지 않고 DeepSWE가 7.3에서 54.4로 상승한 것은 보통 새로운 세대의 모델이 필요할 때나 볼 수 있는 도약입니다. 여러 코드 및 에이전트 벤치마크에서 이 작은 Flash 모델은, 토큰당 거의 4배 더 많은 파라미터를 활성화하는 DeepSeek의 자체 V4 Pro Preview (1.6T 모델)보다 더 높은 점수를 기록하고 있습니다.
에이전트를 구축하는 사람들에게 의미하는 바
점수만큼이나 중요한 두 가지 출시 세부 사항이 있습니다. 첫째, 0731은 Responses API 형식을 네이티브로 지원하며 Codex에 맞춰 조정되었으므로, 해당 인터페이스를 기반으로 구축된 에이전트 툴링 (Agent tooling)은 호환성 심 (Compatibility shim) 없이 deepseek-v4-flash에서 바로 실행됩니다. 둘째, 가격입니다: 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28, 그리고 캐시 히트 (Cache hits) 시 $0.0028입니다. 에이전트 루프 (Agent loops)는 컨텍스트를 끊임없이 다시 전송하므로, 캐시 히트 가격이 청구 금액을 결정하는 핵심 수치가 됩니다.
그리고 오픈 소스라는 점은 단순한 마케팅이 아닙니다: 출시 당일 Hugging Face에 MIT 라이선스로 가중치 (Weights)가 공개되었고, 몇 시간 이내에 커뮤니티 GGUF 파일들이 뒤따랐으며, 155 GB 4-bit 양자화 (Quant) 모델은 192 GB 워크스테이션이나 Mac Studio에 적합합니다. 세부 사항(피크 시간대 가격 2배 적용 공지, 커스텀 채팅 템플릿, 그리고 모델이 평범한 부분 등)을 포함하여 무엇이 출시되었는지에 대한 심층 분석은 여기에서 확인할 수 있습니다: DeepSeek V4 Flash 0731 Explained.
API 콘솔 없이 시도해보기
무엇인가에 연결하기 전에 모델을 직접 테스트해보고 싶다면, 다음과 같은 경로가 있습니다: 공식 API (OpenAI 호환), OpenRouter (하나의 모델 문자열), 또는 LU Labs와 같이 V4 Flash와 V4 Pro가 토큰당 과금이 아닌 월간 할당량(monthly quota) 방식으로 하나의 선택기에 포함된 고정 가격 호스팅 플랜, 혹은 가중치(weights)가 공개되어 있으므로 본인의 하드웨어에서 완전히 로컬로 실행하는 방법이 있습니다. 작동하는 코드 샘플이 포함된 전체 결정 트리(decision tree)는 클라우드 가이드에 있으며, 로컬 경로는 로컬 가이드에서 다룹니다.
전략적 시사점: 오늘날에는 전문화(specialization)가 규모(scale)를 이겼습니다. 에이전트 루프(agent loop)에 대해 집중적으로 학습된 13B 활성 모델(active model)이, 현재 개발자들이 구축하고 있는 워크로드에서 49B 활성 범용 모델(generalist)을 능가하고 있습니다. 모든 연구소(lab)가 이 레시피를 복제할 것으로 예상됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기