DeepSeek V4 Flash의 성능이 눈에 띄게 향상되었습니다
요약
DeepSeek V4 Flash의 성능 향상에 대한 벤치마크 결과입니다. Terminal Bench와 Toolathlon 등 주요 지표에서 GPT-5.6 Terra를 상회하는 성과를 보였으나, DeepSWE와 Agents' Last Exam에서는 Terra가 우위를 점하며 치열한 경쟁 양상을 보입니다.
핵심 포인트
- DeepSeek V4 Flash의 주요 벤치마크 성능 대폭 향상
- Terminal Bench 및 Toolathlon에서 GPT-5.6 Terra 대비 우위 점유
- DeepSWE 및 Agent 관련 벤치마크에서는 GPT-5.6 Terra가 우세
- 모델 간의 성능 격차가 좁혀지며 치열한 경쟁 구도 형성
DeepSeek V4 Flash: Preview → 2026-07-31 벤치마크 프리뷰(Benchmark Preview) 0731 Δ Terminal Bench* 56.9 82.7 +25.8 Toolathlon 51.8 70.3 +18.5 NL2Repo — 54.2 신규 Cybergym — 76.7 신규 DeepSWE — 54.4 신규 Agent Last Exam — 25.2 신규 Automation Bench — 25.1 신규 DSBench-FullStack — 68.7 신규 DSBench-Hard — 59.6 신규 * Terminal Bench가 v2.0에서 v2.1로 변경되었으므로, 이 개선 사항은 엄격한 일대일 비교(apples-to-apples comparison)는 아닙니다. GPT-5.6 Terra 벤치마크와 비교했을 때:
| 벤치마크 | GPT-5.6 Terra | DeepSeek V4 Flash | 우위 (Advantage) |
|---|---|---|---|
| Terminal Bench | 78.4 | 82.7 | Flash (+4.3) |
| Toolathlon | 53.1 | 70.3 | Flash (+17.2) |
| DeepSWE | 69.6 | 54.4 | Terra (+15.2) |
| Agents' Last Exam | 50.4 | 25.2 | Terra (+25.2) |
서로 치열하게 경쟁하고 있지만, 확실한 승자는 없네요... 매우 흥미롭습니다! 출처: https://api-docs.deepseek.com/updates/ submitted by /u/Reddactor [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기