DeepSeek V4 Flash 0731의 지능·성능·가격 분석
요약
DeepSeek V4 Flash 모델의 압도적인 비용 효율성과 성능을 분석합니다. 저렴한 API 가격을 통해 대규모 토큰 사용이 가능하며, 특정 작업에서 기존 고성능 모델에 필적하는 지능을 보여줍니다.
핵심 포인트
- V4 Flash는 100만 토큰당 0.28달러의 매우 낮은 비용 제공
- 지시 준수 능력이 향상되어 비용 효율 면에서 독보적임
- vllm-moet 엔진을 통해 로컬 환경(RTX PRO 6000 등)에서도 높은 추론 속도 구현 가능
- DeepSeek Harness를 통한 코드 에이전트 작업 최적화 예고
새 DeepSeek 모델은 크리스마스 선물 같음. 저가 API 모델은 DeepSeek가 가장 잘하며, VRAM 가격이 로컬 실행이 가능할 만큼 내려가기 전까지는 이 방식이 최선임
보조금에 의존하는 구독 모델은 오래가기 어렵고, API 과금이 지속 가능한 사업 모델에 더 가까워 보임
프로젝트 하나에 DeepSeek를 쓰는데, 수천만 토큰을 몇 센트에 사용할 수 있다는 점이 놀라움. 모든 작업에 적합하지는 않지만 특정 작업은 사실상 무료에 가까운 비용으로 탁월하게 처리함
중국이 메모리와 연산 하드웨어를 따라잡아 미국 기업을 가격과 성능 모두에서 압도할 날이 기대됨
동료 개발자들은 Claude 토큰을 한 시간 만에 소진한다고 불평하지만, 나는 DS Flash를 하루 종일 사용함. 가끔 틀리면 그때 어려운 작업에만 Claude 같은 모델을 꺼내면 됨
토큰당으로 따져도 DeepSeek API가 구독보다 비용 효율적일 가능성이 큼. 직접 시험해 보니 Flash는 지시 준수 능력이 크게 좋아졌고 더 능동적으로 변해, 현재 비용 효율 면에서 견줄 모델이 거의 없음
직접 가격을 살펴보면 GPT 5.6 Luna와 같은 결과를 내려면 토큰이 5배 필요하고 초당 토큰 수도 훨씬 낮음. 그래도 DeepSeek의 압박 덕분에 기존 업체들이 계속 최적화하게 된다는 효과는 분명함
공개 벤치마크의 코드 에이전트 작업에 아직 출시되지 않은 DeepSeek Harness 최소 모드를 사용했다는데, 최적화된 코딩 에이전트 하네스도 발표할 계획인지 궁금함
DSv4 Flash를 reasonix나 pi와 함께 쓰면 토큰 걱정 없이 하루 종일 몇 센트로 코딩할 수 있음. 반면 같은 모델을 Fireworks나 OpenRouter에서 ZDR과 함께 쓰면 이유 없이 비용이 계속 올라감. 사용 데이터 수집을 위해 가격을 보조하는 듯하며, 로컬 실행이 가능해질 날을 기다리는 중임
OpenRouter를 통하지 않는다면 어느 제공업체에서 구매하는지 궁금함. OpenRouter에 등록된 제공업체라면 직접 구매할 때와 가격이 같다고 알고 있었음
기술 보고서에서 이미 DeepSeek Harness를 예고했음. 코드 에이전트 작업은 최소 모드, 최대 추론 노력, temperature = 1.0, top_p = 0.95로 평가했으며 하네스는 추후 공개 예정임
RTX PRO 6000 96GB 한 장이나 DGX Spark 128GB 사용자에게는 덜 알려진 vllm-moet가 매우 좋은 엔진임. 추론용 대칭 2비트 플레인을 자동 생성하고, 정밀도 복원을 위해 4비트 델타 캐시도 만들며, RAM보다 큰 가중치의 SSD 스트리밍을 지원함
각 영역에 할당할 VRAM을 정해 속도와 정밀도의 균형을 조절할 수 있고, DS V4 Flash에서 초당 170토큰이 시연됨. 별도 변환 모델 없이 원본 모델을 그대로 사용함
DGX Spark에서는 sm120과 sm121 차이를 무시하는 작은 우회가 필요하지만 sm121에서도 실행 가능하므로 몇 시간 투자해 볼 가치가 있음
출력 100만 토큰당 0.28달러에 GLM 5.2·Gemini 3.6급 지능을 제공하며, 업데이트된 Pro 모델도 곧 나올 예정임
Unsloth 무손실 Q8이 162GB라 실제로 가정에서도 실행할 만한 크기임
그 정도를 가정에서 돌린다니 어떤 집인지 보고 싶음
Q8 크기는 약 151GB임
DeepSeek V4 Flash가 V4 Pro를 능가한다면, 몇 주 안에 Opus 5급 V4 Pro도 기대할 수 있는지 궁금함. Opus보다 뛰어나면 더 좋겠음
만들고 있는 앱에 V4 Flash를 사용 중인데, GPT·Opus·Sonnet만 쓰다가 넘어오니 비용 효율과 성능이 놀라움. 비용이 워낙 낮아 수익이 목적이 아닌 앱에 넉넉한 무료 등급도 제공할 수 있음 https://trysojourn.app
V4 Pro 가격에 Opus 5 성능이라면 믿기 어려울 정도로 훌륭하겠지만, 아마 꿈에 가까울 듯함
업데이트된 V4 Pro 최종판이 곧 공개된다고 밝힌 바 있음
정말 흥미로운 부분은 구조 변경 없이 추가 미세 조정만으로 큰 성능 향상을 이뤘다는 점임. 더 많은 데이터와 연산, 시간을 투입한 결과임
DS V4 Flash는 경쟁하는 모델군에 비하면 비교적 작으므로, 품질 높은 데이터와 학습 파이프라인을 다른 소형 모델에 적용해도 비슷한 향상을 얻을 가능성이 커 보임
비용이 X축이므로 정확히는 DeepSeek V4 Flash 0731 최대 추론이 작업당 약 0.03달러, 지수 50임. OpenAI Luna는 높은 추론이 0.03달러·지수 46, 초고 추론이 0.04달러·지수 49, 최대 추론이 0.07달러·지수 51임
따라서 Luna는 DeepSeek Flash보다 23배 비싸지만 추론 속도는 25배 빠르다고 보는 편이 공정함. DeepSeek를 능가하는 가장 저렴한 OpenAI 모델은 Luna 최대 추론으로, 비슷한 성능에 반올림 전 기준 약 3배 비싸지만 속도 역시 거의 3배 빠름
Artificial Analysis가 DeepSeek와 OpenAI에 모두 진한 파란색을 사용한 것은 특히 오늘 같은 날에는 매우 부적절한 색상 선택임
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기