DeepSeek-V4-Flash 업데이트
요약
DeepSeek-V4-Flash 모델의 뛰어난 가성비와 속도를 활용한 효율적인 AI 코딩 및 에이전트 워크플로우를 소개합니다. 저렴한 비용으로 대량의 토큰을 사용하며, MCP 서버와 맞춤형 도구를 결합해 개인용 에이전트 시스템을 구축하는 실전 사례를 다룹니다.
핵심 포인트
- DeepSeek-V4-Flash는 매우 저렴한 비용과 빠른 속도로 코딩 작업의 90%를 수행 가능
- MCP 서버 및 컨텍스트 축소 도구와 결합 시 강력한 개인용 에이전트 구현 가능
- 고비용 모델은 계획 및 검토 역할에만 제한적으로 사용하고 나머지는 Flash로 처리
- 로컬 실행이 가능한 수준의 효율성으로 커뮤니티에 유익한 모델
개인적으로 K3보다 더 기대됨. DSV4 모델은 서빙 비용이 매우 낮아, 성능이 향상될수록 더 많은 작업에서 ‘충분히 좋은’ 모델이 될 수 있음
DeepSeek는 오랫동안 Pro 버전을 매우 저렴하게 제공했고 OpenCode 등과 연동했으므로, 실제 개발 작업 데이터도 많이 확보했을 가능성이 큼. 이를 사후 학습에 활용하면 추가 개선도 가능함
K3를 DSV4로 증류했을 때 얼마나 더 좋아질지도 궁금함. 저렴하고 빠른 모델은 공급자 마음대로 사라지지 않고 성능을 계속 활용할 수 있다는 점에서 커뮤니티에 특히 유익함. 적어도 Flash는 1만 달러 미만 장비로도 집에서 실행할 수 있지만, GLM이나 K3 대형 모델은 현실적으로 어려움
학습 데이터 제공에 동의할 수 있는 공급자는 DeepSeek와 Moonshot뿐임
DwarfStar와 결합하면 쓸 만한 로컬 AI가 가능할 것으로 기대함
작업의 90%를 Flash로 처리하고 있음. 이유는 모르겠지만 Pro보다 낫고, 매우 저렴하면서 빠름
변경량을 1,000줄 이하로 유지하고 아키텍처 결정은 직접 내리면 최첨단 모델과 차이를 거의 느끼지 못함. 나머지 10%는 버그·보안 문제를 찾거나 더 나은 구조를 검토하는 데 쓰며, Flash도 꽤 잘하지만 교차 검증하고 있음
작은 변경에 5~10분씩 기다리는 것보다 빠른 반복이 훨씬 나음. 최근 Kimi와 GLM은 불필요하게 오래 추론해 느렸음. 의존성, 로그, 성능 덤프처럼 많은 데이터를 한도 걱정 없이 넣을 수 있고, 바이너리 리버스 엔지니어링에서도 보안 제한에 걸리지 않음
프롬프트 표현이 약해서인지 Codex로 사용한 OpenAI 모델들은 바이너리 리버스 엔지니어링을 거부한 적이 없음. 지금도 Codex와 서드파티 펌웨어를 분석 중인데 제한에 한 번도 걸리지 않았음
반면 보안과 무관한 프롬프트까지 거절당한다는 경우도 있어, 플랫폼별·사용자별 차이가 이렇게 큰 것인지 궁금함
DeepSeek V4 Flash는 대부분의 작업에 충분하고 응답도 빠름. 토큰은 주로 미국의 FireWorks.ai에서 구매하지만 DeepSeek에도 대량으로 선결제해 둠
Claude Code보다 토큰을 적게 쓰는 OpenCode를 주로 사용하며, DeepSeek 자체 코딩 하네스 출시도 기대 중임
전반적으로 좋지만 OpenRouter에서는 출력 토큰 한도가 지나치게 빡빡함. 추론의 함정에 빠지면 한도 내에서 스스로 빠져나오지 못하지만, 그래도 Kimi 모델을 대체했음
개인용 일상 에이전트 작업 대부분에 DeepSeek를 사용한 최근 30일 기록은 비용 4.55달러, API 요청 3,467회, 토큰 323,183,886개임
소규모 팀을 이끄는 엔지니어로서 품질 기준이 높고 개인 프로젝트에도 같은 기준을 적용하지만, 코딩과 검토 작업에서는 전혀 실망하지 않았음. 그 밖의 작업에는 다른 모델을 사용함
LLM으로 코드 검토를 할 때 어떤 방식과 프롬프트를 사용하는지 궁금함. 답변 품질이 상당히 낮았는데, 내 사용법이 원인인지 알고 싶음
이 정도 토큰 캐싱을 달성하려면 어떤 하네스를 사용하는지 궁금함
환각이 많지는 않은지, 있다면 작업 흐름에 어떤 영향을 주는지 궁금함
품질이 뛰어나지는 않으며, 대부분의 LLM도 마찬가지임
이제 pi 안의 거의 모든 작업을 Flash로 실행함. 적절한 MCP 서버, 컨텍스트 축소 도구, 스킬을 갖추면 어떤 작업도 구현할 수 있음
일부 세션은 30턴 이상 걸리지만 빠르고 저렴해, 한 시간 동안 작업해도 약 0.5달러면 충분함. 다만 다중 하위 에이전트 작업 흐름에서는 계획·검토·오라클 역할에 더 비싼 모델도 사용함
느린 Opus 구독은 몇 주째 쓰지 않았음. 휴대폰에서도 동작하고 MCP와 스킬을 지원하는 자체 호스팅 OpenWebUI 채팅도 구축해 Perplexity를 완전히 대체했으며, 호스팅과 구독 비용은 월 약 18달러임
나도 pi + DeepSeek 조합에 할 일 추적과 토큰 절약용 맞춤 도구를 다수 붙이고, 매우 어려운 작업에만 최첨단 모델을 사용함. 이 구성이 필요한 기능을 모두 충족함
pi에 사용할 만한 확장 기능을 추천받고 싶음
이번 업데이트에서 체감되는 개선이 있는지 궁금함
pi에서 top_p와 temperature를 설정하는 방법이 궁금함
벤치마크가 실제 사용 성능을 제대로 반영한다면 놀라운 모델임. 300B 모델이 이전 DS4 Pro 미리보기 모델의 1.8T 매개변수 성능을 넘고 GPT 5.6 Luna보다도 나아 보임
가격 인하 후의 Luna보다 여전히 저렴함
DeepSWE에서는 DeepSeek가 54.4%, Luna가 67%임
200B 모델이 GLM-5.2와 경쟁하고 Opus 4.8에 근접한 것은 상당히 인상적임
이 수치가 범용 성능으로도 이어지고 DeepSeek의 뛰어난 캐싱까지 더해진다면 사용량이 매우 많아질 듯함
단순히 200B 모델인 것뿐 아니라 용량도 160GiB에 불과함
더 명확히 구분하도록 v4.1-Flash라고 부르지 못할 이유가 무엇이었는지 궁금함
속도와 낮은 가격을 유지하면서도 이미 충분히 쓸 만한 deepseek-v4-pro의 성능을 넘어선다면 매우 유망함
deepseek-v4-flash는 이미 가격 대비 성능이 가장 좋은 모델이었으므로 지능/비용 지표에서 격차가 더 벌어질 듯함. 다만 DeepSeek API의 저렴한 비용은 코드베이스 정보를 중국에 넘기는 대가이기도 함
적어도 한 벤치마크에서는 GLM 5.2보다 우수하다고 함
비싼 작업에는 Opus 대신 Kimi K3, 일반 작업에는 Sonnet 대신 DSV4 Flash를 사용하는 구성이 합리적인지 궁금함
deepseek-v4-pro의 업데이트 버전이 곧 나올 듯하며, DSV4 Flash의 큰 개선 폭을 보면 지능과 비용 모두에서 Kimi K3를 앞설 가능성이 큼
충분히 합리적임. DSV4 Flash로 코딩이나 서버 점검을 한 시간 수행해도 순수 API 비용이 약 0.30달러라 매번 놀라움
백그라운드에서 두 모델 사이를 전환하도록 내 모델 라우터를 사용할 수 있음
코딩 외 용도의 에이전트에 DSv4를 사용하는 사례가 궁금함. 특히 GPT-5.4 mini로 분류나 범주화 등을 처리하던 사용자가 DSv4를 어떻게 활용하는지 알고 싶음
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기