DeepSeek V4 Flash 0731의 ARC-AGI 평가 결과
요약
DeepSeek V4 Flash 0731 모델의 성능과 비용 효율성을 분석한 내용입니다. 매우 저렴한 비용과 빠른 속도 덕분에 로컬 실행 및 다양한 자동화 작업에 활용 가능하며, 이는 미국 AI 기업들에게 시장 경쟁 측면에서 위협이 될 수 있습니다.
핵심 포인트
- DeepSeek V4 Flash의 압도적인 가성비와 빠른 추론 속도
- 로컬 환경(DGX, RTX Blackwell)에서의 뛰어난 실행 성능
- 미국 모델 대비 저렴한 비용으로 인한 글로벌 시장 경쟁력 변화 가능성
- API 및 오픈소스 모델 활용을 통한 비용 최적화 전략
출시 이후 광범위하게 써봤는데, 거의 모든 작업에 충분하고 비용도 무시할 만한 수준임. Oh My Pi에서 두 번째 인스턴스를 ‘조언자’로 두고 5~6개 세션, 실질적으로 12개 스트림을 돌려도 하루 5달러 이상 쓰기 어려움
OpenCode Go는 일시적으로 한도를 두 배 제공해 10달러로 사실상 140달러어치 토큰을 쓸 수 있는데, 일반적인 사용으로 이를 소진하기는 쉽지 않아 보임. Claude Max도 구독 중이지만, 모델이 더 강하더라도 한도와 사용량을 신경 써야 해서 거의 쓰지 않게 됨
이 정도로 저렴한 지능은 CI 테스트 실패 시 자동 수정안 생성, 모든 풀 리퀘스트의 테스트 자동 생성, 서버 로그 감시, 지속적인 보안 감사, 예외 전수 조사 같은 새로운 자동화를 가능하게 함. 소셜 미디어 피드도 자동 필터링하고 재정렬해 알고리듬에 끌려가기보다 직접 조정해볼 생각임
이 평가가 정확하다면 미국 AI 연구소들은 큰 위기에 처할 수 있음. 국가안보를 이유로 미국 연방·주 정부와 대형 계약업체에서 최첨단 중국산·비미국산 모델 사용을 금지할 수는 있겠지만, 몇 달 전 최고 수준과 맞먹는 소형 모델이 등장하면 국제 시장에서는 크게 밀릴 가능성이 큼
미국 밖의 대기업이 자체 호스팅과 최적화·미세조정이 가능한 공개 가중치 모델로 같은 작업을 훨씬 저렴하게 처리할 수 있는데 굳이 미국 업체의 웃돈을 낼 이유가 없음
DGX 2대로 로컬 실행 중인데 매우 인상적임. 비추론 모드는 반응이 빠르고 추론 모드는 지연이 있지만 필요할 때만 켤 수 있으며, 둘 다 성능이 좋음
하루 5달러가 어떻게 무시할 만한 비용인지 의문임. 월 150달러 정도면 GPT 5.6 Sol Pro 요금제로 사실상 무제한 사용이 가능한데, 같은 가격에 훨씬 약한 모델을 쓸 이유가 없음
DeepSeek는 향후 API 가격을 대폭 인상할 예정이라고 경고하고 있음
‘거의 모든 작업’이 구체적으로 어떤 작업인지 궁금함
이것은 몇 달 전의 미리보기판이 아니라 DSv4 Flash 07/31 릴리스임. 미리보기판부터 로컬에서 사용했는데 이번 버전은 한 단계 위로 느껴지며, 디버깅과 업로드한 문서·데이터 분석에 매우 유능함
핵심은 속도임. RTX Pro 6000 Blackwell 2장으로 단일 스트림에서 사전 채움 약 8천 토큰/초, 생성 약 250토큰/초가 나오며, vLLM에서 약 64개 동시 스트림으로 1천 토큰/초도 확인했음
기다리며 탭을 바꿀 필요 없이 대화할 수 있고, 약 300B 규모지만 활성 매개변수는 13B라 빠르면서 답변 품질도 좋음. 이제 일상 작업의 95% 이상을 로컬 모델에 맡기고 아주 큰 코딩 작업에만 Claude Fable을 쓰는 편이 더 편리함
이전에는 GLM5.2 약 750B를 적당한 속도로 돌리려고 하드웨어를 더 살 생각이었지만 이제 필요성을 못 느낌. 현재로도 충분히 똑똑하고 로컬 모델은 앞으로 훨씬 더 좋아질 것으로 봄
어떤 양자화 수준인지 궁금함. 공식 엔드포인트는 느린 편임
며칠 전 Claude 계정이 정지됐는데, 가능한 원인은 JetBrains IDE의 AI 도우미에서 인증하면서 API 계정 대신 일반 구독 정보를 입력한 것뿐임. API 계정이 필요하다는 걸 알고 탭을 닫았지만 약 20분 뒤 이용 정책 위반으로 정지됐다는 이메일을 받았고 이의 신청도 거절됨
처음에는 ChatGPT에 가입하려 했지만 OpenRouter에 20달러가 남아 있어 며칠간 Pi와 DeepSeek V4 Pro를 써봤고 내 용도에는 충분했음. Claude의 보조금이 적용된 구독 대신 API 비용과 OpenRouter 수수료를 내더라도 전체 지출은 훨씬 적을 듯함
원하는 최소형 오픈소스 실행 도구를 쓰고 공급자를 쉽게 바꿀 수 있는 유연성도 마음에 듦. 주로 취미 코딩에서 문제 접근법을 묻는 정도라 요구 수준이 높지는 않음
심리전과 생물무기에 관해 물어봐도 계정은 멀쩡함. 다만 최근 Sonnet 세션 하나가 중단됐는데 묘한 업적처럼 느껴짐
구독 서비스는 사용량이 적고 들쭉날쭉해서 이제 OpenRouter에서 DS4 Pro/Flash만 사용함. 주간 한도가 끝나기 전에 월 20달러를 정당화하려고 억지로 토큰을 쓰던 부담도 사라짐
구독을 선호한다면 OpenCode Go 월 10달러, Cline Pass 월 10달러, Atlas Code 월 20달러, CommandCode 월 1달러가 우수한 공개 가중치 모델을 넉넉한 한도로 제공함. 데이터 보존을 감수할 수 있다면 현재 OpenCode Go에서 10달러로 DeepSeek Flash v4 사용액 120달러를 제공함
Flash는 만족스러운 모델이며, 사실상 무시할 만한 비용으로 지능을 이용하는 시대의 시작처럼 보임. 이제는 대규모 군집 지능을 가장 잘 배치하고 조직하는 실행 도구가 핵심이 될 것임
불과 한 달 전만 해도 Kimi K3가 흥미로운 모델이었는데, 이제 같은 성능을 20분의 1 가격에 쓸 수 있음. 발전 속도가 놀라움
매일 쏟아지는 변화를 따라가며 최첨단 개발 역량을 유지하면서 실제 작업 시간까지 확보하는 사람이 있는지 진지하게 궁금함. 이제 AI 발전을 계속 추적할 가치가 있는지 판단하기 어려운 사건의 지평선에 도달한 듯함
이전 DeepSeek V4 Flash보다 무한 반복에 빠지거나 도구 호출 없이 혼잣말하며 토큰을 낭비하는 일이 훨씬 많아졌음. Pi 에이전트에서 평범한 프롬프트와 용도로 사용할 때 발생함
Rust를 이야기하다 갑자기 전기의자나 D&D 규칙 논쟁처럼 전혀 관련 없고 이전에 다룬 적도 없는 주제로 넘어가기도 했으며, 이후 이를 직접 짚어줘도 인식하지 못함. 여전히 쓸 가치는 있지만 적어도 내 환경에서는 에이전트 성능이 저하됨
같은 현상을 봤고 꽤 성가심. 프롬프트 조정으로 완화할 수 있음
OpenCode 월 10달러 요금제에서 높은 노력 수준으로 업무에 쓰는데 문제를 겪지 않았음. 이 수준은 개인적으로 최대보다 더 나음
처음 OpenCode에 추가됐을 때는 모두가 새 모델을 시험해서인지 느렸지만, 이제 다시 매우 빨라졌고 적은 비용으로 Opus 4.8급 성능을 보여줌
프로그래밍 작업에 강력히 추천함. Fable만큼 강하지는 않지만 Opus보다 대화 성향이 훨씬 낫고 약점도 매우 다름
Claude와 번갈아 쓰면 서로의 실수를 커지기 전에 잡아줌. 말하는 방식까지 고려하면 이제는 프로그래밍에 DeepSeek를 더 선호함
내 체감도 같으며 증류 모델이라는 소문을 불식시킬 만함. 말투와 약점 모두 Claude 계열과 전혀 다르게 느껴짐
한 시간 사용했지만 시간만 완전히 낭비했음. println("I am retarded") 수준을 넘는 작업에는 너무 부족함
최전선 모델은 아니지만 연초에 쓰던 모델보다 훨씬 발전했고 실사용성이 높음. 지시 준수와 도구 호출이 훌륭하며, 간단한 작업 흐름만 구성해도 장시간 작업 성능이 매우 좋음
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기