로컬 AI가 클라우드를 따라잡은 날: ds4, DeepSeek V4 Flash, 그리고 개발자들에게 일어난 변화
요약
Salvatore Sanfilippo가 출시한 ds4 엔진을 통해 DeepSeek V4 Flash 모델을 로컬 환경에서 실행한 결과, 클라우드 기반의 Claude보다 빠른 성능을 기록했습니다. ds4는 비대칭 2비트 양자화 기술을 사용하여 모델의 품질 저하를 최소화하면서도 효율적인 로컬 추론을 구현했습니다.
핵심 포인트
- ds4 엔진을 통한 DeepSeek V4 Flash 로컬 실행이 클라우드 Claude보다 빠른 속도 기록
- 비대칭 2비트 양자화로 MoE 전문가 가중치만 압축하여 품질과 성능의 균형 달성
- Apple Silicon GPU를 활용한 완전한 로컬 환경에서의 고성능 추론 가능성 증명
- 품질에 중요한 핵심 가중치는 고정밀도를 유지하는 전략적 아키텍처 적용
만약 당신이 코딩을 업으로 삼고 있으며 로컬 AI (local-AI) 분야를 지켜봐 왔다면, 2026년 5월 9일을 기억해 두어야 합니다. Salvatore Sanfilippo(네, Redis를 만든 바로 그 사람입니다)가 ds4를 출시했습니다. 이는 Metal 컴퓨팅 커널 (compute kernels)을 포함하여 수천 줄의 수작업으로 작성된 C 언어로 이루어져 있으며, 정확히 단 하나의 모델, 즉 DeepSeek V4 Flash를 위해 구축되었습니다.
저는 동일한 128 GB MacBook Pro에서 세 가지 엔진에 동일한 프롬프트 (prompt)를 실행해 보았습니다:
ds4를 통한 DeepSeek V4 Flash — 완전한 로컬 (local), 클라우드 제외- Max 플랜을 통한 Cloud Claude
- MLX를 통한 Gemma 4 31B — 역시 로컬 (local)
로컬 DeepSeek가 실제 소요 시간 (wall-clock time) 측면에서 클라우드 Claude를 이겼습니다. 이 문장은 과거에는 공상 과학 소설 같은 이야기였습니다.
▶ — 세 가지 엔진, 하나의 프롬프트, 동일한 기기에서 실시간으로 렌더링된 완전히 다른 세 가지 오로라 애니메이션.
군더더기를 원하지 않는 분들을 위한 벤치마크 (benchmark)
| 엔진 | 시간 | 출력 | 실행 위치 |
|---|---|---|---|
DeepSeek V4 Flash (ds4 로컬) | 103 s | 3,259 tokens | Apple Silicon GPU |
| ... |
프롬프트는 단 하나의 창의적인 HTML 작업이었습니다: "애니메이션화된 오로라 장면을 만드세요 — 단일 파일, 바닐라 JS (vanilla JS), 산, 소나무, 반짝이는 별, 흐르는 오로라 띠."
각 엔진은 완전히 다른 오로라를 생성했습니다. 추론 (inference) 과정 중 그 어떤 엔진도 네트워크에 접속하지 않았습니다. (네, lsof로 확인했습니다. 네, 이것은 the AirGap NDA piece에서 사용된 것과 동일한 lsof 감사 패턴입니다.)
이해할 가치가 있는 ds4의 세 가지 아키텍처 (architectural) 결정 사항
이 부분은 로컬 AI 인프라 (infrastructure)를 고민하는 개발자에게 매우 중요합니다.
1. 비대칭 2비트 양자화 (Asymmetric 2-bit quantization) (품질 저하가 허용되는 부분에만 적용)
양자화 (Quantization)에 대한 단순한 접근 방식은 모든 가중치 (weight)를 동일하게 취급합니다. ds4는 그렇지 않습니다. 라우팅된 Mixture-of-Experts (MoE) 전문가들만 2비트로 압축됩니다 (구체적으로 up/gate는 IQ2_XXS, down은 Q2_K 적용). 품질에 결정적인 모든 경로 — 공유 전문가 (shared experts), 어텐션 투영 (attention projections), 라우팅 (routing), 출력 헤드 (output head) — 는 더 높은 정밀도 (Q8 또는 전체 정밀도)를 유지합니다.
해당 라우팅된 전문가들은 전체 가중치 점유율의 약 90%를 차지합니다. 나머지 10%는 미세한 정밀도 손실이 큰 정확도 손실로 이어지는 부분입니다. 90%를 양자화하고 10%를 남겨두면, 도구 호출 (tool calling)을 깔끔하게 수행하고 일관된 코드를 작성할 수 있는 81 GB 크기의 파일을 얻게 됩니다.
이것은 특정 모델의 손실 지형 (loss landscape)을 충분히 관찰하여 어떤 가중치가 압축을 견딜 수 있는지 알 수 있을 때만 의미가 있는 종류의 트레이드오프 (tradeoff)입니다. 이는 양자화 레시피로 포장된, 모델 특화적인 엔지니어링 결정입니다.
2. KV 캐시의 디스크 이동 (2026년의 SSD는 충분히 빠릅니다)
“KV 캐시 (KV cache)는 반드시 RAM에 존재해야 한다”는 가정은 2023년의 것입니다. 최신 Apple SSD는 5GB/s 이상의 순차 읽기 (sequential reads) 속도를 냅니다. ds4는 세션 상태를 디스크에 기록하고, 토큰 ID의 SHA1 값을 키로 사용하여 실행 간에 이를 재사용합니다.
실질적인 효과는 다음과 같습니다: Claude Code가 25k 토큰의 시스템 프롬프트 (system prompt)를 보낼 때, 그 프리필 (prefill) 과정은 단 한 번만 발생합니다. 해당 접두사 (prefix)를 공유하는 완전히 다른 에이전트 실행을 포함하여, 이후의 모든 세션은 토큰 0부터 다시 계산하는 대신 디스크에서 밀리초 단위로 읽어옵니다.
로컬에서 긴 컨텍스트 (long-context) 모델을 사용해 보았다면, 프리필이 루프 내에서 가장 느린 작업이라는 것을 알고 있을 것입니다. ds4는 첫 번째 실행 이후 이를 무료로 만들어 버립니다. 이는 표준화되기까지 수년이 걸린, “작은 변화가 거대한 함의를 갖는” 종류의 움직임입니다. (참조: ds4 README의 disk-KV 섹션.)
3. CUDA-with-a-shim이 아닌 순수 Metal
3. CUDA-with-a-shim이 아닌 순수 Metal
핫 패스(hot path)에 PyTorch도, TensorFlow도, llama.cpp 래퍼 레이어도 없습니다. metal/*.metal 아래의 컴퓨트 커널은 특정 모델과 특정 아키텍처를 위해 특별히 작성되었습니다. 감사의 글에는 llama.cpp와 GGML이 언급되어 있으며 — ds4는 양자화된 레이아웃(quant layouts)과 선택적 커널을 차용합니다 — 하지만 이는 포크(fork)가 아닙니다.
이러한 좁은 범위성이 핵심입니다. 범용 프레임워크는 범용성을 유지하는 데 비용을 지불해야 합니다. 특정 모델에 하나의 칩으로 전념하면 그 비용을 직접 조정하여 제거할 수 있습니다. M3 Max 128 GB에서 초당 약 27 토큰(tok/s). M5 Max에서는 초당 약 32 토큰입니다. 노트북에서의 에이전트 루프(agent loops)로는 충분합니다.
규정 준수 민감 개발자에게 중요한 이유
같은 주에 저는 여전히 AirGap AI를 유지하고 있습니다. 이는 외부 연결 없이 노트북에서 특권 문서를 분석하기 위한 와이파이 차단(wi-fi-off), lsof-감사 워크플로우입니다 (NDA, 고객 파일, PHI 등). 지난주까지는 이것이 Llama 3.3 70B의 영역이었습니다. 역량 상한선이 실제였습니다.
ds4는 이 상한선을 실질적으로 높입니다:
- 1M 토큰 컨텍스트: 전체 코드베이스, 완전한 증언 기록(deposition transcripts), 완벽한 계약 세트 등 모든 것을 단일 대화에서 메모리에 보관합니다.
- 준-프론티어 추론(Quasi-frontier reasoning): Claude Sonnet이나 Opus를 사용해 본 적이 있다면, DeepSeek V4 Flash는 대부분의 에이전트 작업에서 같은 영역에 위치합니다.
- 작동하는 툴 호출(Tool calling that works): Antirez가 코딩 에이전트(opencode, Pi, Claude Code) 하에서 테스트했으며, 툴 호출은 신뢰성 있게 작동합니다.
법률 회사, 의료 기관 및 규정 준수 의무를 지닌 업체들에게 수학 자체가 바뀌었습니다.
# 1. 엔진 구축하기 (Metal을 사용하는 Apple Silicon)
git clone https://github.com/antirez/ds4
cd ds4 && make
...
또는 nicedreamzapp/claude-code-local을 클론하기만 하면 됩니다. DeepSeek V4 Flash는 이제 라인업의 네 번째 투사(fighter)가 되었으며, 위에서 언급한 모든 과정을 대신 처리해 주는 claude-ds4 래퍼(wrapper)를 제공합니다.
이것이 위치하는 맥락
이것은 일회성 사건이 아닙니다. 이것은 제가 계속해서 써 내려가고 있는 긴 흐름 속의 다음 단계입니다:
-
MacBook에서 Claude Code를 로컬로 실행하는 세 세대 — 내가 실제로 배운 것 — "겨우 작동하는 수준"에서 "실제로 클라우드 사용을 대체하는 수준"까지 이르는 긴 여정
-
계속해서 상승하는 클라우드 AI 코딩 비용 — $0를 지불하면서도 Claude Code를 사용하는 방법 —
ds4가 나오기 전의 경제적 관점 -
Claude 구독 가치를 10배로 끌어올리기 — 클라우드 비용 계산이 실제로 어떻게 이루어지는지에 대하여
-
음성으로 코딩한다는 것은 실제로 어떤 느낌인가 — AI가 내 복제된 목소리로 대답할 때 — 이 모델들이 이제 연결되는 음성 루프(voice loop)
-
귀하의 의료 기관은 아마 지금도 PHI(개인 건강 정보)에 클라우드 AI를 사용하고 있을 것입니다 — 의료 분야에서 온디바이스(on-device)가 중요한 이유
-
귀하의 법률 회사가 고객 파일에 클라우드 AI를 사용하고 있다면, 아마 문제가 있을 것입니다 — 법률적 관점
-
Ambient Computing에 관한 현장 가이드 (A Field Guide to Ambient Computing) — 이 모든 것이 속해 있는 더 큰 프레임워크
ds4는 이 모든 것들의 로컬 우선 (local-first) 버전을 마침내 프로덕션 작업(production work)에 사용할 수 있게 만드는 엔진입니다. 이제 로컬 에이전트 (local agent)는 자신이 어떤 워크로드 (workload)에 능숙한지 선택할 필요가 없습니다.
팔로우할 곳
- 🛠️ github.com/nicedreamzapp/claude-code-local — 라인업, 런처(launchers), 그리고 벤치마크 (benchmarks)
- 🐳 github.com/antirez/ds4 — 엔진 자체
- 🌿 marijuanaunion.com — 로컬 AI, 음성, 그리고 앰비언트 컴퓨팅 (ambient computing)에 관한 더 폭넓은 글
- 🔒 nicedreamzwholesale.com/airgap — 컴플라이언스 등급 (compliance-grade) 워크플로우 노트
- 💬 Discord — NiceDreamzApps 서버
2026년 5월 9일. 단 하나의 C 파일이 데이터 센터를 따라잡은 날.
이 글은 Marijuana Union의 헤드라인 기사의 기술적 동반 문서입니다. 동반 영상: . 컴플라이언스에 민감한 워크로드에 대한 로컬 AI 컨설팅은 AirGap AI를 참조하십시오.
원문은 Nice Dreamz Wholesale에 게시되었습니다. claude-code-local을 사용하여 클라우드 없이 오픈 소스로 자신의 하드웨어에서 AI를 로컬로 실행하세요. 자세한 내용은 nicedreamzwholesale.com/software에서 확인하실 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기