4x 구형 RTX 2080 Ti($2,000 예산 구성)로 DeepSeek-V4 로컬 실행하기: 커스텀 Turing 커널, W8A8 양자화
요약
구형 RTX 2080 Ti 4개를 활용하여 2,500달러 미만의 예산으로 DeepSeek-V4-Flash 모델을 로컬에서 실행하는 가성비 시스템 구축 사례를 소개합니다. 커스텀 Turing CUDA 커널과 W8A8 양자화, 이종 추론 최적화를 통해 메모리 제약을 극복하고 높은 성능을 달성했습니다.
핵심 포인트
- Turing 아키텍처에 특화된 커스텀 W8A8(INT8) CUDA 커널을 통해 대역폭 병목 현상 완화
- VRAM과 시스템 RAM 간의 정적 메모리 분할 및 동적 오프로딩을 통한 이종 추론 최적화
- MoE 라우팅 시 발생하는 멀티 GPU 통신 오버헤드를 숨기기 위한 파이프라인 실행 전략 구현
- Intel Xeon E5-2696 v4와 4x RTX 2080 Ti를 조합한 저비용 고효율 하드웨어 구성
안녕하세요 r/DeepSeek 여러분,
최첨단 MoE (Mixture of Experts) 모델을 실행하기 위해 반드시 H100 클러스터나 최신 고가 GPU가 필요하다고 누가 말했나요? 저는 소비자용 구형 하드웨어 단일 노드를 어디까지 밀어붙일 수 있는지 확인하고 싶었습니다. 그래서 총 2,500달러 미만의 비용으로 DeepSeek-V4-Flash (전체 284B, 활성 13B)를 로컬에서 성공적으로 실행하는 가성비 머신을 구축했습니다!
놀랍게도, 매우 타이트한 메모리 예산 내에서 약 255 prefill tokens/s를 달성했습니다.
하드웨어-소프트웨어 공동 최적화 (hardware-software co-optimization)를 통해 어떻게 이 "거대한 MoE 전차를 끄는 구형 당나귀" 같은 업적을 달성했는지 간략하게 설명해 드리겠습니다:
⚡️ 기술적 돌파구
- 커스텀 Turing CUDA 커널 (Custom Turing CUDA Kernels): 2080 Ti의 Tensor Cores는 여전히 유효하지만, PCIe Gen3와 VRAM 대역폭이 거대한 병목 현상 (bottleneck)을 일으킵니다. 저희는 대역폭 병목을 크게 완화하기 위해 W8A8 (INT8) 행렬 곱셈 (matrix multiplication)을 가속화하도록 Turing 아키텍처에 특화된 커스텀 CUDA 커널을 다시 작성했습니다.
- 이종 추론 (Heterogeneous Inference): 4개의 11/22GB VRAM과 1TB 시스템 RAM 사이의 정적 메모리 분할 (static memory splitting) 및 동적 오프로딩 (dynamic offloading)을 최적화했습니다. 하드웨어 용량의 100%를 활용합니다.
- 연산-통신 중첩 (Computation-Communication Overlap): MoE 라우팅으로 인해 발생하는 거대한 멀티 GPU 통신 오버헤드를 숨기기 위해 파이프라인 실행 전략 (pipelined execution strategy)을 구현했습니다.
🖥️ 가성비 하드웨어 사양
- CPU: Intel Xeon E5-2696 v4 (멀티코어를 위한 클래식한 가성비 제왕)
- GPU: 4x RTX 2080 Ti (각 11/22GB)
- RAM: 1TB DDR4 ECC
전체 구현체, 배포 스크립트 및 예비 기술 보고서는 100% 오픈 소스로 공개되어 있습니다. 이곳의 동료 시스템/컴파일러 해커분들의 의견, 벤치마크 또는 피드백을 듣고 싶습니다!
🔗 GitHub Repository: https://github.com/lvyufeng/deepseek-v4-2080ti
(참고: 며칠 전 arXiv에 상세 보고서를 제출했지만, 현재 수동 검토 대기열에 묶여 있습니다. 아마도 초보 저자가 2080 Ti를 DeepSeek-V4에 던지는 모습이 그들의 검토 경계선을 건드린 모양이네요 ㅎㅎ. 승인되는 대로 arXiv 링크로 업데이트하겠습니다!)
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기