단일 RTX 6000 Pro에서 실행되는 Deepseek V4 Flash - vLLM-Moet
요약
vLLM-Moet 커스텀 엔진을 사용하여 단일 RTX 6000 Pro에서 Deepseek V4 Flash 모델을 실행하는 방법을 소개합니다. 라우팅된 전문가를 2비트로 압축하는 기술을 통해 VRAM 사용량을 획기적으로 줄였습니다.
핵심 포인트
- vLLM-Moet을 통해 단일 GPU에서 대규모 모델 실행 가능
- 라우팅된 전문가를 2비트로 압축하여 VRAM 효율 극대화
- 130K 컨텍스트 설정 시 약 150GB의 시스템 RAM 필요
- Deepseek V4 Flash 및 GLM 5.2 모델 지원 가능성
와... https://github.com/kacper-daftcode/vLLM-Moet 이 Docker로 제공되는 커스텀 vLLM을 사용하면, 단일 RTX 6000 Pro에서 DS V4 Flash를 실행할 수 있습니다 (듣기로는 단일 5090에서도 작동한다고 하는데, 그의 README를 확인해 보세요. 저는 직접 시도해보지는 않았습니다). 듣기로는 이 방식이 GLM 5.2와도 작동한다고 합니다 (비록 최소 두 개의 6000 Pro가 필요하긴 하지만, 그럼에도 여전히 놀랍습니다). 130K 컨텍스트 (context)를 설정했을 때, safetensor 샤딩 (sharding) 단계를 넘기기 위해 약 150 GB의 RAM이 필요했습니다. 하지만 일단 VRAM에 완전히 로드되면 GPU에 모두 담을 수 있습니다 (만약 RAM이 이보다 적다면, 로딩 단계를 통과할 수 있도록 스왑 (swap)을 생성하거나 확장하세요. 다만 초기 로딩에 20분 정도 걸릴 것을 예상해야 합니다). 몇 가지 벤치마크 (benchmarks)를 실행 중이며 (아래 참조) - 이전에 DS V4를 실행해 본 적이 없어서, 이 커스텀 엔진에서 어떤 파라미터 (parameters)를 사용해야 할지는 확실하지 않습니다. 하지만 그냥 공유하고 싶었습니다 - 이 개발자가 해낸 것은 매우 흥미로운 업적입니다. 더 작은 VRAM에 맞게 크기를 줄일 수 있었던 비결(magic sauce)은 fp4 전문가 (experts)는 유지하면서 라우팅된 전문가 (routed experts)를 2비트 (2 bit)로 압축한 것입니다 (그에게 찬사를 보냅니다, 의심할 여지 없는 천재입니다). 하지만 얼마나 실용적인지 확인하려면 더 많은 테스트가 필요합니다 (이를 활용해 코딩 세션을 진행해 볼 예정입니다).
| 초기 실행 결과 - 단일 RTX 6000 Pro | 모델 | 테스트 항목 | t/s | 최고 t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|---|---|---|---|---|---|---|---|
| deepseek-v4-flash | tg32 | 128.58 ± 11.43 | 132.73 ± 11.80 | ||||
| deepseek-v4-flash | ctx_tg @ d4096 | 103.21 ± 9.94 | 106.54 ± 10.26 | ||||
| deepseek-v4-flash | tg32 @ d4096 | 111.93 ± 18.57 | 115.54 ± 19.17 | ||||
| deepseek-v4-flash | ctx_pp @ d8192 | 7907.32 ± 9331.94 | 5257.95 ± 2446.23 | 3813.06 ± 2446.23 | 5257.95 ± 2446.23 | ||
| deepseek-v4-flash | ctx_tg @ d8192 | 110.42 ± 11.02 | 113.98 ± 11.37 | ||||
| deepseek-v4-flash | tg32 @ d8192 | 129.20 ± 30.24 | 133.37 ± 31.21 | ||||
| deepseek-v4-flash | ctx_pp @ d16384 | 5057.32 ± 2173.55 | 5396.66 ± 2464.32 | 3951.77 ± 2464.32 | 5396.93 ± 2464.13 | ||
| deepseek-v4-flash | ctx_tg @ d16384 | 111.62 ± 16.28 | 115.22 ± 16.80 | ||||
| deepseek-v4-flash | tg32 @ d16384 | 107.76 ± 4.27 | 111.24 ± 4.41 | ||||
| deepseek-v4-flash | ctx_pp @ d32768 | 2613.02 ± 9.10 | 12685.53 ± 25.40 | 11240.64 ± 25.40 | 12686.86 ± 25.37 | ||
| deepseek-v4-flash | ctx_tg @ d32768 | 103.65 ± 17.46 | 106.99 ± 18.03 | ||||
| deepseek-v4-flash | tg32 @ d32768 | 100.84 ± 3.82 | 106.61 ± 7.36 | ||||
| deepseek-v4-flash | ctx_pp @ d65535 | 3856.66 ± 580.03 | 17068.97 ± 2595.20 | 15624.08 ± 2595.20 | 17070.57 ± 2595.74 | ||
| deepseek-v4-flash | ctx_tg @ d65535 | 118.46 ± 18.93 | 126.93 ± 23.61 | ||||
| deepseek-v4-flash | tg32 @ d65535 | 119.35 ± 18.77 | 134.06 ± 25.60 | ||||
| 제출자: /u/live4evrr, r/LocalLLaMA에 제출됨 [링크] [댓글] |
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기