RTX PRO 6000 Max-Q eGPU를 장착한 Bosgame M5에서의 DeepSeek-V4-Flash-0731 성능
요약
RTX PRO 6000 Max-Q eGPU를 장착한 Bosgame M5 환경에서 DeepSeek-V4-Flash-0731 모델의 양자화별 성능을 측정한 결과입니다. llama.cpp와 DSpark drafter를 활용하여 다양한 양자화 설정(Q2, Q4, Q8)에 따른 디코딩 및 프리필 속도를 비교 분석했습니다.
핵심 포인트
- 양자화 비트수가 낮을수록(Q2) 디코딩 속도가 59.5 t/s로 가장 빠름
- DSpark drafter를 활용한 추측 디코딩(Speculative Decoding) 적용 사례
- CUDA와 ROCm을 혼합한 레이어 분할(Split-mode) 설정 공유
- 양자화 크기에 따른 전문가 경계(Expert Boundary) 최적화 방법 제시
제 수치는 다음과 같습니다:
| Quant | Size | Layout | Decode | Prefill | Draft acceptance |
| :--- | :--- | :--- | :--- | :--- | : |
| UD-Q8_K_XL | 150.8 GiB | 20 layers CUDA0 / 23 ROCm0 + drafter | 44.0 t/s | 564 t/s | 0.535 |
| UD-Q4_K_XL | 144.4 GiB | 22 / 21 + drafter | 48.4 t/s | 585 t/s | 0.532 |
| UD-Q2_K_XL | 90.2 GiB | entirely on CUDA0, no drafter | 59.5 t/s | 1513 t/s | — |
— 저는 Claude를 사용하여 닫힌 PR(Pull Request)에 있던 DSpark drafter를 현재의 main 브랜치로 포팅하도록 했습니다. https://github.com/haraldh/llama.cpp/tree/dspark-dsv4
UD-Q2_K_XL
llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q2_K_XL \
--host 0.0.0.0 --port 8000 \
--temp 1.0 --top-p 1.0 --min-p 0.0 \
--no-mmap -fa on -np 1 \
--device CUDA0 \
-ub 2048 -b 4096 \
-c 200000 --cache-ram 65536
UD-Q4_K_XL
llama-server -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q4_K_XL \
--host 0.0.0.0 --port 8000 \
--temp 1.0 --top-p 1.0 --min-p 0.0 \
--no-mmap -fa on -np 1 \
--device CUDA0,ROCm0 --split-mode layer --tensor-split 100,0 \
-ot 'blk\.(2[2-9]|3[0-9]|4[0-2])\.ffn_(gate|up|down)_exps\.weight=ROCm0' \
-md DSV4-Flash-0731-DSpark-draft-bf16.gguf \
--spec-type draft-dspark --spec-draft-n-max 5 \
--device-draft CUDA0 --spec-draft-p-min 0.3 \
-ub 2048 -b 4096 \
-c 200000 --cache-ram 32768
UD-Q8_K_XL
위와 동일하지만 :UD-Q8_K_XL를 사용하며, 밀집(dense) 부분이 6.3 GiB 더 크기 때문에 전문가 경계(expert boundary)를 두 레이어 더 낮게 설정했습니다:
-ot 'blk\.(2[0-9]|3[0-9]|4[0-2])\.ffn_(gate|up|down)_exps\.weight=ROCm0'
/u/backslashHH 님이 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기