DeepSeek-V4-Flash-0731-UD-Q3_K_XL 3x3090 테스트 결과
요약
DeepSeek-V4-Flash 모델의 3-bit K_XL 양자화 버전에 대한 llama-bench 테스트 결과를 공유합니다. RTX 3090 GPU 3대를 활용하여 모델의 추론 성능(T/S)을 측정한 벤치마크 데이터입니다.
핵심 포인트
- RTX 3090 3대(총 VRAM 약 72GB) 환경에서 테스트 수행
- DeepSeek-V4-Flash 모델의 3-bit K_XL 양자화 적용
- pp512 기준 약 116.04 T/S, tg128 기준 약 7.71 T/S 기록
관심 있는 분들을 위해, 3 bit K_XL 양자화 (quantization)에 대한 llama-bench 결과를 공유합니다. 더 개선할 수 있을 것 같지만, 아직까지는 성과가 없었습니다. Command ./llama-bench -m /home/user/llamacpp/modelsmain/unsloth/ds4/DeepSeek-V4-Flash-0731-UD-Q3_K_XL-00001-of-00004.gguf -ngl 21 --split-mode layer -p 512 -n 128 -r 5 Output CUDA Initialization ggml_cuda_init: found 3 CUDA devices (Total VRAM: 72364 MiB): Device 0: NVIDIA GeForce RTX 3090, compute capability 8.6, VMM: yes, VRAM: 24116 MiB Device 1: NVIDIA GeForce RTX 3090, compute capability 8.6, VMM: yes, VRAM: 24124 MiB Device 2: NVIDIA GeForce RTX 3090, compute capability 8.6, VMM: yes, VRAM: 24124 MiB Benchmark Results Model Size Params Backend NGL Test T/S deepseek4 ?B Q3_K - Medium 119.40 GiB 284.33 B CUDA 21 pp512 116.04 ± 27.64 deepseek4 ?B Q3_K - Medium 119.40 GiB 284.33 B CUDA 21 tg128 7.71 ± 0.09 Build: e3546c794 (9976) System Memory Total Used Free Shared Buff/Cache Available Mem 122Gi 7.9Gi 1.2Gi 165Mi 114Gi Swap 0B 0B 0B NVIDIA-SMI Status +-----------------------------------------------------------------------------------------+ | NVIDIA-SMI 580.159.03 Driver Version: 580.159.03 CUDA Version: 13.0 | +-----------------------------------------+------------------------+----------------------+ | GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. | | | | MIG M.
| |=========================================+========================+======================| | 0 NVIDIA GeForce RTX 3090 Off | 00000000:01:00.0 Off | N/A | | 58% 55C P2 151W / 390W | 22696MiB / 24576MiB | 35% Default | | | | N/A | +-----------------------------------------+------------------------+----------------------+ | 1 NVIDIA GeForce RTX 3090 Off | 00000000:31:00.0 On | N/A | | 30% 53C P2 120W / 350W | 20193MiB / 24576MiB | 9% Default | | | | N/A | +-----------------------------------------+------------------------+----------------------+ | 2 NVIDIA GeForce RTX 3090 Off | 00000000:6C:00.0 Off | N/A | | 32% 55C P2 135W / 420W | 17811MiB / 24576MiB | 0% Default | | | | N/A | +-----------------------------------------+------------------------+----------------------+ submitted by /u/consultkitapp [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기