2x RTX 3080 20GB, 64GB DDR5 환경에서 Q2 DeepSeek V4 Flash 구동 | 생성 17 tk/s
요약
2x RTX 3080 20GB와 64GB DDR5 환경에서 DeepSeek V4 Flash 모델을 Q2 양자화 방식으로 구동한 사례를 공유합니다. llama.cpp 포크 버전을 활용해 KV 캐시를 Q8로 양자화하여 128k 컨텍스트에서 안정적인 성능을 확보했습니다.
핵심 포인트
- 2x RTX 3080 20GB 환경에서 DeepSeek V4 Flash 구동 성공
- KV 캐시 Q8 양자화 적용으로 모델 출력 품질 유지
- 128k 컨텍스트에서 17 tk/s 생성 및 270 tk/s 프리필 속도 달성
- VRAM 할당 편향 조절(-ts 파라미터)을 통한 OOM 에러 방지
안녕하세요, 이곳에 처음으로 글을 올립니다. 제 빌드에서 Antirez의 imatrix Q2 DeepSeek V4 Flash GGUF (86.7 GB)를 구동하는 데 성공한 과정을 공유하고자 합니다. 저는 KV 캐시(KV cache)가 Q8로 양자화(quantised)되었을 때 모델의 출력을 수정해 주는 llama.cpp 포크(fork) 버전을 사용했습니다. 사양: - Ryzen 7 7800X3D - Asus ProArt B850-CREATOR WIFI NEO - 64GB DDR5-5200 - 2x RTX 3080 20GB (둘 다 PCIe 4.0 x8로 동작하며, 전력은 280W로 제한됨) Debian 13에서 Nvidia 610.43.02 드라이버를 사용 중입니다. 다음 실행 파라미터(launch parameters)를 사용했습니다: ./llama-server \ --model ~/models/gguf/DeepSeek-V4-Flash-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8-chat-v2-imatrix.gguf \ -ngl 99 \ -np 1 \ --n-cpu-moe 28 \ --split-mode layer \ -ts 130,43 \ -b 2048 \ -ub 2048 \ -fa on -c 131072 \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ --temp 1.0 \ --top-p 1.0 \ --min-p 0.0 \ --no-mmap \ --host 0.0.0.0 \ --port 8080 (-ts 130,43을 사용하여 VRAM 할당 편향을 GPU 0 쪽으로 강제하지 않으면 서버가 OOM(Out of Memory) 에러로 충돌했음을 참고하세요) 128k 컨텍스트(context)에서 17 tk/s의 생성(gen) 속도와 270 tk/s의 프리필(prefill) 속도를 달성할 수 있었습니다: 15.07.104.694 I slot print_timing: id 0 | task 3236 | prompt eval time = 6269.96 ms / 1713 tokens ( 3.66 ms per token, 273.21 tokens per second) 15.07.104.697 I slot print_timing: id 0 | task 3236 | eval time = 130667.97 ms / 2290 tokens ( 57.06 ms per token, 17.53 tokens per second) 15.07.104.697 I slot print_timing: id 0 | task 3236 | total time = 136937.93 ms / 4003 tokens 더 최적화할 수 있는 방법이 수만 가지는 더 있겠지만, 이 하드웨어 사양으로는 나쁘지 않다고 생각합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기