DeepSeek V4 Flash | IQ3_XXS-AS & IQ2_S 벤치마크 | mainline b10064 vs fairydreaming
요약
DeepSeek V4 Flash 모델의 두 가지 양자화 방식(IQ3_XXS-AS, IQ2_S)에 대한 성능 벤치마크 결과입니다. llama.cpp의 특정 포크 버전과 메인라인 빌드 간의 비교를 통해 양자화 방식에 따른 추론 속도 및 효율성을 분석했습니다.
핵심 포인트
- DeepSeek V4 Flash의 IQ3_XXS-AS와 IQ2_S 양자화 방식 성능 비교
- IQ2_S 방식이 IQ3_XXS-AS보다 프롬프트 및 생성 속도 면에서 우세함
- fairydreaming/llama.cpp 포크 버전의 실효성에 대한 검증 결과 공유
- RTX 3090 및 Ryzen 5950X 환경에서의 구체적인 벤치마크 데이터 제공
안녕하세요 여러분! 제 하드웨어에서 두 가지 다른 양자화 (quant) 방식의 DeepSeek V4 Flash GGUF가 어떻게 작동하는지 확인하고 그 결과를 공유하고자 합니다. fairydreaming/llama.cpp dsv4 포크 (fork)에서 두 가지 양자화를 테스트했습니다. 보너스로, 확인을 위해 동일한 모델 (IQ3_XXS-AS)을 mainline llama.cpp b10064에서도 실행해 보았습니다. 요약하자면: 이제 그 포크는 무의미하다는 것이 밝혀졌습니다! bullerwins가 만든 DeepSeek V4 Flash 모델: DeepSeek-V4-Flash.IQ3_XXS-AS.gguf DeepSeek-V4-Flash.IQ2_S.gguf
하드웨어 구성 사양
CPU: AMD Ryzen 5950X (16C/32T, 14개 스레드 사용)
RAM: 128 GB DDR4 3600 MHz CL16 (듀얼 채널)
GPU: RTX 3090 24 GB
OS: Win 11 Pro
빌드 세부 정보
fairydreaming/llama.cpp (dsv4 브랜치)
-DGGML_CUDA=ON -DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES=native -DGGML_CCACHE=OFF -DGGML_NATIVE=ON -DCMAKE_BUILD_TYPE=Release -DLLAMA_OPENSSL=ON -DCMAKE_ASM_COMPILER=<nasm.exe>
Mainline llama.cpp (빌드 b10064)
-DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES=native -DCMAKE_BUILD_TYPE=Release -DCMAKE_ASM_COMPILER=<nasm.exe>
실행 파라미터 (모든 실행 및 모델에 대해 동일)
lama-server.exe ^
-m "model.gguf" ^
--chat-template-file "deepseek-ai-DeepSeek-V4.jinja" ^
--ctx-size 196608 ^
--jinja --metrics --perf ^
-np 1 ^
-ub 4096 -b 4096 ^
--no-kv-unified ^
--no-mmap ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--temp 1.0 --top_k 40 --top_p 1.0 ^
--min-p 0.00 --repeat-penalty 1.0 --presence-penalty 0.0 ^
--threads 14 ^
Part 1: fairydreaming 포크에서의 IQ3_XXS-AS vs IQ2_S
Cold Start (첫 번째 요청, 캐시 없음)
지표 | IQ3_XXS-AS | IQ2_S
Prompt tokens | 11,630 | 11,650
Prompt eval time | 44.28 s | 41.48 s
Prompt speed | 262.66 tok/s | 280.84 tok/s
Prompt ms/tok | 3.81 ms | 3.56 ms
Generation tokens | 473 | 121
Generation time | 41.42 s | 8.97 s
Generation speed | 11.42 tok/s | 13.50 tok/s
Generation ms/tok | 87.58 ms | 74.09 ms
Total time | 85.70 s | 50.45 s
Total tokens | 12,103 | 11,771
Graphs reused | 464 | 120
Warm Request (캐시 히트, 컨텍스트 재사용)
지표 | IQ3_XXS-AS | IQ2_S
Prompt tokens | 40,840 | 51,150
Prompt eval time | 161.37 s
201.33 s 프롬프트 속도 253.08 tok/s 254.06 tok/s 프롬프트 ms/tok 3.95 ms 3.94 ms 생성 토큰 2,639 1,671 생성 시간 244.56 s 129.87 s 생성 속도 10.79 tok/s 12.87 tok/s 생성 ms/tok 92.67 ms 77.72 ms 총 시간 405.93 s 331.20 s 총 토큰 43,479 52,821 그래프 재사용 3,057 1,762 슬롯 총 토큰 55,104 (절단 없음) 64,466 (절단 없음) 빠른 요약 프롬프트 처리: IQ2_S가 콜드(cold) 상태에서 약간 더 빠르지만 (+7%), 웜(warm) 상태에서는 사실상 동일합니다 (둘 다 254 tok/s). 프롬프트 처리는 컨텍스트 크기가 커질수록 수렴합니다. 생성: IQ2_S는 일관되게 약 1819% 더 빠릅니다 (콜드 기준 13.50 대 11.42, 웜 기준 12.87 대 10.79). 제 의견: IQ3_XXS-AS가 진정한 스위트 스팟입니다. IQ2_S는 PP(Prompt Processing)에서 더 빠르지 않지만, 품질 차이는 눈에 띄며 TG(Total Generation)가 그리 중요하지 않습니다. 파트 2: fairydreaming 포크 대 mainline b10064 (IQ3_XXS-AS) 포크에서 테스트한 후, 동일한 IQ3_XXS-AS 모델을 메인라인 llama.cpp 빌드 b10064에 동일한 설정과 작업으로 실행했습니다. 비교는 다음과 같습니다: 콜드 시작 지표 dsv4 fork mainline b10064 프롬프트 속도 262.66 tok/s 227.38 tok/s 생성 속도 11.42 tok/s 11.88 tok/s 웜 요청 지표 dsv4 fork mainline b10064 프롬프트 속도 253.08 tok/s 251.50 tok/s 생성 속도 10.79 tok/s 11.11 tok/s 빠른 요약 메인라인은 본질적으로 동일합니다 - 프롬프트와 생성 모두 3~4% 이내입니다. 실질적인 차이는 없습니다. 결론: fairydreaming dsv4 포크는 더 이상 필요하지 않습니다. Mainline llama.cpp (빌드 b10064+)가 동일한 성능으로 DeepSeek V4 Flash를 잘 처리합니다. 오늘 소스에서 빌드한다면, 업스트림(upstream)을 사용하기만 하면 됩니다. 양자화에 관하여: 현재 이 모델과 하드웨어에 대해 bullerwins의 GGUF가 가장 최적이라고 생각합니다. 어떤 양자를 선택할지에 대해서는 - IQ3_XXS-AS가 진정한 스위트 스팟입니다. 2비트 변형은 대략 같은 토큰 속도로 작동합니다. 속도가 같다면 그리고 IQ3가 눈에 띄게 더 나은 품질을 제공한다면, 낮은 양자는 가치가 없습니다. 성능 한계: 여기서 병목 현상은 시스템 메모리 대역폭 및/또는 CPU일 가능성이 높습니다.
추론 (Inference) 동안, RTX 3090은 약 150–200 W만을 소비하므로 (TDP 제한이 약 375–400 W인 상태에서), 여전히 어느 정도의 연산 여유 (compute headroom)가 있습니다. 어쩌면 5090을 구매하여 더 많은 레이어 (layers)를 VRAM으로 오프로딩 (offloading) 하는 것이 가치가 있을까요? 어쩌면 최소 500 PP와 25 TG를 얻을 수 있을까요?.. 어쨌든, 이것이 누군가에게 도움이 되기를 바랍니다. submitted by /u/CoplanarDimension [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기