DeepSeek V4 Flash를 위해 KV Cache를 양자화해서는 안 되는 이유
요약
DeepSeek V4 Flash 모델 사용 시 KV Cache를 Q8로 양자화할 경우 발생하는 품질 저하를 분석했습니다. PPL, KLD, 토큰 확률 변화를 통해 Qwen 397B 모델과 비교했을 때 DS4F의 양자화 민감도가 매우 높음을 입증했습니다.
핵심 포인트
- DeepSeek V4 Flash는 KV Cache 양자화 시 품질 저하가 심각함
- Q8 양자화 적용 시 PPL 및 KLD 수치가 크게 상승함
- Qwen 397B 대비 양자화에 의한 토큰 확률 변동폭이 매우 큼
- DS4F의 성능 유지를 위해서는 BF16 KV Cache 사용 권장
저는 DeepSeek V4 Flash(DS4F)를 사용할 때 그 누구도 KV Cache를 양자화해서는 안 된다고 생각합니다. BF16 KV에서 Q8 KV로 전환했을 때의 품질 영향(PPL, KLD, Same TopP)을 확인해 보았는데, 그 차이가 상당한 것으로 나타났습니다. 이는 Qwen 397B의 결과와는 매우 대조적입니다. 다음은 DS4F에 대한 결과입니다:
====== Perplexity (PPL, 혼란도) 통계 ======
Mean PPL(Q) : 5.877076 ± 0.042497
Mean PPL(base) : 5.839660 ± 0.041730
Cor(ln(PPL(Q)), ln(PPL(base))): 95.74%
Mean ln(PPL(Q)/PPL(base)) : 0.006387 ± 0.002100
Mean PPL(Q)/PPL(base) : 1.006407 ± 0.002114
Mean PPL(Q)-PPL(base) : 0.037416 ± 0.012318
====== KL divergence (KLD, 쿨백-라이블러 발산) 통계 ======
Mean KLD: 0.145884 ± 0.001043
Maximum KLD: 12.467786
99.9% KLD: 4.535020
99.0% KLD: 1.857870
95.0% KLD: 0.652148
90.0% KLD: 0.349220
Median KLD: 0.032079
10.0% KLD: 0.000093
5.0% KLD: 0.000012
1.0% KLD: 0.000000
0.1% KLD: -0.000002
Minimum KLD: -0.000025
====== Token probability (토큰 확률) 통계 ======
Mean Δp: -0.007 ± 0.031 %
Maximum Δp: 99.525%
99.9% Δp: 81.503%
99.0% Δp: 42.054%
95.0% Δp: 14.588%
90.0% Δp: 7.220%
75.0% Δp: 1.066%
Median Δp: 0.000%
25.0% Δp: -1.061%
10.0% Δp: -7.112%
5.0% Δp: -14.515%
1.0% Δp: -42.297%
0.1% Δp: -84.157%
Minimum Δp: -99.994%
RMS Δp : 11.884 ± 0.069 %
Same top p: 87.189 ± 0.088 %
비교를 위해, Qwen 397B의 결과는 다음과 같습니다:
====== Perplexity (PPL, 혼란도) 통계 ======
Mean PPL(Q) : 3.747980 ± 0.020507
Mean PPL(base) : 3.746773 ± 0.020461
Cor(ln(PPL(Q)), ln(PPL(base))): 99.89%
Mean ln(PPL(Q)/PPL(base)) : 0.000322 ± 0.000260
Mean PPL(Q)/PPL(base) : 1.000322 ± 0.000260
Mean PPL(Q)-PPL(base) : 0.001207 ± 0.000975
====== KL divergence (KLD, 쿨백-라이블러 발산) 통계 ======
Mean KLD: 0.003552 ± 0.000034
Maximum KLD: 2.220941
99.9% KLD: 0.131591
99.0% KLD: 0.043847
95.0% KLD: 0.014439
90.0% KLD: 0.007836
Median KLD: 0.000866
10.0% KLD: 0.000013
5.0% KLD: 0.000004
1.0% KLD: -0.000000
0.1% KLD: -0.000006
Minimum KLD: -0.000176
====== Token probability (토큰 확률) 통계 ======
Mean Δp: 0.019 ± 0.005 %
Maximum Δp: 39.939%
99.9% Δp: 15.971%
99.0% Δp: 6.618%
95.0% Δp: 2.334%
90.0% Δp: 1.222%
75.0% Δp: 0.233%
Median Δp:
0.000% 25.0% Δp: -0.219% 10.0% Δp: -1.183% 5.0% Δp: -2.258% 1.0% Δp: -6.245% 0.1% Δp: -14.757% Minimum Δp: -88.445% RMS Δp : 2.024 ± 0.022 % Same top p: 97.929 ± 0.037 % submitted by /u/erazortt [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기