
KV 캐시 양자화 벤치마크: Qwen 3.6 27B 및 Gemma 4 31B 대상 413개 쌍 테스트. BeeLlama.cpp v0.4.0을
요약
BeeLlama.cpp v0.4.0을 사용하여 Qwen 3.6 27B 및 Gemma 4 31B 모델의 KV 캐시 양자화 성능을 벤치마크한 결과입니다. KVarN 및 Precision Tail 기법을 포함한 다양한 양자화 옵션의 메모리 절감 효과와 품질(KLD)을 분석했습니다.
핵심 포인트
- KVarN 방식이 표준 양자화 대비 우수한 품질과 메모리 효율을 제공함
- kvarn5는 중급형 설정에서 가장 높은 가성비를 보임
- kvarn4-kvarn3 조합은 품질과 메모리 사이의 균형 잡힌 권장 최소 계층임
- Precision Tail 기법을 통해 최신 토큰의 정밀도를 유지하며 압축 가능
기사 링크: KV 캐시 양자화 벤치마크(KV Cache Quantization Benchmarks): 더 많은 KV 캐시 양자화 옵션을 제공하는 llama.cpp의 포크 버전인 BeeLlama.cpp v0.4.0을 이용한 KVarN 및 Precision Tail KLD 벤치마크.
모델:
- Qwen 3.6 27B Q5_K_S 64k 컨텍스트(context)
- Gemma 4 31B Q5_K_S 16k 컨텍스트(context)
표준 양자화(Standard quants), 확장형: q6_0 및 q6_1, 그리고 q2_0부터 q3_1까지의 저비트(low-bit) 유형.
KVarN: Huawei에서 개발한 분산 정규화 KV 캐시(Variance-Normalized KV-Cache).
Precision Tail: KV 캐시의 최신 X 토큰을 (B)F16으로 유지하는 방식. BeeLlama에 구현됨.
총 413개 구성: Qwen 3.6 27B로 238개, Gemma 4 31B로 175개.
추천 단계(The Recommendation Ladder)
전체 벤치마크 결과, 설정, 방법, 분석, 설명 및 기타 모든 내용은 기사에서 확인할 수 있습니다.
- Qwen 캐시 테일(Cache Tail)
| KV 캐시 (MiB) | 중앙값 KLD (Median KLD) | 99.9% KLD | 용도 |
|---|---|---|---|
| bf16 | 0 4096.00 | 0 0.00005 | 기준(Reference) |
| q8_0 | 1024 2272.00 | 0.000897 0.087699 | 표준 충실도, Precision Tail 적용 |
| kvarn8 | 1024 2256.00 | 0.000871 0.087639 | BF16 미만에서 측정된 최상의 품질 |
| q8_0 | 0 2176.00 | 0.000909 0.093029 | 표준 충실도 |
| q8_0-q6_0 | 1024 2016.00 | 0.000894 0.091098 | 노이즈 범위 내의 q8_0 품질, 256.00 MiB 절감 |
| kvarn6 | 1024 1744.00 | 0.000879 0.084629 | 하이엔드 가성비 선택지 |
| kvarn6-kvarn5 | 1024 1616.00 | 0.000886 0.092778 | 훨씬 저렴하며 품질은 거의 동일 |
| kvarn5 | 1024 1488.00 | 0.000897 0.087666 | 중급형에서 가장 높은 가성비 |
| q5_0-q4_1 | 1024 1440.00 | 0.000966 0.089128 | VRAM 제약 시 표준 방식 |
| kvarn5-kvarn4 | 1024 1360.00 | 0.000936 0.089469 | 균형 잡힌 기본값 |
| q4_0 | 1024 1248.00 | 0.001057 0.104486 | 컴팩트한 표준 |
| kvarn4 | 1024 1232.00 | 0.000994 0.090391 | 적은 메모리로 q4_0보다 깔끔함 |
| kvarn4-kvarn3 | 1024 1104.00 | 0.001112 0.113968 | 권장되는 최소 계층 |
| kvarn3 | 1024 976.00 | 0.001316 0.139558 | 컨텍스트를 반드시 맞춰야 할 때 |
| kvarn3-kvarn2 | 1024 848.00 | 0.002424 0.23878 | 비상 압축 |
| kvarn2 | 1024 720.00 | 0.003811 0.450496 | 최후의 수단 |
Qwen Standard-Only Cache Tail KV cache (MiB) Median KLD 99.9% KLD 용도
| bf16 | 0 | 4096.00 | 0 | 0.00005 | 기준점 (Reference)
| q8_0 | 0 | 2176.00 | 0.000909 | 0.093029 | 손실을 최소화한 압축 (Compression with minimal losses)
| q8_0-q6_0 | 0 | 1920.00 | 0.000937 | 0.093575 | q8_0보다 256.00 MiB 낮음
| q6_0 | 0 | 1664.00 | 0.00096 | 0.091134 | 하이엔드 가치 선택지 (The high-end value pick)
| q6_0-q5_0 | 0 | 1536.00 | 0.001054 | 0.09467 | 균형 잡힌 기본값 (Balanced default)
| q5_0 | 0 | 1408.00 | 0.001154 | 0.09707 | 급격한 성능 저하 전 마지막 단계 (Last tier before the cliff)
| q5_0-q4_1 | 0 | 1344.00 | 0.001433 | 0.122096 | VRAM 제약 시 기본값 (Default when VRAM-constrained)
| q5_0-q4_0 | 0 | 1280.00 | 0.001516 | 0.121068 | 64.00 MiB 더 저렴하지만 중앙값은 더 나쁨
| q4_0 | 0 | 1152.00 | 0.001846 | 0.154408 | 권장되는 최소 단계 (Smallest recommended tier)
| q4_0-q3_0 | 0 | 1024.00 | 0.003313 | 0.218912 | 컨텍스트를 반드시 맞춰야 할 때 (When the context must fit)
| q3_0 | 0 | 896.00 | 0.004696 | 0.304186 | 비상 압축 (Emergency compression)
| q2_0 | 0 | 640.00 | 0.019374 | 1.198902 | 최후의 수단 (Last resort)
- Gemma Cache Tail KV cache (MiB) Median KLD 99.9% KLD 용도
| bf16 | 0 | 2480.00 | 0 | 0.000047 | 기준점 (Reference)
| q8_0 | 0 | 1317.50 | 0.0371 | 16.813929 | 전체 프리필 (prefill) 속도에서의 일반적인 기본값
| q8_0-q6_0 | 0 | 1162.50 | 0.040875 | 16.839821 | q8_0보다 155.00 MiB 낮음
| q6_0 | 0 | 1007.50 | 0.042636 | 17.30599 | 급격한 성능 저하 전 마지막 단계 (Last tier before the cliff)
| q6_0-q5_0 | 0 | 930.00 | 0.055236 | 17.26157 | K 측면이 더 강함, q5_0보다 77.50 MiB 높음
| q5_0 | 0 | 852.50 | 0.061747 | 18.731647 | 사용 가능한 품질을 위한 메모리 하한선 (Memory floor for usable quality)
| q5_0-q4_0 | 0 | 775.00 | 0.109427 | 19.183374 | 비대칭 압축 (Asymmetric compact)
| q4_0 | 0 | 697.50 | 0.134091 | 20.442234 | 거대한 성능 저하 전의 예산 범위 (Budget body before the huge cliff)
| q4_0-q3_0 | 0 | 620.00 | 0.381216 | 22.304634 | 컨텍스트를 반드시 맞춰야 할 때 (When the context must fit)
| q3_0 | 0 | 542.50 | 0.504075 | 23.15744 | 비상 압축 (Emergency compression)
| q2_0 | 0 | 387.50 | 2.95758 | 27.834961 | 최후의 수단 (Last resort)
/u/Anbeeld에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기