
LFM2.5-2.6B 모델 및 KV 캐시 양자화 (Quantization) 보고서
요약
LiquidAI의 초소형 모델 LFM2.5-2.6B에 대한 양자화 성능 분석 보고서입니다. 다양한 GGUF 및 KV 캐시 양자화 조합을 통해 메모리 제한 환경에서의 성능 저하를 실험적으로 검증했습니다.
핵심 포인트
- LFM2.5-2.6B는 8GB Raspberry Pi에서 성능 저하 없이 구동 가능
- 모델 양자화 품질이 KV 캐시 양자화보다 성능 저하에 더 민감함
- Q4_K_M 양자화 방식은 사용을 권장하지 않음
- 로그 KLD 지표는 성능 저하를 완만하게 보여주어 착시를 일으킬 수 있음
LFM2.5-2.6B는 LiquidAI에서 출시한 새로운 초소형 모델로, 훨씬 더 큰 모델들과 대등하게 경쟁하는 벤치마크 성능을 보여줍니다. 저는 주어진 메모리 양에 대해 모델의 최적의 전반적인 양자화 (Quantization) 상태를 파악하기 위해, 다양한 모델 GGUF 양자화 (Quants)와 다양한 KV 캐시 양자화 (Quants)를 교차하여 llama-perplexity를 실행했습니다. 또한 서로 다른 양자화 지표들이 모델의 성능 저하를 어떻게 보여주거나(또는 숨기거나) 하는지도 보여줍니다. 전체 보고서 및 해설, 대화형 HTML 플롯(Interactive HTML plots). 읽을 시간이 없다면: 이 모델은 실질적인 성능 저하 없이 8GB Raspberry Pi에 탑재 가능하며, 4GB Raspberry Pi에서는 제한적인 성능 저하와 함께 탑재 가능합니다. Q4_K_M은 절대 사용하지 마십시오. 이 모델의 경우, 모델 양자화 (Model quant) 품질이 KV 캐시 양자화 (KV cache quant) 품질보다 더 빠르게 저하됩니다. Abliteration은 약 ~0.075 KLD의 고정된 비용이 발생합니다. 로그 KLD (Logarithmic KLD) 및 Top-1% 플롯은 품질 저하가 완만하다고 말하며 당신을 속이지만, 실제로는 절벽처럼 급격하게 일어납니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기