DeepSeek-V4-Flash-Mini 54GB GGUF 약 20.5 t/s 속도로 실행
요약
DeepSeek-V4-Flash 모델을 극단적인 2비트 혼합 양자화(IQ2_XXS) 기술을 통해 54GB 크기로 압축하여 실행한 실험 결과입니다. VRAM 점유율을 40GB 이상 대폭 줄이면서도 초당 약 20.5개의 토큰을 생성하는 성능을 확인했습니다.
핵심 포인트
- 2비트 극단적 양자화 적용으로 모델 크기 대폭 축소
- VRAM/RAM 점유율을 기존 대비 40GB 이상 절감
- 초당 약 20.54 tokens의 추론 속도 달성
- 혼합 양자화(mixed quantization)를 통한 효율성 검증
DeepSeek-V4-Flash의 REAP 적응 버전 ( 0xSero/DeepSeek-V4-Flash-0731-REAP )과 antirez/deepseek-v4-gguf를 영감의 원천으로 삼아, 예산 친화적인 "Mini" 빌드를 만들기 위해 표준 양자화 (quantization) 기술을 얼마나 공격적으로 사용할 수 있는지 확인해 보기로 했습니다. 당연히 재미를 위해서 말이죠. 95GB의 전체 bf16 GGUF로 시작하여 혼합 양자화 (mixed quantization) ( w2Q2K-AProjQ8-OutQ8 )를 적용한 IQ2_XXS 변형으로 압축했습니다. 극단적인 2비트 양자화 (2-bit quantization)가 복잡한 추론에 실용적일까요? 논란의 여지가 있습니다. VRAM/RAM 점유율을 40GB 이상 줄이면서도 여전히 일관성 있게 생성하나요? 물론입니다. 과학은 '왜 안 돼?'를 묻는 것이지, '왜?'를 묻는 것이 아닙니다.
프롬프트 평가 시간 (prompt eval time) = 372.26 ms / 12 tokens (토큰당 31.02 ms, 초당 32.24 tokens)
평가 시간 (eval time) = 81141.35 ms / 1667 tokens (토큰당 48.68 ms, 초당 20.54 tokens)
총 시간 (total time) = 81513.62 ms / 1679 tokens
재사용된 그래프 (graphs reused) = 1804
파일 크기:
-rw-rw-r-- 1 jabbatheduck jabbatheduck 95G Aug 4 16:10 deepseek-v4-flash-bf16.gguf
-rw-rw-r-- 1 jabbatheduck jabbatheduck 54G Aug 4 17:41 DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2.gguf
-rw-rw-r-- 1 jabbatheduck jabbatheduck 353M Aug 4 16:37 DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2-imatrix-0731.gguf
submitted by /u/giveen [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기