Qwen3.8-27B UD-IQ4_XS Heretic + MTP를 16 GB 카드에서 테스트한 결과 (55-68 tok/s)
요약
본 기사는 RTX 4080 (16GB) 환경에서 Qwen3.8-27B 모델을 MTP(Multi-Turn Prompting)와 Heretic 빌드를 적용하여 테스트한 결과를 분석합니다. 특히, 기존 양자화 방식의 한계를 극복하고 품질 손실을 최소화하기 위해 자체 제작한 UD-IQ4_XS 버전을 개발했습니다. 이 모델은 속도와 품질 간의 트레이드오프를 보여주며, VRAM 용량과 시스템 환경이 성능에 미치는 영향을 상세히 다룹니다.
핵심 포인트
- 16GB VRAM 제약 하에 Qwen3.8-27B의 최적화된 양자화 모델(UD-IQ4_XS)을 개발함.
- MTP 활성화 시, 일반적인 환경 대비 코드 및 프로즈 생성 속도가 크게 향상됨 (55~68 tok/s).
- 모델 품질은 KLD 값으로 측정되며, 낮은 값이 더 우수함을 의미합니다. (UD-IQ4_XS가 경쟁 모델보다 우위)
- VRAM 용량과 시스템 리소스(백그라운드 앱)는 추론 속도에 치명적인 영향을 미칩니다.
저는 RTX 4080에 MTP가 활성화된 상태로, 검열되지 않은 Qwen3.8-27B (llmfan46의 Heretic 빌드, MTP 헤드 유지)를 사용하고 싶었습니다 (수많은 설정을 테스트해 본 결과 이것이 가장 적합하다고 판단했기 때문입니다). 하지만 공개된 어떤 양자화(quantization) 모델도 이를 위해 만들어지지 않았습니다. 좋은 IQ4_XS는 MTP를 위한 공간을 남겨두지 못했고, 들어가는 모델들은 3비트였습니다. 저는 이에 놀랐습니다. 16GB가 매우 흔한 용량이기 때문에, 이 용량에 맞게 양자화하여 품질 손실을 최소화하면서도 잘 작동하도록 만들기로 결정했습니다. Unsloth의 per-tensor UD 레시피를 llmfan46의 BF16에 적용하고, 12 / 16 / 24 GB 버전을 만들어냈으며, 찾을 수 있는 모든 양자화 모델과 동일한 가중치에 대해 Q8_0 대비 KLD(Kullback-Leibler Divergence)를 측정했습니다.
품질 (Q8_0 대비 평균 KLD, wikitext-2 / llama.cpp 소스 코드, 낮을수록 좋음)
| Quant | GiB | Prose Code | UD-Q5_K_XL (제작) | 19.44 | 0.0045 | 0.0037 |
|---|---|---|---|---|---|---|
| mradermacher i1-IQ4_XS | 14.26 | 0.0202 | 0.0149 | |||
| UD-IQ4_XS (제작, 16 GB) | 13.27 | 0.0268 | 0.0192 | |||
| llmfan46 Q3_K_M | 13.48 | 0.0639 | 0.0456 | |||
| mradermacher i1-IQ3_M | 11.89 | 0.0649 | 0.0465 | |||
| UD-IQ3_XXS (제작, 12 GB) | 10.18 | 0.0904 | 0.0587 | |||
| mradermacher i1-Q2_K | 10.12 | 0.1551 | 0.1017 |
4080에서의 속도 (llama.cpp b11457, 15K 토큰 프롬프트, 32K 컨텍스트, MTP 2 드래프트, 3개 고정 시드 평균): UD-IQ4_XS는 코드에서 55 tok/s, 프로즈(prose)에서 50 tok/s를 기록했습니다. 이는 MTP가 없을 때의 29 / 29 대비 수치입니다. i1-IQ3_M이 더 빠르지만 (70 / 54), KLD가 2.4배 높기 때문에 저는 속도보다 품질을 선호합니다. 하지만 선택은 여러분에게 달려 있습니다.
예상치 못한 점들: 드래프트 토큰 2개가 3개보다 성능이 좋았습니다. 동일한 시드에서 40K 컨텍스트를 사용했을 때: 코드에서 68 vs 56 tok/s, 프로즈에서 55 vs 36 tok/s였습니다. 거부된 드래프트가 더 적었습니다. 48K 대 40K는 정확히 동일한 토큰(시드당 동일한 드래프트 수용 횟수)을 생성했으며 속도는 22% 느렸습니다. 이것은 순전히 VRAM이 공유 메모리로 넘쳐흐른 것일 뿐, 다른 이유는 아닙니다.
16 GB의 한계는 매우 심각합니다. 같은 40K 설정에서도 데스크톱이 VRAM을 1.2GB, 1.4GB 또는 1.9GB 보유하고 있는지에 따라 코드에서 각각 68, 51, 42 tok/s라는 다른 속도를 보였습니다. 생성 도중 Chrome 창을 열자 디코딩 속도가 0.2 tok/s까지 떨어졌습니다. 만약 Windows를 사용하며 같은 카드에 모니터를 연결했다면, Task Manager의
q6_K head vs IQ3_S head: 코드에서는 83% 대 83%의 수용률을 보였고, 산문(prose)에서는 58% 대 54%를 보였습니다. 세 파일과 명령어, 스크립트(레시피 추출, 건식 실행 검증, KLD, 시드 속도 벤치): https://huggingface.co/codavidgarcia/Qwen3.8-27B-Uncensored-Heretic-MTP-UD-GGUF 이 링크에서 확인할 수 있습니다. 12 GB와 24 GB의 컨텍스트 숫자는 해당 카드에서 측정한 것이 아니라 llama.cpp가 보고한 버퍼를 기반으로 계산된 것입니다. 직접 실행해 보시고 결과를 알려주세요! 가중치(weights)는 llmfan46에게, 레시피는 Unsloth에게, imatrix는 mradermacher에게 크레딧을 전합니다. 즐겁게 사용하세요! 수정: 몇몇 분들이 수치에 대해 질문하셔서 KLD 차트를 추가했습니다 (낮을수록 좋습니다). https://preview.redd.it/pxp048081juh1.png?width=3200&format=png&auto=webp&s=5ee30548379fa9e7edce9e0242844656f2e89c07 /u/ZestRocket 님이 제출한 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기