Qwen3.6-27B IQ4_XS FULL VRAM with 110k context
요약
본 기사는 Qwen3.6-27B 모델의 VRAM 최적화 문제를 다루며, 특정 `llama.cpp` 커밋이 모델 크기를 불필요하게 증가시켜 16GB VRAM 환경에서 사용성을 떨어뜨린 사례를 지적합니다. 작성자는 해당 커밋을 되돌리고(reverting) 기존의 고효율 양자화 방식인 IQ4_XS를 복원하여, Qwen3.6-27B 모델을 14.7GB로 최적화했습니다. 이 커스텀 모델은 16GB VRAM 환경에서 높은 성능과 함께 최대 110k 컨텍스트 길이까지 처리할 수 있음을 입증했습니다.
핵심 포인트
- Qwen3.6-27B의 기본 배포 버전이 특정 `llama.cpp` 커밋으로 인해 크기가 증가(14.7GB $\rightarrow$ 15.1GB)하여 16GB VRAM 환경에서 사용성이 저하됨.
- 문제의 원인은 `attn_qkv` 레이어 양자화가 최소 Q5_K로 하드코딩된 특정 `llama.cpp` 커밋에 기인함.
- 작성자는 해당 문제를 해결하기 위해 커스텀 모델을 제작하여, IQ4_XS와 같은 고효율 양자화를 복원하고 16GB VRAM에서 14.7GB 크기를 유지하는 데 성공함.
- 최적화된 모델은 Perplexity 테스트를 통해 16GB VRAM 내에서 최대 110k 컨텍스트 길이까지 안정적으로 처리할 수 있음을 보여줌.
Qwen3.6-27B IQ4_XS Bloat: llama.cpp 커밋 되돌리기로 16GB VRAM 절약 (15.1GB vs 14.7GB) + KVCache 테스트
편집: 생각 끝에 이 이슈를 제출했습니다: https://github.com/ggml-org/llama.cpp/issues/22544
편집: 이 토픽에서 설명된 버그는 이제 수정되었습니다: https://github.com/ggml-org/llama.cpp/pull/22572
Qwen3.6-27B 출시와 함께, 3.5 버전의 mradermacher가 만든 우수한 IQ4_XS 양자화(14.7GB)(Qwen3.5-27B-i1-GGUF)와 비교했을 때, 현재 이미지가 부풀려진(bloated) 것을 발견했습니다. Qwen3.6에 해당하는 모델(Qwen3.6-27B-i1-GGUF)는 현재 15.1GB의 용량을 차지합니다.
IQ4_XS는 진정한 '유니콘'입니다. 모든 벤치마크에서 크기 대비 모델 품질 면에서 놀라운 비율을 제공합니다. 실제로는 적절한 컨텍스트를 가진 27B 모델을 16GB VRAM으로 구동할 수 있는 유일한 실행 가능한 옵션입니다. 이보다 낮은 양자화는 코딩 작업에 부적합합니다. 불행하게도, 14.7GB에서 15.1GB로의 증가는 16GB 카드 사용 경험을 망가뜨립니다.
원인 및 해결책 원인은 특정 llama.cpp 커밋(1dab5f5a44)입니다: GitHub 링크. 이 커밋은 attn_qkv 레이어 양자화를 최소한 Q5_K로 하드코딩합니다.
이를 수정하기 위해, 저는 소스 코드를 수정하여 원래의 IQ4_XS 레이어 양자화를 1:1로 재현했습니다. mradermacher의 imatrix(Qwen3.6-27B-i1-GGUF)를 사용하고 비교 벤치마크를 수행했습니다. 모델 품질에서 유의미한 저하를 관찰하지 못했습니다. 제 생각에는 언급된 커밋이 IQ4_XS 형식에 대한 순수한 회귀(regression)입니다.
레이어를 되돌린 제가 만든 14.7GB 모델은 여기에서 사용할 수 있습니다: 👉 cHunter789/Qwen3.6-27B-i1-IQ4_XS-GGUF
Perplexity 벤치마크: 65k 컨텍스트 (-c 65536)
테스트 매개변수: pg19.txt (여기 Project Gutenberg에서 다운로드), --chunks 32*,
-ngl 99(명시되지 않은 경우),-fa 1*,-b 512*,-ub 128
| ID | 모델 크기 | 모델 파일 / 버전 | -ctk | -ctv | 최종 PPL |
|---|---|---|---|---|---|
| 1 | 15.1GB | Qwen3.6-27B.i1-IQ4_XS.gguf (표준) | q8_0 | q8_0 | 7.3765 ± 0.0276 |
| 2 | 14.7GB | ...-IQ4_XS-attn_qkv-IQ4_XS.gguf (커스텀) | q8_0 | q8_0 | 7.3804 ± 0.0276 |
| 3 | 14.7GB | ...-IQ4_XS-attn-qk |
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기