LexiPanel로 최적화된 Qwen3.8-27B CODER 모델: 24GB 카드에 적합한 성능 분석
요약
LexiPanel로 최적화된 Qwen3.8-27B CODER 모델을 소개하며, 24GB GPU 환경에 맞춰 컨텍스트 길이와 메모리 사용량을 최적화했습니다. 이 모델은 MTP 헤드를 유지하여 별도 초안 모델 없이 에이전트 코딩 작업에 활용 가능하며, 실제 테스트에서 높은 디코딩 속도를 보여줍니다.
핵심 포인트
- 24GB GPU 환경에 맞춘 Qwen3.8-27B CODER 최적화 모델 제공
- MTP 헤드 유지로 별도 초안 모델 없이 에이전트 코딩 가능
- 실제 테스트에서 높은 디코딩 속도(최대 46 t/s) 확인
- llama.cpp를 활용한 상세 실행 명령어 및 설정 가이드 포함
https://huggingface.co/Wa1k3r/Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit
Qwen3.8-27B CODER — IQ4_XS imatrix · 24 GB card fit · ~262k context · MTP draft
Quantized, Abliterated, and fitted by LexiPanel. 이 모델은 Fit planner가 텐서 혼합(tensor mix)을 선택하여 약 240k 토큰의 컨텍스트를 가진 24 GB GPU에 채우도록 설계되었습니다. 코드 중심 텍스트에서 중요성 행렬(importance matrix)을 구축했으며, MTP 헤드(MTP head)는 Q8_0으로 유지되어 별도의 초안 모델 없이도 --spec-type draft-mtp가 작동합니다.
이 업로더는 에이전트 코딩(agentic coding)을 위해 매일 사용하고 있습니다. RX 7900 XTX에서 컨텍스트에 이미 110k–170k 토큰이 있을 때 디코딩 속도는 초당 36–41 토큰입니다.
파일
파일 유형 크기 내부
Wa1k3r/Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit.gguf IQ4_XS + imatrix 18.35 GB (17.1 GiB) MTP 헤드는 Q8_0, 토큰 임베딩은 Q4_K
측정 속도 (실제 사용, 합성 벤치마크 아님)
이 수치는 2026-10-01에 에이전트 코딩 세션에서 발생한 98개의 요청을 서버 자체에서 측정한 결과입니다:
컨텍스트 창 내 토큰 개수 요청 디코드, 중앙값 디코드 범위
65k – 131k 토큰 42 41.2 t/s 33.8 – 46.0 t/s
131k – 171k 토큰 56 36.0 t/s 30.7 – 43.0 t/s
MTP 초안 수용률: 중앙값은 85%입니다 (요청의 중간 절반이 75%와 94% 사이에 속함). 이는 초안 깊이(draft depth) 2에서 디코드 단계당 약 2.7 토큰으로 계산됩니다.
프리필(Prefill):
108k 토큰 프롬프트에 대해 초당 387 토큰;
147k–156k 깊이에서 추가된 약 4.5k개 새 토큰에 대해 초당 175–183 토큰.
VRAM: 컨텍스트 245,760 토큰 사용 시 24.6 GB 중 24.2 GB 사용하며, q4_1 KV 캐시와 CPU의 비전 프로젝터(vision projector)가 사용되었습니다.
설정: AMD Radeon RX 7900 XTX (24 GB), llama.cpp b11235를 Vulkan 백엔드에서 사용하고 모든 레이어를 GPU에, 하나의 슬롯에 배치했습니다.
llama.cpp로 실행하기
llama-server -m Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit.gguf \ -c 262144 -np 1 -ngl 99 --flash-attn on \ --cache-type-k q4_1 --cache-type-v q4_1 \ --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0 \ --jinja --reasoning on --reasoning-format deepseek \ --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 \ -b 2048 -ub 512 --cache-reuse 256
Context: -c 262144는 q4_1 KV 캐시를 사용하는 24GB 카드에 가중치와 함께 적합한 값입니다. 모델의 네이티브 창(native window)은 262,144 토큰입니다. 더 작은 카드의 경우, -c 값을 낮추십시오.
Speculative decoding: --spec-type draft-mtp는 이 파일 내에 MTP 레이프(layer)를 포함하는 초안(drafts)을 사용하므로 별도의 초안 모델이 필요하지 않습니다. qwen35 아키텍처와 draft-mtp를 지원하는 최신 llama.cpp가 필요하며, 이 카드는 b11235에서 측정되었습니다.
Sampling: 이는 Qwen이 권장하는 설정이며, 파일에 저장되어 있습니다.
Agent loops: 호스트 RAM 프롬프트 캐시(host-RAM prompt cache)가 도움이 됩니다. 예를 들어 --cache-ram 5631 (MiB).
Vision: 이 리포지토리에는 언어 모델만 포함되어 있습니다. Qwen3.8-27B mmproj를 추가하려면 --mmproj mmproj-F16.gguf --no-mmproj-offload를 사용하십시오. 그러면 프로젝터가 CPU에서 실행되고 VRAM은 컨텍스트에 할당된 상태로 유지됩니다.
LexiPanel이 이를 구현한 방법
Conversion: 소스 가중치(source weights)는 MTP 헤드(head)가 포함된 BF16 GGUF로 변환되었습니다.
Importance matrix: 약 30만 토큰(570 청크)의 코드 중심 보정 텍스트(calibration text)에서 계산되었습니다. 4분의 3은 Python 소스(표준 라이브러리 및 설치된 패키지)이며, 나머지는 기술 문서, README, 라이선스 텍스트 등 코딩 에이전트가 컨텍스트로 채우는 종류의 텍스트입니다.
Quantization: llama.cpp b11182의 llama-quantize를 사용하여 해당 매트릭스를 가진 IQ4_XS 파일을 만들었습니다. MTP 헤드는 Q8_0으로 유지되어 초안이 정확하게 유지되며, 토큰 임베딩은 Q4_K입니다.
Fitting the card: LexiPanel의 Fit 플래너는 262144 토큰 컨텍스트를 가진 24GB 카드에 대해 품질을 우선시하는 혼합 방식을 선택했습니다. 파일 크기가 가장 작은 것이 아니라, 해당 컨텍스트에서 카드가 감당할 수 있는 최고의 품질을 가져갔습니다.
크레딧 및 라이선스
양자화(Quantization), 중요도 행렬(importance matrix), MTP 초안 설정 및 카드 적합성: LexiPanel.
사용 도구: llama.cpp.
라이선스는 Apache-2.0입니다. 가중치에는 거부율 감소("uncensored")가 적용되었으므로, 사용 방법은 사용자 본인의 책임입니다.
Qwen3.8-27B CODER — IQ4_XS imatrix · 24 GB 카드 적합성 · ~262k 컨텍스트 · MTP 초안
LexiPanel에 의해 양자화(Quantized), 제거(Abliterated) 및 적합화(fitted)되었습니다. 이의 Fit planner는 약 240k 토큰의 컨텍스트를 가진 24 GB GPU 하나를 채우기 위해 텐서 혼합을 선택했습니다. 코드 중심 텍스트에서 중요도 행렬을 구축했으며, MTP 헤드는 Q8_0으로 유지하여 별도의 초안 모델 없이 --spec-type draft-mtp가 작동합니다. 업로더는 에이전트 코딩(agentic coding)을 위해 매일 이를 실행합니다. RX 7900 XTX에서는 컨텍스트에 이미 110k–170k 토큰이 있는 상태에서 36–41 tokens/s의 속도로 디코딩됩니다.
파일
파일 유형 크기 내부 정보
Wa1k3r/Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit.gguf IQ4_XS + imatrix 18.35 GB (17.1 GiB) MTP 헤드는 Q8_0, 토큰 임베딩은 Q4_K
측정 속도 (실제 사용, 합성 벤치마크 아님)
이 수치는 2026-10-01에 진행된 에이전트 코딩 세션에서 발생한 98개의 요청을 서버 자체에서 측정한 결과입니다:
컨텍스트 창 내 컨텍스트 토큰 요청 디코드, 중앙값 디코드, 범위
65k – 131k 토큰 42 41.2 t/s 33.8 – 46.0 t/s
131k – 171k 토큰 56 36.0 t/s 30.7 – 43.0 t/s
MTP 초안 수용률: 중앙값은 85%입니다 (요청의 중간 절반이 75%와 94% 사이에 속함). 이는 초안 깊이(draft depth) 2에서 약 2.7 토큰당 디코드 단계로 계산됩니다.
프리필(Prefill):
콜드한 108k 토큰 프롬프트에 대해 387 t/s;
147k–156k 깊이에서 추가된 약 4.5k개의 새 토큰에 대해 175–183 t/s.
VRAM: 컨텍스트 262144 토큰 사용 시 24.6 GB 중 24.2 GB 사용, q4_1 KV 캐시 및 CPU의 비전 프로젝터 포함.
설정: AMD Radeon RX 7900 XTX (24 GB), Vulkan 백엔드의 llama.cpp b11235, 모든 레이어 GPU에 배치, 슬롯 하나.
llama.cpp로 실행하기
llama-server -m Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit.gguf
-c 262144 -np 1 -ngl 99 --flash-attn on
--cache-type-k q4_1 --cache-type-v q4_1
--spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0
--jinja --reasoning on --reasoning-format deepseek
--temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
-b 2048 -ub 512 --cache-reuse 256
Context: -c 262144는 q4_1 KV 캐시를 사용하는 24 GB 카드에 가중치와 함께 들어가는 크기입니다. 모델의 기본 컨텍스트 창은 262,144 토큰입니다. 더 작은 카드의 경우, 먼저 -c 값을 낮추세요.
Speculative decoding: --spec-type draft-mtp는 이 파일 내부에 MTP 레이프를 포함하는 초안(drafts)을 사용하므로 별도의 초안 모델이 필요하지 않습니다. qwen35 아키텍처와 draft-mtp를 지원하는 최신 llama.cpp가 필요하며, 이 카드는 b11235에서 측정되었습니다.
Sampling: 이는 Qwen이 권장하는 설정이며 파일에도 저장되어 있습니다.
Agent loops: 예를 들어 --cache-ram 5631 (MiB)과 같은 호스트 RAM 프롬프트 캐시가 도움이 됩니다.
Vision: 이 리포지토리는 언어 모델만 포함합니다. --mmproj mmproj-F16.gguf --no-mmproj-offload를 사용하여 Qwen3.8-27B mmproj를 추가하세요. 그러면 프로젝트(projector)는 CPU에서 실행되고 VRAM은 컨텍스트에 남아 있습니다.
LexiPanel이 이를 만든 방법
Conversion: 소스 가중치는 MTP 헤드를 포함하여 BF16 GGUF로 변환되었습니다.
Importance matrix: 약 30만 토큰 (570 청크)의 코드 중심 교정 텍스트에서 계산되었습니다. 4분의 3은 Python 소스(표준 라이브러리 및 설치된 패키지)이며, 나머지는 기술 문서, README, 라이선스 텍스트 등 코딩 에이전트가 컨텍스트를 채우는 유형의 텍스트입니다.
Quantization: llama.cpp b11182의 llama-quantize를 사용하여 해당 행렬로 IQ4_XS 파일을 만들었습니다. MTP 헤드는 Q8_0으로 유지되어 초안이 정확하게 유지되며, 토큰 임베딩은 Q4_K입니다.
Fitting the card: LexiPanel의 Fit 플래너는 262144 토큰 컨텍스트를 가진 24 GB 카드에 대해 품질을 우선하는 혼합 방식을 선택했습니다. 파일 크기가 가장 작은 것이 아니라, 해당 컨텍스트에서 카드가 감당할 수 있는 최고의 품질을 가져갔습니다.
크레딧 및 라이선스
양자화(Quantization), 중요도 행렬(importance matrix), MTP 초안 설정 및 카드 적합성: LexiPanel.
도구: llama.cpp.
라이선스는 Apache-2.0을 따릅니다. 가중치에는 거부율 감소(
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기