
Qwen3.6 NVFP4 Unsloth 양자화 모델: 2.5배 더 빠른 속도
요약
Unsloth가 Qwen3.6 모델에 대해 NVIDIA NVFP4 양자화보다 최대 2.5배 빠른 속도를 제공하는 새로운 양자화 모델을 출시했습니다. W4A4 방식을 사용하여 정확도 저하를 최소화하면서도 추론 속도를 대폭 향상시켰습니다.
핵심 포인트
- W4A4 방식을 통해 NVIDIA NVFP4 대비 최대 2.5배 빠른 속도 구현
- FP8 KV 캐시 보정으로 컨텍스트 길이를 자동으로 2배 확장 가능
- MMLU-Pro, GPQA 등 주요 벤치마크에서 기존 방식과 대등한 정확도 유지
- 35B 모델에 대해 속도 최적화 버전(Fast)과 정확도 유지 버전 제공
r/LocalLLaMA 여러분, 안녕하세요! 저희는 Qwen3.6 27B 모델에 대해 NVFP4 양자화 (quants) 속도를 2.5배 향상시켰으며, 35B-A3B 모델의 경우 NVIDIA의 NVFP4 양자화 대비 1.56배에서 1.79배 더 빠르게 만들었습니다. 정확도 저하 없이 말이죠! 저희는 행렬 곱셈 (matmuls)을 위해 실제 4bit 텐서 코어 (tensor cores)를 사용하는 W4A4를 사용한 반면, NVIDIA의 방식은 W4A16을 사용합니다. FP8 KV 캐시 (KV Cache) 보정 (calibration)도 제공되어, 자동으로 2배 더 긴 컨텍스트 (contexts)를 사용할 수 있습니다. 정확도 측정을 위해 FP8, BF16, NVIDIA의 NVFP4 및 저희의 NVFP4를 대상으로 MMLU-Pro, AIME 2025, GPQA 테스트를 수행했습니다. 또한 MTP가 미리 임베디드 (pre-embedded)되어 있습니다. 저희는 두 가지 버전의 35B 모델인 NVFP4-Fast (1.79배 더 빠름)와 NVFP4 (1.56배 더 빠름)를 제공합니다. NVFP4-Fast는 W4A4를 완전히 사용하는 반면, 일반 NVFP4는 정확도를 조금 더 유지하기 위해 혼합 방식을 사용합니다.
NVFP4 링크:
Qwen3.6-35B-A3B-NVFP4 (1.56배 더 빠름)
Qwen3.6-35B-A3B-NVFP4-Fast (1.79배 더 빠름)
Qwen3.6-27B-NVFP4 (2.5배 더 빠름)
Qwen3.6-27B
| 제공자 (Provider) | MMLU-Pro | GPQA | AIME 2025 |
|---|---|---|---|
| Unsloth | 86.25 | 86.34 | 93.12 |
| NVIDIA | 85.96 | 86.87 | 93.12 |
| FP8 | 86.11 | 86.87 | 93.75 |
| BF16 | 85.96 | 88.13 | 93.33 |
Qwen3.6-35B-A3B
| 제공자 (Provider) | MMLU-Pro | GPQA | AIME 2025 |
|---|---|---|---|
| Unsloth | 85.85 | 86.74 | 92.29 |
| Unsloth Fast | 85.58 | 87.75 | 91.67 |
| NVIDIA | 85.60 | 87.12 | 91.88 |
| FP8 | 85.75 | 86.74 | 93.12 |
| BF16 | 85.75 | 86.36 | 92.50 |
저희의 NVFP4 Qwen3.6 블로그에서 더 많은 분석과 벤치마크를 확인하실 수 있습니다: https://unsloth.ai/docs/models/qwen3.6#nvfp4
즐거운 주말 보내세요 여러분! 또한 DGX Spark 사용자분들은 flashinfer 백엔드 (backend)를 사용하세요. 그렇지 않으면 추론 (inference) 속도가 2배 더 느려질 것입니다!
저희 블로그에는 /u/danielhanchen이 r/LocalLLaMA에 제출한 더 자세한 내용이 담겨 있습니다. [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기