
Qwen3.6-27B의 추측적 디코딩 (Speculative Decoding)은 더 무거운 양자화 (Quant) 모델에서 성능이 향상됩니다
요약
Qwen3.6-27B 모델을 대상으로 다양한 양자화 수준에 따른 추측적 디코딩(Speculative Decoding) 성능을 벤치마킹한 결과입니다. 양자화가 무거울수록 추측적 디코딩을 통한 속도 향상 이득이 더 커지는 경향을 확인했습니다.
핵심 포인트
- 양자화 수준이 높을수록(Q8 > Q6 > Q4) 추측적 디코딩의 속도 이득이 증가함
- nvfp4/SGLang 조합과 DFlash 알고리즘이 전반적으로 가장 빠른 성능을 보임
- MTP 방식은 전반적으로 견고한 성능을 유지하나, 특정 환경(llama.cpp UD-Q4)에서는 매우 느려질 수 있음
- 본 결과는 단일 하드웨어 및 특정 워크로드 조건에서의 상한선임을 유의해야 함
Qwen3.6-27B를 대상으로 다양한 양자화 (Quant) 모델 전반에 걸친 주요 알고리즘의 추측적 디코딩 (Speculative Decoding) 속도 벤치마킹 중 속도 측정 단계를 마쳤습니다. 종합적인 결과: 양자화 (Quant)가 무거울수록 추측적 디코딩 (Speculative Decoding)을 통해 얻는 이득이 더 큽니다 (10개의 추측적 디코딩 설정 모두에서 배율 기준 Q8 > Q6 > Q4 순으로 나타남). 일치하는 깊이 (Matched depth)에서 수락률 (Acceptance)은 양자화 (Quant)와 무관하지만, 기본 단계 (Base step)는 가중치 바이트 (Weight bytes)가 늘어남에 따라 느려지며, 초안+검증 (Draft+verify) 오버헤드는 그렇지 않습니다. 예외적으로 nvfp4/SGLang 조합이 전체적으로 가장 빠른 양자화/엔진 쌍입니다. DFlash가 전체적으로 가장 빠른 알고리즘입니다. Weaver가 이를 능가하지만 이는 예외적인 경우입니다: 포크 전용 (Fork-only)이며 헤드 (Head)가 타겟별로 지정되어 있어, 일반적인 옵션이 아닌 특정 모델/양자화 조합에 해당합니다. Weaver의 레시피, 패치 및 버전 정보: https://gist.github.com/thavoc/a9f3a37c082e7a8bbcf2b8efebfada25 MTP는 모든 곳에서 견고한 2위를 차지했습니다. EAGLE3는 두 방식 모두에 밀리며, DFlash 초안 작성기 (Drafter)가 없을 때의 폴백 (Fallback) 용도로만 유용합니다. ngram은 건너뛰는 것이 좋습니다: 양자화 (Quant)와 상관없이 약 1.03배 수준이며, 동시성 (Concurrency) 환경에서는 오히려 마이너스 효과를 냅니다. 흥미로운 이상 현상: llama.cpp의 UD-Q4 기반 MTP 경로는 병적으로 느립니다. Q4 MTP-3는 동일한 수락률 (Acceptance)을 가질 때 Q6 MTP-3보다 절대적인 tok/s가 더 느리며, 이는 대역폭 (Bandwidth)만으로는 설명할 수 없습니다. 출력은 정확하지만 메커니즘은 알려지지 않았습니다. 주의 사항: 단일 하드웨어 구성에 대한 좁은 데이터 포인트입니다. 짧은 출력, 탐욕적 (Greedy) 방식, 배치 (Batch) 1을 사용한 Spec-Bench는 추측적 디코딩 (Speculative Decoding)의 최적 사례에 가깝습니다. 동시성 (Concurrency) 환경에서는 스트림당 이득이 줄어들고, 더 긴 컨텍스트 (Context)는 이를 더욱 압축할 것이므로, 이를 일반적인 속도 향상이 아닌 이 워크로드 형태에 대한 상한선으로 취급하십시오. 아직 정확도 A/B 테스트도 진행되지 않았으므로, 이 결과는 더 무거운 양자화 (Quant)의 품질이 남은 속도 차이를 감수할 만큼 가치가 있는지에 대해서는 아무것도 말해주지 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기