
RTX 5060 Ti에서 Qwen3.5 35B A3B float8을 55 tok/s로 실행하기 위한 Extended garlic
요약
RTX 5060 Ti 환경에서 Qwen3.5 35B 모델을 55 tok/s의 속도로 실행하기 위한 최적화 기법을 소개합니다. Gated Delta Network 커널을 적용하여 기존 llama.cpp의 Q8 양자화 방식보다 훨씬 빠른 성능을 구현했습니다.
핵심 포인트
- Gated Delta Network 커널 적용을 통한 추론 속도 향상
- RTX 5060 Ti에서 Qwen3.5 35B 모델을 55 tok/s로 실행
- llama.cpp Q8 양자화 방식 대비 현저히 높은 성능 기록
- MTP(Multi-Token Prediction) 미적용 상태에서의 결과
이전 게시물( https://www.reddit.com/r/LocalLLaMA/comments/1utefpr/running_qwen3_30b_a3b_at_50_toks_on_rtx_5060_ti/ )에서 Qwen3.5 35B를 도입하는 것에 대한 수요가 매우 높았던 것으로 보입니다. 이후 몇 가지 Gated Delta Network 커널을 적용하여 이를 구현했습니다. 이 모델은 55 tok/s로 실행됩니다 (녹화 중이 아닐 때는 61 tok/s - 녹화가 CPU 및 GPU 용량을 소모하기 때문). 이는 Q8 양자화 (quant)로 Qwen3.5 35B를 실행하는 llama.cpp보다 성능이 현저히 뛰어납니다. 참고로, 이는 MTP 없이 구현된 결과입니다. MTP는 단순히 여러 토큰을 생성한다는 기본적인 이유 외에도 몇 가지 멋진 이유들 덕분에 생성 속도를 더욱 높일 수 있습니다. 이 높은 속도를 얻기 위해 사용된 트릭을 기록하는 블로그 포스트를 작업 중입니다. /u/Azazelionide에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기