48GB VRAM에서 속도와 품질을 모두 만족시키는 Qwen 3.8 27B Swift 1.5 (W8A16)
요약
작성자가 속도와 품질을 모두 만족시키기 위해 Qwen 3.8 27B Swift 1.5 양자화 모델(W8A16)을 직접 제작했습니다. 이 모델은 8비트 AWQ + GPTQ 양자화를 거쳤으며, 4개의 RTX 3090 환경에서 vLLM과 MTP를 사용하여 높은 디코딩 속도와 안정적인 성능을 보여줍니다.
핵심 포인트
- Qwen 3.8 27B Swift 1.5 모델은 AWQ + GPTQ 양자화를 적용함.
- 4개의 RTX 3090 환경에서 vLLM 및 MTP를 사용해 테스트됨.
- 약 100 tok/s의 디코딩 속도를 달성하여 효율성을 입증함.
- 48GB VRAM 내에서 최적화된 성능을 제공하는 것이 목표임.
안녕하세요. 때로는 속도와 품질 둘 다가 필요하기 때문에, 제가 직접 Qwen 3.8 27B Swift 1.5 양자화 모델을 만들었습니다. 이 모델은 8비트 AWQ + GPTQ 양자화를 거쳤습니다. 저의 4개의 RTX 3090으로 사랑과 정성을 들여 제작했으니 (모델 카드를 읽어보세요), 48GB VRAM에서 얻을 수 있는 최고의 절충안이라고 생각합니다. 제 워크플로우에서 2개의 RTX 3090과 vLLM 및 MTP를 사용하여 실행해 보니, 거의 100 tok/s의 디코딩 속도(MTP=5 기준)로 완벽하게 작동하며, 기존의 3.8 27B 모델보다 과잉 사고를 덜 하는 것 같습니다 :) 카드당 약 21.6GB가 사용됩니다 (vLLM을 128k 컨텍스트 및 FP16 KV 캐시로 실행했을 때). https://huggingface.co/TacGibs/Swift-1.5-Qwen3.8-27B-W8A16 다른 분들에게 유용했으면 좋겠습니다! /u/TacGibs가 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기