
V100 사용자들을 위해: Qwen+Dflash 및 Laguna를 실행하는 SGLang
요약
V100 GPU 사용자들을 위해 SGLang을 최적화하여 Qwen 모델 등을 효율적으로 실행할 수 있는 방법을 제공합니다. TileLang FlashAttention과 Marlin-V100 등을 적용하여 구형 하드웨어에서의 성능을 개선했습니다.
핵심 포인트
- V100 GPU를 위한 SGLang 포크 버전 제공
- TileLang FlashAttention 및 Marlin-V100 적용
- Qwen 3.5/3.6 모델에 대한 Dflash 지원
- 복잡한 빌드 과정을 생략할 수 있는 Docker 이미지 제공
SGLang을 포크(Fork)하여, V100용 TeilLang FlashAttention을 작성하였고, 오픈 소스인 marlin-v100을 사용했으며, sm70을 위한 ungated flashinfer를 적용했습니다. Qwen 3.5/3.6 모델에 대해 Dflash가 작동하도록 만들었고, Laguna S2.1 지원을 추가했으며, Laguna에 dflash가 작동하도록 시도했습니다(현재까지는 성공하지 못했습니다). ~4000-6000pp, ~100 tks tg(Qwen 전용). 나의 4xV100 32GB NVLINK에서 실행 중: https://preview.redd.it/wf4xcerbzqfh1.png?width=1356&format=png&auto=webp&s=3572c5d50a1813d63603b5424bc215631a6d253d https://preview.redd.it/vcb5d3tpzqfh1.png?width=1300&format=png&auto=webp&s=9c0e8b4fbf33265d2580792201b5eed5813d4e9d
Repo: https://github.com/haohervchb/sglang-V100
Tilelang FA: https://github.com/haohervchb/Tilelang-FA-V100
Marlin-V100: https://github.com/zhinianqin/marlin_v100
Docker 이미지가 있어, 영원히 걸릴 것 같은 빌드 과정이 필요하지 않습니다.
submitted by /u/Primary_Exchange21 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기