Baidu Kunlun을 위한 vLLM
요약
vLLM Kunlun은 Kunlun XPU에서 vLLM을 원활하게 실행할 수 있도록 설계된 하드웨어 플러그인입니다. Transformer, MoE, 멀티모달 모델 등 다양한 오픈 소스 모델을 지원하며, 소스 코드 수정 없이 표준 플러그인 방식으로 통합이 가능합니다.
핵심 포인트
- Kunlun XPU를 위한 하드웨어 플러그형 인터페이스 제공
- Qwen, Llama, DeepSeek, Gemma4 등 20개 이상의 모델 지원
- W8A8, AWQ, GPTQ 등 다양한 양자화 방식 지원
- Multi-LoRA 및 고성능 추론을 위한 그래프 최적화 제공
📖 문서 (Documentation) |
🚀 빠른 시작 (Quick Start) |
📦 설치 (Installation) |
💬 Slack
- [2026/07] 🚧
v0.25.1 개발 중— Qwen3.5 / Qwen3.5-MoE, Gemma4 (텍스트 및 멀티모달), GLM MoE DSA, 그리고 DFlash speculative decoding (추측적 디코딩) 추가 - [2026/02] ⚡
성능 최적화 (Performance optimizations)— 작은 배치(small batches)를 통한 MoE 융합(Fused MoE), 어텐션 메타데이터 구축 최적화, Multi-LoRA 추론이 non-LoRA 성능의 80% 이상 달성 - [2026/02] 🔧
DeepSeek-V3.2 MTP 지원— DeepSeek-V3.2를 위한 MTP (Multi-Token Prediction) 추가, RoPE 및 디코딩 단계 커널 최적화 포함 - [2026/01] 🔢
새로운 양자화 (quantization) 방법— compressed-tensors W4A16, AWQ MoE W4A16, 그리고 DeepSeek-V3.2 W8A8 양자화 지원 - [2026/01] 🛠️
CI/CD 전면 개편— E2E 테스트, 유닛 테스트 CI, ruff 포맷 체크, 그리고 모듈형 CI 워크플로우 리팩토링 추가 - [2025/12] 🎉
v0.11.0 출시— Qwen3-Omni, Qwen3-Next, Seed-OSS 지원 (Release Notes) - [2025/12] 📦
v0.10.1.1 출시— 5개 이상의 멀티모달 모델, dense 모델을 위한 AWQ/GPTQ 양자화, Piecewise Kunlun Graph, vLLM V1 엔진, 10-100배의 속도 향상을 보이는 Flash-Infer Top-K/Top-P 샘플링 (Release Notes) - [2025/12] 🌟 vLLM Kunlun의 초기 출시 — 2025년 12월 8일 오픈 소스 공개
vLLM Kunlun (vllm-kunlun)은 Kunlun XPU에서 vLLM을 원활하게 실행하도록 설계된 커뮤니티 유지 관리 하드웨어 플러그인입니다. 이는 RFC Hardware Pluggable에 명시된 원칙을 준수하며, vLLM 커뮤니티 내에서 Kunlun 백엔드를 통합하기 위한 권장 방식입니다.
이 플러그인은 Kunlun XPU와 vLLM의 통합을 분리하는 하드웨어 플러그형(hardware-pluggable) 인터페이스를 제공합니다. vLLM Kunlun을 활용함으로써 Transformer 계열, Mixture-of-Experts (MoE), Embedding, 그리고 Multi-modal LLM을 포함한 인기 있는 오픈 소스 모델들을 Kunlun XPU에서 손쉽게 실행할 수 있습니다.
Seamless Plugin Integration (원활한 플러그인 통합)— Python entry points를 통해 표준 vLLM 플랫폼 플러그인으로 작동하며, vLLM 소스 코드를 수정할 필요가 없습니다.
Broad Model Support (폭넓은 모델 지원)— Qwen, Llama, DeepSeek, GLM, Gemma4, Kimi-K2 및 멀티모달 (multimodal) 모델을 포함한 20개 이상의 주류 LLM을 지원합니다.
Quantization Support (양자화 지원)— MoE 및 dense 모델을 위한 W8A8 (INT8), AWQ, GPTQ, 그리고 compressed-tensors W4A16을 지원합니다.
LoRA Fine-Tuning (LoRA 미세 조정)— Qwen 시리즈 모델에 대한 LoRA 및 Multi-LoRA 어댑터 (adapter)를 지원합니다.
Piecewise Kunlun Graph (분할 Kunlun 그래프)— 고성능 추론 (inference)을 위한 하드웨어 가속 그래프 최적화를 제공합니다.
FlashMLA Attention (FlashMLA 어텐션)— DeepSeek MLA 아키텍처를 위해 최적화된 멀티 헤드 잠재 어텐션 (multi-head latent attention)을 제공합니다.
Speculative Decoding (추측적 디코딩)— DeepSeek-V3.2를 위한 MTP (Multi-Token Prediction) 및 DFlash/EAGLE 스타일의 제안자 (proposers)를 지원합니다.
Tensor Parallelism (텐서 병렬화)— 분산 실행 (distributed execution) 지원을 통한 멀티 디바이스 병렬 추론을 지원합니다.
OpenAI-Compatible API (OpenAI 호환 API)— 표준 OpenAI API 인터페이스로 모델을 서빙합니다.
Hardware (하드웨어): Kunlun3 P800
OS (운영체제): Ubuntu 20.04
Software (소프트웨어):
- Python >= 3.10
- PyTorch >= 2.5.1 (KL3-customized
xpytorch빌드, 설치(Installation) 섹션 참조) - vLLM (버전 일치 필요, requirements.txt 참조)
- transformers == 5.2.0 (Qwen3.5는 transformers 5.x 필요)
| 모델 (Model) | 지원 (Support) | 양자화 (Quantization) | LoRA | Kunlun Graph |
|---|---|---|---|---|
| Qwen2 | ✅ | ✅ | ✅ | ✅ |
| ... | ||||
| 모델 (Model) | 지원 (Support) | 양자화 (Quantization) | LoRA | Kunlun Graph |
| --- | --- | --- | --- | --- |
| Qwen2-VL | ✅ | ✅ | ✅ | |
| ... |
현재 환경: 16-way 동시성 (concurrency), 입출력 크기 2048.
python -m vllm.entrypoints.openai.api_server \# host 0.0.0.0 \# port 8356 \# ...
curl http://localhost:8356/v1/chat/completions \# -H "Content-Type: application/json" \# -d '{ ...'
| 버전 (Version) | 릴리스 유형 (Release Type) | 문서 (Documentation) |
|---|---|---|
| v0.25.1 | 최신 개발 버전 (main) | Quick Start · Installation |
| v0.11.0 | 최신 안정 버전 (stable release) | Quick Start · Installation |
vllm-kunlun/
├── vllm_kunlun/ # 핵심 플러그인 패키지 (Core plugin package)
│ ├── platforms/ # Kunlun XPU 플랫폼 구현 (Kunlun XPU platform implementation)
...
커뮤니티의 기여를 환영합니다! PR(Pull Request)을 제출하기 전에 저희의 기여 가이드(Contributing Guide)를 읽어주시기 바랍니다.
PR 제목에는 다음 접두사(prefix)를 사용해 주세요:
[Attention]
— 어텐션 메커니즘 (Attention mechanism) 기능/최적화
[Core]
— 핵심 vllm-kunlun 로직 (플랫폼, 어텐션, 통신(communicators), 모델 러너(model runner))
[Kernel]
— 연산 커널 (Compute kernels) 및 연산 (ops)
[Bugfix]
— 버그 수정
[Doc]
— 문서 개선
[Test]
— 테스트
[CI]
— CI/CD 개선
[Misc]
— 기타 변경 사항
저희는 2025년 12월 8일에 프로젝트를 시작했습니다. 저희는 오픈 소스와 협업을 사랑합니다 ❤️
XPU 리소스를 제공하여 효율적인 모델 적응 디버깅, 포괄적인 엔드 투 엔드 (end-to-end) 테스트, 그리고 더 넓은 모델 호환성을 가능하게 지원해 주신 KunLunXin 팀에 진심으로 감사드립니다.
LICENSE 파일에 명시된 바와 같이 Apache License 2.0을 따릅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Lobste.rs AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기