# v0.30.0 ## 주요 변경 사항 (Highlights) 이번 릴리스에는 315명의 기여자(신규 104명 포함)가 참여하여 총 762개의
요약
vLLM의 v0.30.0 릴리스는 대규모 모델 지원 및 성능 최적화에 초점을 맞췄습니다. DeepSeek-V4.1-Flash, GLM-5.3-Flash 등 다양한 신규 모델을 지원하며, FlashMLA V4.1 레코드와 같은 고급 기술을 도입했습니다. 또한, GPU 가중치 캐시 데몬을 통해 엔진 재시작 시 로딩 시간을 획기적으로 단축하는 'Fast Start' 기능을 추가했습니다.
핵심 포인트
- DeepSeek-V4.1-Flash 등 다양한 최신 모델 지원
- GPU 메모리에 가중치를 유지하여 빠른 시작(Fast Start) 구현
- CUDA IPC를 활용한 캐시 로딩으로 재시작 시간 단축
- Gumbel-max 워터마크 생성 및 탐지 기능 추가
v0.30.0
주요 변경 사항 (Highlights)
이번 릴리스에는 315명의 기여자(신규 104명 포함)가 참여하여 총 762개의 커밋이 반영되었습니다!
-
새로운 모델: SM100의 FlashMLA V4.1 레코드를 통해 전체 KV를 MXFP8로 저장하는 DeepSeek-V4.1-Flash (#56214, #56228, #56208), DeepGEMM Mega-mHC (#56962), 그리고 Engram DP sharding을 사용한 비동기 Engram 사전 로드(prefetch)를 지원하는 DeepSeek-V4.1-Flash; ROCm (#55107) 및 LoRA를 사용하는 DeepSeek-V4-Flash-Vision-Exp (#54566); EPLB를 사용한 GLM-5.3-Flash (#53906)와 #55119); K2-Horizon (#55063); Cohere Compass (#54774); Bailing V3 VL (#55921); Transformers 백엔드를 통한 Nanbeige4.2 (#56071); 그리고 AVX512/AMX sparse MLA, indexer, mHC 및 compressor 커널을 갖춘 DeepSeek-V4 CPU 백엔드 (#55355).
-
빠른 시작 (Fast Start): 영구적인 GPU당 가중치 캐시 데몬이 양자화된(post-quantized), TP-sharded 가중치를 GPU 메모리에 유지하여, 엔진 재시작 시 디스크에서 다시 로드하는 대신
--load-format ipc_cache를 통해 CUDA IPC로 매핑합니다 (#54921). 이제 FP4 체크포인트 (#55465) 및 멀티 노드 TP (#55468)도 지원합니다. -
워터마킹 (Watermarking): 키가 있는 PRF(Pseudo-Random Function)를 사용한 Gumbel-max 워터마크 생성 및 탐지, 요청별 옵트아웃 기능, 그리고 예시 탐지 엔드포인트(#54053)를 지원합니다. 듀얼 키 Gumbel-max는 추측 디코딩(speculative decoding)(#56122)과 호환되며, Rust 프론트엔드는 요청별 제어 기능을 전송합니다(#56338).
-
HiSparse: GPU 압력 하에서 KV 페이지를 고정된 호스트 메모리(pinned host memory)로 스필하고, 요청별 GPU 핫 버퍼(hot buffer)에서 top-k 누락분(misses)을 제공하는 희소 MLA 디코드용 호스트 상주 계층입니다. 이는
HiSparseConnector(#53781)를 통해 활성화되며, Prometheus 카운터(#56061), TP 랭크 전반에 걸쳐 공유되는 호스트 캐시(#56629), 그리고 커넥터에서 추론된 어텐션 설정(#57041)을 포함합니다. -
Model Runner V2: 즉시 모드(eager mode)에서 듀얼 배치 오버랩(#50945)과 마이크로배치 단계에 대한 전체 CUDA 그래프(FULL CUDA graphs)(#51700)를 지원합니다. 파이프라인 병렬 처리(pipeline parallelism) 하에서 MTP(#46994) 및 EAGLE3/DFlash/DSpark(#50514) 추측 디코딩을 지원합니다. 온라인 수용 추정기(online acceptance estimator)를 통해 모든 초안 모델 스펙큘레이터에 대한 적응형 검증(#52228)을 수행합니다. 그래프 캡처 중 GC(Garbage Collection)를 동결시켜 캡처 시간을 12초에서 2초로, H200에서의 엔진 초기화 시간을 28.9초에서 8.2초로 단축시켰습니다(#54646).
--return-sampling-mask를 GPU에서 압축하여 약 2배의 RL 단계 시간 회귀(regression) 문제를 해결했습니다(#54901). -
Qwen3.8-Flash-Next 성능: 별도의 prefill 및 decode QSA indexer 커널(#54513), 융합된 PLE 커널(#54517), FP8 indexer 캐시(#54890), 희소 GQA(sparse GQA)에서의 패딩된 인덱스 건너뛰기(#54873), 융합된 PLE 잔차 및 QSA 출력 게이트(#55309),
--engram-config를 통한 UVA PLE 오프로드 및 Engram 텐서 병렬화(#54371), 그리고 torch.compile을 NVIDIA 구현에서 제거하여 FP8이 단일 GB300에 적합하도록 했습니다(#55272). -
Kimi K3 성능: SM100에서의 네이티브 CUDA AttnRes 기본 설정(#54261), KDA 혼합 배치 gather/scatter 제거 (E2E 처리량 5.2-7.7% 향상, #56159), 그룹화된 FP8 MLA 캐시 삽입(소규모 배치에서 커널 속도 4-6배 향상, #55356), strided 텐서에서의 DSV3 저지연 GEMM (커널 속도 12-81% 향상, #54565), 오버랩된 TP8 KDA 투영(#54697), FlashInfer KDA 커널(#55364), 부분적 접두사 캐싱 및 추측 디코딩을 포함한 내부 접두사 체크포인트(#53614), 하이브리드 Mamba 모델을 위한 대칭 DCP 분해(#55531).
-
대규모 서비스 (Large scale serving): 희소 MLA 모델에 대한 PCP+DCP(#56157), 단일 모듈 MTP를 사용한 PCP 및 복제된 DSpark(#56107)와 디코드 전용 FULL CUDA 그래프(#53867), 재구성(reconfiguration)에 걸쳐 CUDA 그래프를 재사용하는 탄성 EP(Elastic EP)(#54985), NVLink가 없는 장치를 위한 옵션 선택적 FlashInfer PCIe IPC all-reduce(#53576), 결합(combine)을 통해 공유 전문가를 비동기적으로 최종화하는 DeepEP v2(#52781), Mooncake Store의 이종 TP 공유(#53129), KVCR 2차원 어댑터(#53624), 그리고 NIXL(#47941) 및 Mooncake(#41567)를 통한 인코더 캐시 공유.
-
양자화 (Quantization):
quantization_config.targets를 통한 목표 온라인 양자화(#51285) 및 모든 양자화 방법에서 부분적으로 사전 양자화된 체크포인트(#51392),nvfp4_fp8_ds_mlaKV 캐시를 사용한 W4A16 DSA(#51724), SM100/103에서 Marlin에 대한 FlashInfer CuTeDSL NVFP4 W4A16 기본값(#53014), torch linear 백엔드에서의 NVFP4(#53319), 양자화별 선형 백엔드 오버라이드(#51204), CUDA에서의 AutoRound 2/3/5/6/7비트(#52890), 그리고 DSA 희소 인덱서용 DeepSelect top-k(#56464). -
주요 변경 사항 (Breaking changes): plain
vllm serve에서--enable-scale-out을 통해 scale-out 엔드포인트가 선택적(opt-in)으로 제공되며, 이는 기존의VLLM_ENABLE_SCALE_OUT_ENDPOINTS(#54579, #55176)를 대체합니다; GPTQ 활성화 순서(g_idx)가 제거되었습니다(#54809); 0.29 버전에서 사용 중단된 항목들(예:VLLM_PREFIX_CACHE_RETENTION_INTERVAL및VLLM_MM_HASHER_ALGORITHM환경 변수)(#55353)이 제거되었으며,allMamba 캐시 모드가 사용 중단되었습니다(#55041);python -m vllm.entrypoints.grpc_server는vllm serve --grpc로 대체되어 사용이 권장됩니다(#56746); YaRN은 Transformers와 동기화되어, vendor YaRN 별칭(alias)이 더 이상max_model_len을 재조정하지 않습니다(#56446).
릴리스 아티팩트 (Release Artifacts)
Python Wheels
| 플랫폼 | 설치 명령어 |
|---|---|
| PyPI (CUDA 13.0) | pip install vllm |
| ... |
Docker Images
| 플랫폼 | Docker 이미지 |
|---|---|
| CUDA 13.0 (기본값) | docker pull vllm/vllm-openai:v0.30.0 |
| ... |
기타 아티팩트 (Other Artifacts)
사전 빌드된 릴리스 아티팩트는 이 페이지 하단의 Assets 섹션에서 다음을 포함하여 이용 가능합니다:
- 소스 배포 tarball
- x86_64 및 arm64용 CUDA 12.9 Python wheels
- x86_64 및 arm64용 CUDA 13.0 Python wheels
- x86_64, arm64, macOS용 CPU Python wheels
- x86_64용 XPU Python wheel
모델 지원 (Model Support)
AI 자동 생성 콘텐츠
본 콘텐츠는 vLLM Releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기