# v0.31.0 ## 주요 변경 사항 (Highlights) 이번 릴리스에는 307명의 기여자로부터 717개의 커밋이 포함되었으며, 이 중 9
요약
vLLM의 v0.31.0 릴리스는 DeepSeek-V4.1-Flash 성능 향상과 시스템 안정성 개선에 초점을 맞췄습니다. SM100 기반으로 FlashMLA 메가 어텐션, Mega-Gate 등 최신 아키텍처를 통합했으며, 가중치 캐시 데몬을 통한 빠른 재시작 기능 및 엔진 스냅샷 기능을 추가하여 운영 효율성을 높였습니다.
핵심 포인트
- FlashMLA 메가 어텐션을 SM100 기본값으로 지원합니다.
- Mega-Gate와 MoE 최종화 등 최신 아키텍처를 통합했습니다.
- 가중치 캐시 데몬을 통해 엔진 재시작 속도가 빨라졌습니다.
- CRIU 기반의 엔진 스냅샷 기능이 추가되어 복원성이 향상되었습니다.
v0.31.0
주요 변경 사항 (Highlights)
이번 릴리스에는 307명의 기여자로부터 717개의 커밋이 포함되었으며, 이 중 96명이 신규 참여했습니다!
- DeepSeek-V4.1-Flash 성능: V4.1 NVFP4 압축 KV 캐시를 사용한 FlashMLA 메가 어텐션(mega attention)이 이제 SM100의 기본값(#56935)입니다; 인덱서용 DeepGEMM 희소 MQA 로짓(logits)(#56254) 및 게이트 GEMM을 전문가 선택과 융합한 Mega-Gate(#56266); 디코더 경계에서 TP all-reduce, mHC 입력 준비(#57643) 및 MoE 최종화(finalize)를 융합했습니다(#58586); SM100/SM103에서 역 RoPE와 MXFP8 양자화를 사용한 융합된 소규모 배치 WO-A(#58634); MXFP8
wo_bGEMM을 시퀀스 병렬 reduce-scatter와 융합(#57428); TP 랭크에 걸쳐 분할된 Engramwkv(#58678) 및 기본적으로 공동 배치(co-located) DP 복제본에서 공유되는 Engram 호스트 테이블(#57651); 비전 타워용 인코더 CUDA 그래프(#56625); 그리고 슬라이딩 윈도우 KV를 프리픽스 캐싱(prefix caching)에서 유지하는 SWA 경계 재현(bounded replay)을 구현했습니다(#56227). - 빠른 재시작 (Fast restart): 새로운
vllm preloadCLI는 가중치 캐시 데몬(weight-cache daemon)을 실행하여 엔진 재시작 시에도 후처리된(post-quantized) 가중치를 GPU 메모리에 유지합니다(#56680). 이제 데이터 병렬성(#57386), MTP 드래프트 모델(#57312),/health엔드포인트(#58552) 및 준비 대기(readiness wait) 기능이 추가되었습니다(#58370).
실험적 초기화된 엔진 스냅샷(vllm snapshot create/restore)은 CRIU를 사용하여 완전히 초기화된 TP1 엔진을 복원합니다(#51360).
-
Model Runner V2 및 speculative decoding: Model Runner V2에서 draft-model speculative decoding(#43091)과 사용자 지정 logits processor(#56497); Model Runner V2의 새로운 LiLiCorr drafter(#57934); draft CUDA 그래프에 컨텍스트 K/V를 사전 계산하여 DFlash용 비동기 스케줄링(#58065)을 구현하고, Gemma4를 위한 DSpark 적응형 검증(#57263) 및 Kimi-K3용 가변 길이 디코딩(#52988); 비-DCP DSpark draft를 가진 DCP 타겟(#56723); 그리고 MoE 메모리를 MRV2 프로파일링 시 계산하여 WideEP 배포에서 OOM(Out Of Memory)을 방지합니다(#57270, #58411).
-
대규모 서빙(Large scale serving):
--all2all-backend를 통해 MoonEP balanced EP all2all 백엔드를 지원하며, 이는#52101을 통해 구현되었습니다. 또한 데이터 병렬(data parallelism)과 결합된 프리필 컨텍스트 병렬화(#57075), SM100/SM103용 저-SM 멀티멤 리듀스-스캐터(low-SM multimem reduce-scatter)(#55072), 시퀀스 병렬화(sequence parallelism)를 사용한 DeepEPv2(#57210) 및 공유 전문가 오버랩(shared-expert overlap)을 갖춘 EPLB(#57236), RL용 샤딩 인식 NCCL M2N 가중치 전송 백엔드(#51520), 그리고 KV 오프로딩(KV offloading)의 백프레셔 감지 기능(#50045)도 추가되었습니다. -
스케줄링 제어(Scheduling controls):
--max-num-active-seqs가max_num_seqs와 독립적으로 RUNNING 입장을 제한하며(#56758),--long-prefill-token-threshold는 이제 단일 요청을 청크로 나누는 대신 대기 중인 프리필(waiting prefills) 개수에 맞춰 조정됩니다(#57951, #58459). 또한, 대기 큐가 수정되어 이미 KV 블록을 보유한 요청이 먼저 스케줄링되도록 했으며(#58947), KV 압력 하에서의 KV 커넥터 + MTP 교착 상태(deadlock)가 수정되었습니다(#57104). -
HiSparse 강화: MTP 검증 행(rows)이 union residency kernel을 통해 해결되었으며(#59235), FULL 그래프 하에서 MTP 수용 오류가 수정되었고(#59309), 호스트 백킹(host backing)이 없는 GPU 페이지 문제가 해결되었습니다(#59036). 또한, 청크 기반 프리필(chunked-prefill) 선점 라이벨록(livelock)이 수정되었고(#59494), HiSparse가 할당하는 그룹으로부터 KV 캐시 크기가 결정되도록 변경되었으며(#59450), 호스트 접두사(host prefix) 발행 및 GPU 접두사 채택 관련 수정 사항이 포함되었습니다(#59007, #59282).
-
보안(Security): 요청별
mm_processor_kwargs와media_io_kwargs는--trust-request-mm-kwargs가 설정되지 않으면 거부됩니다(#58830); 접두사 캐시의 추가 키(extra keys)는 출처별로 태그되어 LoRA 이름과cache_salt가 더 이상 충돌할 수 없게 되었으며(#51899), LoRA 경로가 블록 해시(block hash)의 일부로 포함됩니다(#59335); 오래된 멀티모달 수신자 캐시 항목이 최신 페이로드(payloads)를 대체할 수 없게 되었습니다(#57833). -
Breaking changes: 요청별 멀티모달 키워드 인자(kwargs) 제한(#58830); `tokenizer_mode=
AI 자동 생성 콘텐츠
본 콘텐츠는 vLLM Releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기