Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이번 릴리스는 대규모 업데이트를 포함하며, 특히 KV Offloading 서브시스템이 하이브리드 메모리 할당기(HMA)와 통합되고 추측적 디코딩에 '사고 예산' 개념이 도입되어 정확도가 향상되었습니다. vLLM은 PyTorch 호환성을 위해 C++20 빌드를 요구하는 Breaking Change가 발생했습니다. 또한, Blackwell GPU를 위한 새로운 TOKENSPEED_MLA 백엔드와 MiMo-V2.5, Laguna XS.2 등 다양한 최신 아키텍처 및 모델 지원이 추가되었습니다.
vLLM v0.20.2는 DeepSeek V4, gpt-oss, Qwen3-VL 모델의 버그 수정을 포함하는 작은 패치 릴리스입니다. 이 버전은 총 6명의 기여자가 참여한 6개의 커밋으로 구성되었으며, 특히 DeepSeek V4의 sparse attention 및 KV cache 관리자 관련 문제를 해결했습니다.
vLLM의 v0.20.0 버전이 DeepSeek V4 모델 초기 지원을 포함하여 주요 업데이트를 발표했습니다. 이번 릴리스에서는 CUDA 13.0을 기본으로 채택하고, PyTorch 버전을 2.11로 업그레이드하는 등 중요한 기술 스택 변화가 이루어졌습니다. 개발자들은 최신 하드웨어 및 프레임워크 환경에 맞춰 vLLM을 활용할 수 있게 되었습니다.