
2x5060 Ti 환경에서 vLLM을 이용한 nvfp4 KV-cache 구현
요약
2x5060 Ti 환경에서 vLLM을 사용하여 nvfp4 데이터 타입을 활용한 KV-cache 구현 사례를 소개합니다. 특정 모델과 환경 설정을 통해 메모리 효율을 높이고 추론 성능을 최적화하는 구체적인 실행 구성을 다룹니다.
핵심 포인트
- vLLM에서 nvfp4 데이터 타입을 이용한 KV-cache 구현
- 2x5060 Ti 환경에서의 구체적인 실행 구성 및 환경 변수 설정
- MTP(Multi-Token Prediction) 및 Speculative Decoding 활용
- 메모리 관리 및 OOM 방지를 위한 GPU 메모리 사용량 최적화
이 성과를 제가 했다고 말할 수는 없습니다. 다른 누군가가 접근 방식을 설명했고, 저는 그것을 opencode/GLM 5.2에 복사하여 붙여넣어 작동하게 만들었을 뿐입니다. 제대로 작동하는 것으로 보입니다: https://github.com/vllm-project/vllm/issues/49011 [IMG:1] 실행 구성:
Image
IMAGE=localhost/vllm-sm120-fixes:nightly # commit f54446749, sm120-fixes branch
Environment
-e VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0 # MTP 워크스페이스를 위해 약 0.39 GiB 확보
-e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1
-e VLLM_WORKER_MULTIPROC_METHOD=spawn
-e NCCL_CUMEM_ENABLE=0
-e NCCL_P2P_LEVEL=PBX
-e VLLM_SKIP_P2P_CHECK=1
-e CUDA_DEVICE_MAX_CONNECTIONS=8
-e VLLM_FLOAT32_MATMUL_PRECISION=high
-e OMP_NUM_THREADS=1
Model
${MODEL_PATH} # Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm
--served-model-name local
--quantization compressed-tensors
--dtype bfloat16
--tensor-parallel-size 2
KV cache
--kv-cache-dtype nvfp4
--max-model-len 262144
--gpu-memory-utilization 0.90 # 0.94 사용 시 MTP 워크스페이스 버퍼로 인해 OOM(Out of Memory) 발생
--kv-offloading-size 20
--kv-offloading-backend native
Scheduling
--max-num-seqs 4
--max-num-batched-tokens 4128
--enable-prefix-caching
--enable-chunked-prefill
Cudagraph
--cudagraph-capture-sizes 1 2 4
--compilation-config {"cudagraph_mode":"PIECEWISE"} # FULL 설정 시 XQA 손상 (#49010)
MTP
--speculative-config {"method":"mtp","num_speculative_tokens":3}
--language-model-only
Misc
--reasoning-parser qwen3
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--trust-remote-code
--disable-custom-all-reduce
submitted by /u/gtrak [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기