Qwen3.6 27B NVFP4 + MTP를 단일 RTX 5090에서 사용한 200k 컨텍스트 vLLM 테스트 결과
요약
본 기술 기사는 단일 RTX 5090 GPU와 vLLM 프레임워크를 사용하여 Qwen3.6 27B 모델을 NVFP4 양자화 및 MTP(Multi-Token Prediction) 기능을 활성화한 상태에서 20만 토큰의 초대형 컨텍스트 처리를 성공적으로 수행한 결과를 공유합니다. 이 설정은 고성능 GPU 환경에서 대규모 언어 모델의 긴 컨텍스트 처리 능력을 검증하며, 특히 안정적인 성능과 효율성을 보여줍니다. 벤치마크 결과에 따르면, 20만 토큰 깊이에서의 평균 생성 속도는 약 65~75 tok/s를 기록했으며, 프롬프트 캐시(Prefix Cache) 사용 시 초기 시간(TTFT) 단축 효과가 두드러지게 나타났습니다. 이는 대규모 컨텍스트 기반의 에이전트 워크플로우에 중요한 인사이트를 제공합니다.
핵심 포인트
- 단일 RTX 5090 GPU 환경에서 Qwen3.6 27B 모델을 구동하는 실질적인 방법을 제시함.
- NVFP4 양자화, vLLM, FlashInfer 등 최신 기술 스택 조합으로 대용량 컨텍스트 처리를 구현함.
- 20만 토큰 깊이에서의 평균 생성 속도는 약 65~75 tok/s로 안정성을 입증함.
- 프리픽스 캐싱(Prefix Caching)을 활용할 경우, 초기 응답 시간(TTFT)을 크게 단축시켜 에이전트 워크플로우에 최적화됨.
RTX 5090으로 Qwen3.6 27B NVFP4 모델을 테스트해 본 결과를 공유하고자 합니다. 최근 좋은 게시물들은 대부분 48GB 카드, FP8, 또는 llama.cpp/GGUF에 관한 내용이었습니다.
이는 '최적의 설정'이라는 주장이 아닙니다. 제가 작동시킨 환경과 정확한 파라미터, 그리고 측정된 수치를 공유하는 것이며, 다른 5090 사용자들의 추측을 줄이는 데 도움이 되기를 바랍니다.
요약하자면:
- 단일 RTX 5090 (32GB VRAM)
- 모델:
Peutlefaire/Qwen3.6-27B-NVFP4 - vLLM:
0.20.1.dev0+g88d34c640.d20260502 - Torch:
2.13.0.dev20260430+cu130 - 드라이버:
595.58.03 - 양자화(Quantization):
compressed-tensors - 어텐션 백엔드(Attention backend):
flashinfer - KV 캐시(KV cache):
fp8_e4m3 - MTP 활성화 (추측 토큰 3개)
- 텍스트 전용 모드(Text-only mode)
- 제가 편안하게 주장할 수 있는 공적 범위: 200k 컨텍스트 깊이, 220k/262k 아님
vLLM 모델 엔드포인트는 max_model_len: 230400을 보고하지만, 저는 실제로 200k 컨텍스트 깊이까지만 벤치마크했습니다. 반복적인 실행으로 검증한 것이 200k이기 때문에 의도적으로 주장하는 수치를 200k로 유지합니다.
주요 vLLM 인자(args)는 다음과 같습니다:
vllm serve Peutlefaire/Qwen3.6-27B-NVFP4 \
--host 0.0.0.0 --port 8082 \
--safetensors-load-strategy=prefetch \
--tensor-parallel-size 1 \
--attention-backend flashinfer \
--performance-mode interactivity \
--language-model-only \
--skip-mm-profiling \
--kv-cache-dtype fp8_e4m3 \
--gpu-memory-utilization 0.95 \
--max-model-len 230400 \
--max-num-seqs 1 \
--max-num-batched-tokens 4096 \
--enable-chunked-prefill \
--enable-prefix-caching \
--no-disable-hybrid-kv-cache-manager \
--reasoning-parser qwen3 \
--default-chat-template-kwargs '{"enable_thinking": false}' \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--quantization compressed-tensors \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
--trust-remote-code
시작 로그에서 확인하고 싶었던 중요한 부분들이 있었습니다:
Using FlashInferCutlassNvFp4LinearKernel for NVFP4 GEMM- 사용 가능한 KV 캐시 메모리(Available KV cache memory):
8.3 GiB - 요청당 230,400 토큰에 대한 최대 동시성(Maximum concurrency):
1.00x
실행 후, nvidia-smi는 약 30478 MiB / 32607 MiB가 사용되었으며, vLLM EngineCore 프로세스는 약 29998 MiB를 사용했습니다.
llama-benchy 수치
이 모든 것은 다음 설정을 사용하여 측정되었습니다:
llama-benchy 0.3.7--pp 2048--tg 480--latency-mode generation--skip-coherence- 동시성(concurrency) 1
- 장문 컨텍스트 소스로 War and Peace 텍스트 사용
Context ladder
| context depth | prefill tok/s | generation tok/s | TTFT |
|---|
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기