Qwen3.6-27B를 위한 ~250% 빠른 PP, ~20% 빠른 TG: RTX Pro 6000에서 NInfer NVFP4 vs
요약
NInfer 엔진이 RTX Pro 6000 환경에서 Qwen3.6-27B 모델을 구동할 때 llama.cpp 대비 압도적인 성능 향상을 보임을 입증했습니다. 특히 프리필(prefill) 단계에서 최대 3.53배 빠른 속도를 기록하며 효율적인 추론 성능을 보여줍니다.
핵심 포인트
- NInfer NVFP4 사용 시 프리필 속도 최대 250% 이상 향상
- 코드 및 JSONL 생성 시 llama.cpp 대비 약 14~28% 빠른 생성 속도
- 전체 컨텍스트 실행 시 GPU 메모리 사용량 약 10% 절감
- NVFP4 가중치 및 활성화 방식을 통한 최적화 효과 확인
요약 및 관찰 사항
NInfer는 전체 프롬프트 프리필 (prefill)에서 2.17–3.53배 더 빠릅니다. 지속적인 생성 (generation)의 경우, 테스트된 워크로드 기준 NInfer는 코드 생성에서 1.14배, 구조화된 JSONL 생성에서 1.28배 더 빠릅니다. 저는 RTX Pro 6000의 전력 제한 (power limit)을 420W로 설정했기 때문에, 이 수치들은 풀 파워인 600W 환경보다는 낮을 수 있지만, 상대적인 속도 차이는 비슷할 것입니다. NInfer는 전체 컨텍스트 (full-context) 실행 동안 GPU 메모리를 약 2.9 GB (~10%) 적게 사용했습니다. 이 엔진이 sm_120에 고도로 최적화되었다고 들었는데 (이 프로젝트는 특히 5090을 겨냥하고 있음), 커뮤니티 결과물을 찾지 못해 (아마 제가 충분히 열심히 찾지 않았을 수도 있겠네요 ㅎㅎ) RTX Pro 6000에서 직접 벤치마크를 수행하고 이를 공유하고자 합니다.
모델
비교 대상인 엔진/모델은 다음과 같습니다:
- NInfer
- neroued/Qwen3.6-27B-nvfp4-NInfer
- llama.cpp
- unsloth/Qwen3.6-27B-MTP-GGUF Q4_K_XL
이 모델들을 구체적으로 비교한 이유는 두 모델 모두 동일한 Qwen3.6-27B MTP 모델의 혼합 정밀도 (mixed-precision) 4비트 배포 버전이며, 크기 차이가 1.70%에 불과하기 때문입니다. NInfer는 선택된 선형 레이어 (linears)에 대해 NVFP4 가중치 및 활성화 (weight-and-activation) 실행을 사용하는 반면, llama.cpp의 GGUF 방식은 주로 가중치 양자화 (weight-quantized) 방식입니다. 출력 품질 (output-quality) 평가는 수행되지 않았습니다.
처리량 (Throughput) 결과
값은 동일한 워크로드의 웜업 (warmup) 1회를 제외한 후, 세 번의 독립적인 측정 요청에 대해 엔진이 보고한 평균 처리량입니다.
| 워크로드 | NInfer NVFP4 | llama.cpp UD-Q4_K_XL | NInfer 속도 향상 |
|---|---|---|---|
| 8K prefill | 10,701.2 ± 17.4 tok/s | 3,032.9 ± 5.4 tok/s | 3.53x |
| 64K prefill | 6,302.5 ± 23.6 tok/s | 2,306.7 ± 13.8 tok/s | 2.73x |
| 128K prefill | 4,210.7 ± 2.6 tok/s | 1,746.3 ± 0.1 tok/s | 2.41x |
| 256K prefill | 2,556.4 ± 0.5 tok/s | 1,179.4 ± 1.3 tok/s | 2.17x |
| Python 패키지 생성, 1,024 토큰 | 165.14 ± 0.01 tok/s | 144.90 ± 0.05 tok/s | 1.14x |
| 구조화된 JSONL 생성, 1,024 토큰 | 179.83 ± 0.04 tok/s | 140.28 ± 0.10 tok/s | 1.28x |
생성 (generation) 행은 각 엔진의 내부 디코드 타이머 (decode timer)를 사용합니다. NInfer의 계산은 첫 번째 출력 토큰이 프리필 (prefill) 중에 생성되기 때문에 이를 제외합니다.
요청 지연 시간 (Request latency)
이는 프롬프트 처리 (prompt processing) 및 생성을 포함하여 클라이언트가 관찰한 HTTP 요청 시간입니다.
| 워크로드 | NInfer NVFP4 | llama.cpp UD-Q4_K_XL | NInfer에 의한 절감 시간 |
|---|---|---|---|
| 8K 프롬프트 + 16 출력 | 0.81 s | 2.64 s | 1.83 s |
| 64K 프롬프트 + 16 출력 | 10.38 s | 28.16 s | 17.78 s |
| 128K 프롬프트 + 16 출력 | 31.08 s | 74.78 s | 43.70 s |
| 256K 프롬프트 + 16 출력 | 102.03 s | 221.04 s | 119.00 s |
| Python 프롬프트 + 1,024 출력 | 6.23 s | 7.27 s | 1.04 s |
| JSONL 프롬프트 + 1,024 출력 | 5.73 s | 7.45 s | 1.72 s |
클라이언트가 관찰한 실제 시간 (wall time) 기준으로, NInfer는 네 가지 프리필 (prefill) 단계에서 각각 3.24배, 2.71배, 2.41배, 2.17배 더 빨랐으며, 두 가지 생성 (generation) 워크로드에서는 1.17배 및 1.30배 더 빨랐습니다.
| MTP 수락률 | 테스트 항목 | NInfer NVFP4 | llama.cpp UD-Q4_K_XL | 해석 |
|---|---|---|---|---|
| 2,043 / 3,069 = 66.57% | Python 생성 | 2,184 / 2,652 = 82.35% | llama.cpp가 초안 (draft)을 상당히 더 많이 수락했지만, NInfer는 여전히 1.14배 더 높은 내부 디코드 처리량 (internal decode throughput)을 달성했으며 1.17배 더 빠르게 완료했습니다. | |
| 2,130 / 2,817 = 75.61% | 구조화된 JSONL | 2,154 / 2,739 = 78.64% | 수락률은 상대적으로 비슷했습니다. NInfer는 1.28배 더 높은 내부 디코드 처리량을 달성했으며 1.30배 더 빠르게 완료했습니다. |
제어된 구성 (Controlled configuration)
NInfer 리비전: 8aa49883deabfee4a660801455a1be5483155e5a
lama.cpp 리비전/버전: 54f214a09b8c4e709357ae661a77925edb154f13, 빌드 10018
컨텍스트 용량 (Context capacity): 262,144 토큰
사고 모드 (Thinking mode): 두 엔진 모두 활성화됨
프롬프트 토큰 일치 여부: 두 엔진 모두 6개의 테스트 항목에 대해 정확히 7,678 / 64,510 / 130,046 / 260,094 / 120 / 128 토큰을 보고함
KV 캐시 (KV cache): NInfer INT8 group-64; llama.cpp q8_0 K 및 V
추측 (Speculation): 네이티브 Qwen3.6 MTP, 최대 3개의 초안 토큰
샘플링 (Sampling): greedy/temperature 0, top-p 1.0, top-k 20, min-p 0
패널티 (Penalties): presence penalty 0 및 frequency penalty 0
시드 (Seeds): 동일한 3개의 고정 시드
프롬프트 처리 (Prompt processing): NInfer 프리필 청크 1,024; llama.cpp 논리적 및 물리적 배치 크기 1,024
동시성 (Concurrency): 하나의 활성 요청; llama.cpp는 연속 배치 (continuous batching)가 비활성화된 하나의 슬롯 사용
접두사 재사용 (Prefix reuse): --no-prefix-reuse 및 --no-cache-prompt로 비활성화됨
동일 워크로드에 대한 한 번의 웜업 (warmup) 후 워크로드당 세 번의 측정된 요청이 수행됨
출력 길이: 모든 측정된 프리필 요청
16개의 토큰을 생성했으며, 모든 생성 (generation) 요청은 1,024개의 토큰에 도달했습니다. /u/tat_tvam_asshole 이 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기