
P40 및 MI50 환경에서 RPC를 이용한 550B Nemotron Ultra Q3_S 구동
요약
P40 및 MI50과 같은 구형 GPU 하드웨어 환경에서 RPC를 활용하여 550B Nemotron Ultra 모델을 구동한 벤치마크 결과입니다. 100Gbe NIC와 다수의 GPU를 결합하여 대규모 모델의 처리량을 테스트했습니다.
핵심 포인트
- P40 및 MI50 구형 GPU 환경에서 550B 모델 구동 성공
- RPC를 이용한 다중 머신/GPU 간의 분산 처리 성능 확인
- 컨텍스트 길이에 따른 처리량(throughput) 변화 데이터 제공
- VRAM 확보를 위한 추가 하드웨어(RTX 2080 Ti) 실험 계획
여러분, 저는 MI50 머신과 P40 머신 모두에 100Gbe NIC 카드를 설치하고, 두 머신 모두에 Nemotron Ultra IQ3_S를 로드했습니다. 이렇게 오래된 하드웨어에서 나온 처리량(throughput)을 보고 꽤 놀랐습니다. 이 결과를 바탕으로, 저는 이제 빌드에 더 많은 VRAM을 추가하기 위해 중국산 22GB RTX 2080 Ti를 구매하여 비교, 대조 및 실험을 계속하는 것을 목표로 하고 있습니다.
Mi50 하드웨어:
Asus X99-E-WS (다수의 GPU를 지원하도록 수정된 BIOS)
Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz
128GB DDR4 RAM
SSD
7x MI50's 112GB VRAM
2x MI50's 64GB VRAM (총 176GB VRAM)
P40 하드웨어:
Asus X99-E-WS (다수의 GPU를 지원하도록 수정된 BIOS)
Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz
128GB DDR4 RAM (Non-ECC 스틱 혼합 배치)
SSD
5x P40's 120GB VRAM
메모리 부하 (Memory Load):
MI50 Box
P40 Box
벤치마크 결과 (Benchmark Results):
Context | pp512 | tg128 | pp512+tg128 | pp4096+tg128
0 | 54.42 | 6.19 | 21.33 | 52.28
8,192 | 53.20 | 6.08 | 20.82 | 50.16
32,768 | 47.22 | 5.95 | 19.86 | 45.24
65,536 | 41.50 | 5.89 | 18.81 | 40.04
126,720 | 34.09 | 5.59 | 16.61 | 33.04
실행 명령 (Start up command):
HIP_VISIBLE_DEVICES=1,0,2,3,4,5,6,7,8
/usr/local/bin/llama-server
--rpc 10.10.10.2:50052
-m "$HOME/.lmstudio/models/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_S-00001-of-00007.gguf"
--alias Nemotron-3-Ultra-550B-IQ3_S
-dev RPC0,RPC1,RPC2,RPC3,RPC4,ROCm0,ROCm1,ROCm2,ROCm3,ROCm4,ROCm5,ROCm6,ROCm7,ROCm8
--tensor-split 1,1,1,1,1,1.3,0.65,0.65,1.3,0.65,0.65,0.65,0.65,0.65
-ngl all
--fit off
--split-mode layer
--ctx-size 131072
--batch-size 2048
--ubatch-size 1024
--flash-attn on
--cache-type-k f16
--cache-type-v f16
--parallel 1
--no-cont-batching
--no-kv-unified
--cache-prompt
--cache-ram 0
--ctx-checkpoints 0
--no-cache-idle-slots
--reasoning on
--temp 1.0
--min-p 0.01
--direct-io
--host 0.0.0.0
--metrics
제출자: /u/Old_Grapefruit8774 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기