
Qwen3.6에서 Gemma4로: GTX 1080 Ti 및 P100 3중 GPU 성능 비교
요약
GTX 1080 Ti와 P102-100 GPU 3개를 결합한 시스템에서 Gemma4 및 Qwen3.6 등 다양한 LLM의 성능을 비교한 벤치마크 결과입니다. llama.cpp Vulkan 빌드를 사용하여 모델별 추론 속도(tg128, pp512)를 측정했습니다.
핵심 포인트
- GTX 1080 Ti 및 P102-100 3중 GPU 환경에서의 성능 측정
- Gemma4 26B 모델이 다양한 양자화 방식에서 높은 성능을 보임
- Qwen3.6 및 Gemma3 모델과의 추론 속도 비교 데이터 제공
- Vulkan 백엔드를 활용한 llama.cpp 기반의 벤치마크 수행
31GB VRAM을 결합한 3중 GPU를 사용하는 단일 시스템에서의 벤치마크 (Benchmarks) 결과입니다. NVIDIA GeForce GTX 1080 Ti 11GB (NVIDIA), NVIDIA P102-100 10GB (NVIDIA) - 첫 번째 인스턴스 (먼 친척), NVIDIA P102-100 10GB (NVIDIA) - 두 번째 인스턴스. OS: Kubuntu 26.04, CPU: Ryzen 5 3600, RAM: 48GB DDR4. llama.cpp Ubuntu Vulkan 빌드 10107. 사용된 모델 (Models used): llama-2-7b.Q4_0.gguf, gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf, Gemma-4-26B-A4B-NVFP4.gguf, gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf, gemma-3-27b-it.Q5_K_M.gguf, medgemma-27b-it-UD-Q6_K_XL.gguf (gemma-3), Qwen3.6-35B-A3B-NVFP4-MTP-HQ.gguf (dense), gemma-4-31B-it-UD-Q4_K_XL.gguf (dense), Qwen3-Coder-30B-A3B-Instruct-Q4_K_M.gguf, Qwen3-Coder-30B-A3B-Instruct-UD-Q5_K_XL.gguf, Qwen3.6-35B-A3B-UD-Q4_K_S.gguf, Qwen3.6-27B-NVFP4-MTP-GGUF.gguf.
ggml_vulkan: 3개의 Vulkan 장치를 찾았습니다:
ggml_vulkan: 0 = NVIDIA GeForce GTX 1080 Ti (NVIDIA) | uma: 0 | fp16: 0 | bf16: 0 | fp4: 0 | warp size: 32 | shared memory: 49152 | int dot : 1 | matrix cores: none
ggml_vulkan: 1 = NVIDIA P102-100 (NVIDIA) | uma: 0 | fp16: 0 | bf16: 0 | fp4: 0 | warp size: 32 | shared memory: 49152 | int dot: 1 | matrix cores: none
ggml_vulkan: 2 = NVIDIA P102-100 (NVIDIA) | uma: 0 | fp16: 0 | bf16: 0 | fp4: 0 | warp size: 32 | shared memory: 49152 | int dot: 1 | matrix cores: none
매개변수 (Params) 열을 기준으로 정렬된 수정된 표는 다음과 같습니다:
| 모델 (Model) | 크기 (Size) | 매개변수 (Params) | tg128 | pp512 |
|---|---|---|---|---|
| llama 7B | Q4_0 | 3.56 GiB | 6.74 B | 59.99 |
| gemma4 26B.A4B | Q4_K - Medium | 15.83 GiB | 25.23 B | 48.14 |
| gemma4 26B.A4B | NVFP4 | 16.45 GiB | 25.23 B | 33.28 |
| gemma4 26B.A4B | Q6_K | 21.68 GiB | 25.23 B | 49.67 |
| gemma3 27B | Q5_K - Medium | 17.94 GiB | 27.01 B | 10.20 |
| gemma3 27B | Q6_K | 22.09 GiB | 27.01 B | 10.78 |
| qwen35 27B | NVFP4 | 15.07 GiB | 27.32 B | 8.68 |
| gemma4 31B | Q4_K - Medium | 17.52 GiB | 30.70 B | 10.49 |
| qwen3moe 30B.A3B | Q4_K - Medium | 17.28 GiB | 30.53 B | 75.01 |
| qwen3moe 30B.A3B | Q5_K - Medium | 20.24 GiB | 30.53 B | 64.36 |
| qwen35moe 35B.A3B | Q4_K - Small | 19.45 GiB | 34.66 B | 50.48 |
| qwen35moe 35B.A3B | NVFP4 | 19.07 GiB | 35.51 B | 43.50 |
전력 (Power)
각 GPU의 전력 제한 (Power limit)을 150W로 설정했습니다. /u/tabletuser_blogspot 님이 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기