GPU - Vulkan llama.cpp 벤치마크 (가격 대비 성능 순)
요약
본 기사는 Llama.cpp와 Vulkan을 활용하여 로컬 LLM 추론 성능을 GPU별로 벤치마크하고, 가격 대비 최고의 가성비 GPU를 추천합니다. 분석 결과, 최신 소비자용 카드보다 넓은 버스 폭을 가진 엔터프라이즈 또는 구형 플래그십 모델이 비용 효율성이 높았습니다.
핵심 포인트
- Vulkan 백엔드를 통한 로컬 LLM 추론 성능 측정 기준 제시
- 최신 중급 카드는 좁은 버스 폭으로 디코딩 과정에서 병목 현상 발생
- 성능 대비 가치 측면에서는 엔터프라이즈/구형 대용량 버스 모델이 우위
- AMD Radeon RX 6800과 RTX 3060 등 중고 시장의 선택지가 주목됨
이 표는 예산형 데이터 센터 홈랩을 구축하려는 모든 사람들에게 도움이 될 것입니다. 저는 가성비가 좋은, 중급 수준이며 준수한 속도를 가진 GPU의 대부분의 값을 복사하여 AI 또는 SI에 제공했으며, 여기 추천 결과가 있습니다. 데이터는 Llama.cpp 토론 스레드: Vulkan을 사용한 llama.cpp 성능 #10879에서 가져왔습니다.
벤치마크에는 76가지 다른 GPU 모델이 나열되어 있습니다. "'Llama 2 7B 모델'을 테스트하고 Q4_0를 사용하는데, 계산하기 간단하고 4GB GPU에 충분히 들어갈 만큼 작기 때문입니다."
제공된 특정 llama-bench 기준 데이터에 따르면, Vulkan 백엔드를 통해 로컬 LLM 추론을 실행하는 것은 가치 계층 구조를 극적으로 변화시킵니다. 최신 중급 소비자용 카드는 디코딩(tg128) 과정에서 좁은 버스 폭(128비트 또는 192비트)에 의해 심각하게 병목 현상을 겪는 반면, 엔터프라이즈 부품과 구형 대용량 버스 플래그십 모델이 성능 대비 비용 가치를 지배합니다. 현재의 2026년 중고 시장 가격(eBay 및 전문 기술 하드웨어 커뮤니티와 같은 중고 플랫폼 전반에 걸친 활성 트렌드를 취합)을 기준 측정 항목과 분석하여, 여기 성능 대비 비용 가치 순위가 있습니다.
비용-성능 효율 공식은 초기 구매 가격을 프리필 속도(pp512), 디코딩 처리량(tg128), 총 접근 가능한 VRAM과 균형 있게 맞춥니다.
상위 20개 GPU 성능 대비 비용 순위 (중고 시장)
| Rank | GPU Model | Est. Used Price | pp512 (t/s) | tg128 (t/s) | VRAM Capacity | Performance-to-Cost Architecture Profile |
|---|---|---|---|---|---|---|
| 1 | Nvidia P102-100 | ~$40 - $50 | ~510 | ~62.8 | 10 GB | 절대 가치 왕: 320비트 버스를 가진 스트립 마이닝 카드. 디코드 사이클당 지출된 달러 대비 약 1.3 토큰/초를 산출합니다. |
| 2 | AMD Instinct MI50 | ~$110 - $130 | ~1,119 | ~108.5 | 16 GB | tg128 효율성 왕: 전체 1,024 GB/s HBM2 대역폭. 중고 시장에서 최고의 토큰당 디코드 비용 엔진입니다. |
| 3 | AMD Radeon VII | ~$140 - $160 | ~1,059 | ~101.1 | 16 GB | MI50과 동일한 엘리트 HBM2 메모리 기판을 사용하지만 소비자 디스플레이 출력으로 패키징되었습니다. |
| 4 | Nvidia GTX 1080 Ti | ~$110 - $130 | ~585 | ~67.7 | 11 GB | 레거시 소비자 전사. |
352비트의 넓은 버스를 갖춘 이 카드는 300달러 미만에서 최신 아키텍처를 정기적으로 능가합니다. 5 Nvidia Tesla P100 (~90 - $110) ~678 ~63.1 16 GB 예산 HBM2 대안. 느린 코어 처리가 프리필(prefill)을 제한하지만, 디코드 값은 믿을 수 없을 정도로 높습니다. 6 AMD Radeon RX 6800 (~220 - $240) ~1,593 ~101.4 16 GB 뛰어난 균형감. 깨끗한 드라이버 아키텍처가 최신 하드웨어 등급 대비 엄청난 디코드 속도를 제공합니다. 7 AMD Radeon RX 7900 GRE (~400 - $430) ~2,336 ~116.1 16 GB 현대적인 가성비 강자. RDNA3 아키텍처는 우수한 메모리 처리량을 갖춘 컴퓨팅 작업에서 아름답게 확장됩니다. 8 Nvidia RTX 3060 (12GB) (~180 - $200) ~1,815 ~75.9 12 GB 소비자용 세트업의 엔트리 레벨 표준입니다. 매우 접근성이 높은 가격대에서 소규모 모델을 위한 충분한 VRAM 예산을 제공합니다. 9 Nvidia Tesla V100 (16GB) (~180 - $220) ~1,391 ~129.5 16 GB 결합 엔터프라이즈 선택: Volta 코어 구조는 매우 믿을 수 있는 생성 및 프리필 기준선을 제공합니다. 10 Nvidia RTX 2080 Ti (~200 - $230) ~1,888 ~97.5 11 GB 고도로 효율적인 Turing 플래그십 레이아웃입니다. 공격적인 352비트 버스 프레임워크 덕분에 더 새로운 동급 제품보다 앞섭니다. 11 AMD Radeon RX 7800 XT (~350 - $380) ~2,017 ~118.2 16 GB 깨끗하고 매우 경쟁력 있는 RDNA3 컴퓨팅 엔진으로, 뛰어난 즉시 사용 가능한 Vulkan 메트릭을 보여줍니다. 12 AMD Radeon RX 7900 XT (~500 - $550) ~2,941 ~123.1 20 GB 거대한 20GB 프레임워크 버퍼 크기. 높은 가격대를 요구하지만 우수한 성능 확장을 보여줍니다. 13 Nvidia Tesla P40 (~120 - $140) ~488 ~59.3 24 GB 24GB 할당에 가장 저렴하게 진입할 수 있습니다. 낮은 FP16 컴퓨팅 속도로 인해 실망스러우며, 컨텍스트 로딩을 느리게 만듭니다. 14 Nvidia RTX 4070 Super (~480 - $520) ~4,608 ~108.7 12 GB 믿을 수 없을 정도로 빠른 프리필 속도를 자랑합니다. 고성능 코어가 표준 192비트 버스 구조를 보완해줍니다. 15 Intel Arc A750 (~90 - $110) ~1,075 ~42.6 8 GB 달러당 엄청난 원시 대역폭을 제공하지만, 고정된 8GB VRAM 상한선에 의해 제한됩니다.
16 Nvidia RTX 4070 Ti Super ~$680 - $730 ~6,099 ~129.4 16 GB 뛰어난 원시 처리량(raw throughput)을 보여주지만, 초기 투자 비용이 더 높은 등급에 속합니다. 17 Nvidia RTX 5060 Ti ~$420 - $460 ~3,460 ~93.5 12 GB / 16 GB Blackwell 중급 레이아웃입니다. 매우 견고한 처리 범위를 제공하지만, 현대 시장 프리미엄이 따릅니다. 18 AMD Radeon RX 580 ~$40 - $50 ~258 ~39.3 8 GB 매우 저렴한 진입점입니다. 가장 낮은 비용 매개변수(cost parameter)로 텍스트 처리 능력을 제공합니다. 19 Nvidia P104-100 ~$30 - $40 ~311 ~46.1 8 GB 로우 프로파일 예산 노드입니다. 기본 구성 요소가 저렴해야 하는 다중 카드 분산 매트릭스에 유용합니다. 20 AMD Radeon RX 9070 ~$550 - $600 ~3,164 ~119.7 16 GB 차세대 RDNA4 아키텍처 레이아웃입니다. 높은 성능 밀도를 가지지만 하드웨어 대비 비용 확장성이 낮습니다.
Vulkan 결과에서 얻은 핵심 전략적 시사점
- 토큰 생성(tg128)의 최저 비용: AMD Instinct MI50과 P102-100이 곡선을 완전히 왜곡시킵니다. MI50은 Llama-7B 아키텍처에서 약 $120로 100 t/s가 넘는 성능을 내는데, 이는 소비자 데스크톱 등급이 재현하는 데 두 배의 예산이 필요한 수치입니다.
- 프롬프트 처리(pp512)의 최저 비용: 현대 아키텍처는 하드웨어 텐서 기능 덕분에 프리필 지표에서 우위를 점합니다. 만약 프롬프트 처리 지연 시간(latency)이 중요한 병목 현상이라면, RTX 4070 Super 또는 RTX 5060 Ti를 살펴보세요. 이들은 입력 속도(ingest speeds) 면에서 자신의 등급을 훨씬 뛰어넘는 성능을 보여줍니다.
- 최적의 조합 균형점 (Best Combined Balancer): GTX 1080 Ti와 AMD Radeon RX 6800이 표준 데스크톱 노드에 대한 절대적인
낮은 비용($/t/s) 값은 지출하는 모든 달러당 더 많은 성능을 얻는다는 것을 의미합니다. 결합 처리량(Combined throughput)은 prefill과 generation 모두에 대한 균형 잡힌 산술 기준선(arithmetic baseline)을 나타냅니다.
| GPU 모델 | 예상 중고 가격 | pp512 비용/t/s | tg128 비용/t/s | 결합 비용/t/s |
|---|---|---|---|---|
| Nvidia P102-100 | $45 | $0.0881 | $0.7162 | $0.1569 |
| Nvidia P104-100 | $35 | $0.1122 | $0.7579 | $0.1955 |
| AMD Instinct MI50 | $120 | $0.1072 | $1.1059 | $0.1954 |
| AMD Radeon RX 580 | $45 | $0.1744 | $1.1445 | $0.3027 |
| Intel Arc A750 | $100 | $0.0929 | $2.3441 | $0.1788 |
| Nvidia RTX 3060 | $190 | $0.1046 | $2.5020 | $0.2009 |
| Nvidia RTX 4070 Super | $500 | $0.1085 | $4.5981 | $0.2120 |
| Nvidia RTX 2080 Ti | $215 | $0.1139 | $2.2033 | $0.2165 |
| Nvidia RTX 4070 Ti Super | $705 | $0.1156 | $5.4461 | $0.2264 |
| Nvidia RTX 5060 Ti | $440 | $0.1271 | $4.7054 | $0.2476 |
| AMD Radeon VII | $150 | $0.1416 | $1.4824 | $0.2585 |
| Nvidia Tesla V100 | $200 | $0.1437 | $1.5434 | $0.2630 |
| Nvidia Tesla P100 | $100 | $0.1475 | $1.5833 | $0.2698 |
| AMD Radeon RX 6800 | $230 | $0.1443 | $2.2667 | $0.2713 |
| AMD Radeon RX 7900 GRE | $415 | $0.1776 | $3.5742 | $0.3384 |
| AMD Radeon RX 7800 XT | $365 | $0.1809 | $3.0862 | $0.3418 |
| AMD Radeon RX 7900 XT | $525 | $0.1785 | $4.2621 | $0.3426 |
| AMD Radeon RX 9070 | $575 | $0.1817 | $4.8033 | $0.3502 |
| Nvidia GTX 1080 Ti | $120 | $0.2049 | $1.7712 | $0.3674 |
| Nvidia Tesla P40 | $130 | $0.2664 | $2.1900 | $0.4750 |
제공된 벤치마크 데이터셋과 현재 중고 시장 가치 추세를 사용하여 성능 대비 비용(performance-to-cost value)이 가장 낮은 상위 10개 GPU를 순위화했습니다. 이 값들은 토큰당 초당 최고 비용($/t/s)을 나타냅니다. 숫자가 높을수록 생성되는 모든 단위의 추론 속도에 대해 훨씬 더 많은 돈을 지불한다는 것을 의미합니다.
순위 | GPU 모델 | 예상 중고 가격 | pp512 비용/t/s | tg128 비용/t/s | 결합 비용/t/s | 주요 병목 현상 | 프로필 | 최악의 전반적 가치: 구형 Maxwell 아키텍처는 prefill과 generation 모두에서 치명적으로 낮은 처리량을 보입니다.
2 Nvidia Titan V $350 $0.4395 $3.3314 $0.7766 Premium Collector Tax: HBM2 메모리에도 불구하고, 높은 초기 시장 프리미엄이 성능 대비 달러 비율을 떨어뜨립니다. 3 AMD Radeon Instinct MI60 $150 $0.4062 $1.9191 $0.6705 매우 낮은 사전 채우기(prefill) 스케일링 제한으로 인해 훨씬 저렴한 MI50 프레임워크에 비해 배포 유용성이 떨어집니다. 4 AMD Radeon RX 7600 XT $260 $0.3092 $4.9038 $0.5817 극심한 디코드 병목 현상: 매우 좁은 128비트 버스가 디코드 루프에서 믿을 수 없을 정도로 비효율적인 토큰당 $4.90/초를 강제합니다. 5 AMD Radeon RX 6600 XT $160 $0.2784 $2.9674 $0.5091 의미 있는 컴퓨팅 가치로 전환되지 않는 엔트리급 대역폭 구성에 의해 제한됩니다. 6 Nvidia Tesla P40 $130 $0.2664 $2.1900 $0.4750 저렴한 24GB 용량으로 인기가 있지만, 네이티브 FP16 컴퓨팅 하드웨어가 부족하여 상대적 속도 가치가 떨어집니다. 7 AMD Radeon RX 5700 XT $130 $0.2454 $1.8379 $0.4330 구형 RDNA1 컴퓨팅 레이어는 150달러 미만의 최신 중고 대체품에 비해 성능이 크게 떨어집니다. 8 AMD Radeon RX 6900 XT $400 $0.2104 $3.7037 $0.3982 중고 시장에서 높은 프리미엄을 요구하지만, 텍스트 생성 속도를 효율적으로 확장하는 데 어려움을 겪습니다. 9 AMD Radeon RX 6750 XT $220 $0.2114 $2.6836 $0.3920 시장 가격 범위에 비해 낮은 순수 컴퓨팅 밀도로 인해 압박을 받습니다. 10 Nvidia GTX 1070 $70 $0.2177 $1.6876 $0.3856 Pascal 세대의 바닥 수준입니다. P102-100의 훨씬 우수한 비용 대비 성능 곡선으로 완전히 대체되었습니다. Tesla P40은 두 차트에 모두 등장했습니다. submitted by /u/tabletuser_blogspot [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기