
Qwen2.5-27B 코드 생성 테스트를 위해 Vast AI에서 20GB 3080 4장을 벤치마킹했습니다 (quad 5060Ti 4장보다 더
요약
Vast AI에서 RTX 3080 4장을 활용해 Qwen2.5-27B 모델의 코드 생성 성능을 벤치마킹한 결과입니다. 저렴한 중고 부품 조합으로 높은 컨텍스트 처리 속도와 가성비를 갖춘 강력한 AI 워크스테이션 구축이 가능함을 보여줍니다.
핵심 포인트
- RTX 3080 4장 조합으로 Qwen2.5-27B 모델에서 높은 TPS 기록
- 2,000달러 내외의 비용으로 고성능 코드 생성 머신 구축 가능
- MTP 활성화 시 최대 256k 컨텍스트에서 69 tps 디코딩 달성
- eBay 중고 부품(X99 보드, 3080 등)을 활용한 극강의 가성비 제안
요약하자면 정말 엄청나게 빠릅니다. MTP를 켠 상태에서 최대(256k) 컨텍스트(context) 시 거의 최대치인 69 tps 디코딩(decode)을 기록했습니다. 프롬프트 캐시(prompt cache)를 껐을 때 최대 컨텍스트에서의 프리필(prefill) 수치는 893까지 내려갔습니다. https://jdkruzr.github.io/3080bench/ 테스트가 어떻게 수행되었는지는 여기를 참조하세요: https://github.com/jdkruzr/3080bench/ 이 카드들은 전력 제한(Wattage-capped)이 걸려 있었기 때문에 성능을 더 끌어올릴 여지가 있을 것입니다. 배경을 설명하자면, 저는 이 조합이 가성비(bang-for-your-buck)가 매우 훌륭할 것이라고 의심했기 때문에 이 테스트를 진행했고, 제 생각이 옳았던 것 같습니다. 이 카드들은 개당 최소 400달러 정도에 구할 수 있습니다. 메인보드-CPU-64GB RAM 조합은 eBay에서 약 275달러 정도입니다. 따라서 총 2,000달러 정도면 양자화(quantization)를 거의 하지 않고, 풀-팻 KV 캐시(full-fat kv cache)를 사용하며 성능 저하 없이 이와 같은 밀집 모델(dense models)을 아주 쉽게 처리할 수 있는 머신을 가질 수 있습니다. 제가 보기에는 매우 높은 정확도로 높은 수준의 성능을 발휘할 수 있는 강력한 코드 생성용 박스로 아주 탁월한 선택인 것 같습니다. Q6KXL이 왜 거의 동일한 성능을 보였는지(또는 왜 ngram이 모든 것을 더 나쁘게 만드는 것처럼 보였는지)에 대한 Claude의 모든 논거를 제가 다 믿는지는 모르겠지만, 그것은 중요하지 않습니다. 이 장치는 매우 빠르게 작동할 것이며 그 과정에서 비용도 많이 들지 않을 것입니다. 이것이 무엇을 의미할까요? 오늘날에도 eBay에서 어렵지 않게 구할 수 있는, 충분한 PCIe 3.0 레인(4개의 x16 슬롯)을 가진 X99 보드를 찾으십시오. 그리고 GPU에 약 1,600달러 정도를 투자하면 일종의 괴물 같은 박스를 가질 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기