$2800으로 8개의 Radeon Pro V620 (256 GB VRAM)을 갖춘 시스템 + 커스텀 vLLM 포크 =
요약
작성자는 Radeon Pro V620 카드를 활용하여 대용량 VRAM 시스템을 구축하고, 기존 vLLM 및 llama.cpp의 성능 한계를 극복하는 커스텀 vLLM 포크를 개발했습니다. 이 과정을 통해 QFN에서 1000 t/s에 달하는 높은 프리필 속도를 달성하며, 예상보다 훨씬 뛰어난 성능 향상을 입증했습니다.
핵심 포인트
- Radeon Pro V620을 활용한 대용량 VRAM 시스템 구축 가능.
- 커스텀 vLLM 포크 개발로 기존 LLM 프레임워크의 한계 극복.
- QFN에서 1000 t/s에 달하는 높은 프리필 속도 기록 (llama.cpp 대비 약 800% 향상).
게시물 제목이 약간 오해의 소지가 있습니다. $350에 이 카드를 더 이상 구할 수는 없을 것 같지만, 모든 것을 고려하면 여전히 매우 저렴합니다. 이것들은 Radeon Pro V620이며, 32 GB VRAM을 가진 구형 RDNA2 엔터프라이즈 클라우드 게이밍 카드입니다. (옆에 있는 RTX 4090은 무시하세요. 이미지/비디오 생성 모델 같은 용도로만 사용하며 LLM에는 적합하지 않습니다.) 하지만 저는 몇 달 전에 이 카드를 사서, 비교적 저렴한 비용으로 사용할 수 있는 속도를 가진 대용량 VRAM 시스템을 구축할 수 있을지 도박 삼아 시도해 보았습니다. 오랫동안 llama.cpp로 어려움을 겪었는데, 프리필(prefill) 성능이 매우 좋지 않았습니다 (같은 모델로 평균 350450 t/s 정도). 게다가 vLLM은 이 카드들에서 작동하지 않았습니다. 게다가 llama.cpp는 동시성(concurrency) 처리 능력이 형편없었습니다. 저는 최근에 이 카드를 팔 계획을 세우고 있었는데, 제 사용 사례에는 맞지 않을 것 같았기 때문입니다. 그런데 제가 (Claude) 이 카드들과 작동하면서 실제로 좋은 속도를 낼 수 있는 vLLM 포크를 만들 수 있을지 결정했습니다. 커스텀 RDNA2 커널을 빌드하고 테스트하며 반복 작업을 진행했습니다. 문제가 해결되었습니다! 예상했던 것보다 훨씬 더 잘 작동했습니다. QFN으로도 최고 1000 t/s 프리필에 도달할 거라고 생각했는데, 이건 llama.cpp가 처리하던 속도보다 약 800% 빠릅니다. 결과에 정말 만족합니다! GPU 판매 계획은 취소되었습니다 lol. 계속 최적화를 진행하여 어떻게 되는지 지켜보고, DeepSeek과 GLM-5.3-Flash도 작동하는지 확인할 생각입니다. 아래는 concurrency = 1 및 vLLM을 PP=4로 실행했을 때(여기서는 tensor parallel 없음) orcarouter의 비검열 QFN을 양자화하여 측정한 llama-benchy 결과입니다. 라우팅된 전문가(Routed experts)는 W4A16이고 나머지는 BF16으로 유지됩니다. MTP를 활성화하고 3 토큰 드래프팅을 사용했습니다. MTP가 비활성화되면 4050 t/s의 디코드 속도를 얻습니다. https://preview.redd.it/4223w82yz9uh1.png?width=666&format=png&auto=webp&s=a15e5d1f5664fcb894a746a54a501eb8f6637a57 /u/TheWolfOfWalmart 님이 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기