RTX 5000 PRO (48GB)가 도착했습니다. 기대했던 것보다 더 좋네요.
요약
사용자가 RTX 5000 PRO (48GB) GPU를 구매하여 로컬 LLM 환경을 구축한 후기입니다. Mac Studio 대신 선택한 이 GPU는 뛰어난 프롬프트 처리(PP) 속도와 전력 효율성을 보여주며, Claude Code의 도움을 받아 Linux 및 vLLM 설정에 성공했습니다.
핵심 포인트
- RTX 5000 PRO는 초당 4400 토큰의 경이로운 프롬프트 처리(PP) 속도를 제공함
- Qwen3.6-27B-FP8 모델을 200k 컨텍스트의 전정밀도 캐시(Full precision cache)로 실행 가능함
- RTX 5090 대비 높은 가격에도 불구하고 전력 소모가 절반 수준이며 효율적인 성능을 보여줌
- 초보자가 하드웨어 조립 및 Linux/vLLM 설정 과정에서 Claude Code를 유용하게 활용함
며칠 전 여기에 구매 관련 글을 올린 적이 있습니다: https://www.reddit.com/r/LocalLLaMA/comments/1t2slmw/first_time_gpu_buyer_got_a_rtx_5000_pro_was_it_a/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button
결정을 내리기 전에는 Mac Studio 쪽으로 더 기울어져 있었습니다. 하지만 제가 읽었던 프롬프트 처리 속도(Prompt Processing speeds)에 대한 내용들이 저를 망설이게 했습니다. 예산은 $5000/6000 정도였습니다. 그래서 256GB 모델은 고려 대상이 아니었습니다.
저는 도박을 하듯 RTX 5000 Pro를 구매했습니다. PC에 대한 경험이 전혀 없고, 조립 방법이나 어떤 부품을 사야 하는지도 모르는 상태였지만... 좋은 거래였습니다. 세금을 포함하여 GPU 가격으로 $4300를 지불했습니다 (이전 게시물 댓글에는 $4700라고 적었지만, 영수증을 확인해보니 제가 실수했습니다). 그리고 컴퓨터에 필요한 나머지 모든 부품을 구매해야 했습니다. 결과적으로 64GB RAM을 포함하여 총 $5600가 들었습니다.
완전 초보인 저에게 조립은 쉽지 않았지만, 다행히 이런 일들을 안내해 줄 LLM (대규모 언어 모델)들이 있었습니다.
그다음은 Linux (리눅스)와 vLLM 차례였습니다... 솔직히 완전히 길을 잃은 기분이었습니다. Claude Code가 없었다면 불가능했을 것입니다. 또한 Qwen3.6-27B-FP8을 전체 정밀도 캐시(Full precision cache)로 실행하기 위해 어떤 설정을 사용해야 할지도 막막했습니다. 다행히 이 분이 제가 Claude에게 무엇을 시켜야 할지 알려주는 데 필요한 모든 정보를 게시해 두었습니다: https://www.reddit.com/r/LocalLLaMA/comments/1t46klu/qwen36_27b_fp8_runs_with_200k_tokens_of_bf16_kv/
매주 20회 제한인 Claude Code Max 사용량의 50%를 써버린 끝에 이제 시스템이 작동합니다. 그리고 말해야겠군요... 제 선택이 옳았습니다. 이 물건은 정말 끝내줍니다.
TG (Token Generation, 토큰 생성) 속도는 최대 80 ts까지 나오고 있으며 (매우 긴 프롬프트의 경우 50/60 정도), 이는 경이로운 수준입니다. 하지만 가장 중요한 것은 PP (Prompt Processing, 프롬프트 처리)에서 초당 4400 토큰을 얻고 있다는 점입니다!
Full precision cache (전정밀도 캐시)는 200k 토큰만 수용할 수 있지만, 저에게는 전혀 문제가 되지 않습니다.
솔직히 왜 사람들이 이 GPU에 대해 더 많이 이야기하지 않는지 모르겠습니다. RTX 5090보다 단 1,000달러 더 비쌀 뿐인데, 8FP에서 27B 모델을 수용할 수 있고 200k의 컨텍스트 (context)를 full precision (전정밀도)로 담을 수 있습니다. 전력 소모량은 절반 수준이고요... 물론 성능은 약간 낮지만, 제가 얻고 있는 수치들은 기대했던 것보다 훨씬 높습니다. RTX 5090 두 개를 사용한다면 확실히 이 제품을 압도하겠지만, 비용이 훨씬 더 많이 들 것이고, 소음이 엄청날 것이며, 전기 요금 폭탄을 맞게 될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기