시스템 RAM 64GB의 저주
요약
작성자는 R9700과 RTX 5060 Ti를 사용하는 시스템에서 로컬 LLM 및 이미지/비디오 추론을 수행하는 경험을 공유합니다. 특히 Strata 사용 시 속도가 크게 향상되었으나, 이로 인해 시스템 RAM(64GB) 사용량이 포화되어 다른 워크로드(ComfyUI 등)를 동시에 실행할 수 없는 제약에 직면했습니다.
핵심 포인트
- Strata 사용으로 로컬 LLM 추론 속도(t/s)가 크게 향상됨 (21 t/s -> 60 t/s).
- LLM 구동 시 시스템 RAM 사용량이 높아져 다른 GPU 기반 워크로드 실행에 제약 발생.
- 시스템 메모리 용량 부족으로 인해 여러 AI 작업을 동시에 처리하기 어려움.
- RAM 업그레이드가 필요하지만, 재정적 여유로 인해 어려운 상황.
봇이 아닙니다. Strata 홍보 글도 아닙니다. 그저 제 경험을 공유하는 것입니다.
제 시스템에는 R9700과 RTX 5060 Ti가 장착되어 있고, DDR5 시스템 RAM은 64GB입니다. 전반적으로 나쁘지 않은 구성입니다. 어쨌든 저는 주로 R9700에서 일일 사용(daily driver) 로컬 LLM을 실행하고, 5060 Ti에서는 ComfyUI로 이미지/비디오 추론을 실행합니다. 대부분 Minimax H3 같은 쓰레기들인데, 이것들도 시스템 RAM을 엄청나게 많이 소모합니다.
저는 R9700에서 Qwen3.8-27B를 Q6으로 일일 사용 모델로 사용하고 있으며, 이 속도는 약 35 t/s 정도입니다. 이는 저에게는 일일 사용 모델로는 괜찮은 수준입니다. Strata를 사용하기 전에는 Qwen3.8-Flash-Next를 두 카드 모두에서 vulkan을 사용하여 IQ4_XS (또는 그 양자화(quant)가 무엇이라고 불리는지 - 약 93GB짜리)로 실행해 보았는데, 속도가 겨우 15 t/s 정도밖에 나오지 않았습니다. 이는 제가 일일 사용 모델로 삼기에는 부족해서 포기했고 별다른 관심이 없었습니다. 어쨌든 Strata가 출시되었고 사람들이 QFN이 훨씬 더 평범한 하드웨어에서도 사용 가능하다는 주장을 하자, 저도 확인해 보았는데 대부분의 사람들은 IQ3_XXS 양자화를 사용하고 있었고, 이는 약 70GB 정도 용량이라 당연히 더 빠릅니다. 어쨌든 저는 llama.cpp에서 이 양자화를 먼저 시스템 RAM + R9700만으로 벤치마킹해 보았는데, 속도가 21 t/s가 나왔습니다... 이것은 제가 일일 사용 모델로 받아들일 수 있는 절대적인 최소치에 가깝지만, 솔직히 말해서 아주 설득력 있게 느껴지지는 않습니다. 그러고 나서 같은 양자화를 Strata에서 시도해 보니 약 60 t/s가 나옵니다. 정말 엄청나게 매력적입니다. 저는 지금 당장 이것을 일일 사용 모델로 삼고 싶습니다. 문제는 QFN이 Strata에 로드되어 있을 때 시스템 RAM 사용량이 96%라는 것입니다. 이 때문에 ComfyUI에서 5060 Ti를 이용해 Minimax H3 같은 것을 실행할 수가 없습니다. 그 쓰레기들도 시스템 RAM을 많이 먹거든요.
저는 마침내 이 멋진 모델을 돌릴 수 있게 된 것이 감사하면서도, 어떤 워크로드를 선택해야 할지 골라야 한다는 사실에 저주받은 기분입니다!
또한, 누군가 '그냥 RAM을 128GB로 업그레이드하세요'라고 말하기 전에... 알아요, 알고 있습니다. 그렇게 하고 싶지만, 아내가 공평성을 이유로 요청하는 보석류와 해외여행 비용 때문에 올해 제가 산 모든 장난감들을 상쇄할 여유가 없습니다.
64GB RAM 속에서 울고 있습니다.
/u/Cautious_Chicken_604 님이 제출함
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기