게이밍 PC를 추론 머신으로 개조하고 8GB 카드에서 기본 llama.cpp 대비 2배~9배 성능 향상을 얻었습니다
요약
게이밍 PC와 일반 설정을 활용하여 로컬 LLM 추론 성능을 테스트한 결과, 시스템 RAM의 전문가(Experts)를 VRAM에 배치하고 나머지 요소를 VRAM에 두는 방식이 큰 성능 향상을 가져왔습니다. 이는 MoE 모델에서 레이어별 오프로드보다 효과적이며, 하드웨어 제약 없이 높은 효율성을 보여줍니다.
핵심 포인트
- 게이밍 PC로도 로컬 LLM 추론 가능하며, 전용 고가 장비가 필수 아님.
- 시스템 RAM의 Experts를 VRAM에 배치하는 것이 성능 향상의 핵심 요소임.
- MoE 모델은 레이어별 오프로드보다 전문가(Experts) 활용 방식이 더 효과적임.
모두가 로컬 에이전트를 구동하려면 비싼 전용 하드웨어가 필요하다고 말합니다. 저는 RTX 4060 Ti에 시스템 RAM 64GB를 갖춘 장비를 가지고 있었고, 기본 설정을 사용하지 않고 일반 게이밍 PC가 얼마나 할 수 있는지 확인하고 싶었습니다. 그래서 Claude (Opus 5.5)에게 전체 설정을 진행하도록 했고, 한 번에 하나씩 변경하며 측정했습니다. 카드와 모델은 동일했지만 설정만 변경되었습니다: Model Quant Context Download defaults Tuned (Windows) Tuned (headless Linux)
Qwen3.6-35B-A3B Q4_K_XL 131k ~25 tok/s 39-45 tok/s 52-65 tok/s
Qwen3.8-Flash-Next 125B iQ4_XS 131k ~4 tok/s 9-10 tok/s 17-19 tok/s
Ternary Bonsai 27B PTQ1_0 64k ~4 tok/s 36 tok/s 36 tok/s
Bonsai가 특이합니다: VRAM에 완전히 들어맞기 때문에 오프로드할 것이 없고 기본 설정과 비교할 것도 없습니다. 단지 작고 범위가 명확한 작업에 대한 빠른 옵션일 뿐입니다.
실질적으로 성능을 끌어올린 것은 시스템 RAM의 전문가(Experts)와 나머지 모든 것을 VRAM에 두는 방식이었습니다. MoE (Mixture of Experts) 모델의 경우 레이어별 오프로드(Layer-wise offload)가 훨씬 더 나쁩니다. 밀집형 모델(Dense models)
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기