64GB RAM의 한계 돌파 - UD-Q2_K_XL을 통한 Qwen3.5 122B A10B 구동: Qwen3 Next 80B
요약
64GB RAM 환경에서 UD-Q2_K_XL 양자화 기술을 사용하여 Qwen3.5 122B A10B 모델을 구동하는 실험 결과입니다. 속도 저하와 프롬프트 처리 지연이라는 단점이 있지만, 기존 80B 모델보다 훨씬 높은 지식 품질을 얻을 수 있음을 확인했습니다.
핵심 포인트
- UD-Q2_K_XL 양자화로 64GB RAM에서 122B 모델 구동 가능
- 생성 속도는 2.9 tok/s로 저하되나 응답 품질은 대폭 향상
- 활성 파라미터가 많은 MoE 구조가 지식 유지에 유리함
- 낮은 프롬프트 처리 속도로 인해 에이전트 워크로드 적용은 어려움
저는 64GB의 일반 RAM을 보유하고 있으며, 기존에는 Qwen3 Next 80B를 UD-Q4_K_XL로 구동하며 준수한 성능과 Qwen3.5 35B A3B(이 모델은 Qwen3.6 35B A3B보다 우수함)보다 훨씬 나은 내부 지식을 누리고 있었습니다. DDR4 환경에서 평균 8.5 tok/s의 속도가 나옵니다. 하지만 UD-Q2-K_XL 양자화 (quants)를 적용한 Qwen3.5 122B A10B를 사용하면 동일한 64GB RAM에 약 120B 규모의 모델을 맞추는 것이 가능해집니다. 일반적인 믿음과는 달리, UD-Q2_K_XL 가중치 (weights)는 핵심적으로는 Q2 수준임에도 불구하고 MTP가 활성화된 상태에서 여전히 꽤 훌륭합니다. 비록 속도가 약 2.9 tok/s로 크게 떨어지고, 특히 CPU로 구동할 때 프롬프트 처리 속도 (prompt processing speed)가 엄청나게 저하됨에도 불구하고 (네, 저는 두 모델 모두 CPU에서 구동해야 합니다), 내부 지식 측면에서 훨씬 더 높은 품질의 응답을 얻고 있습니다. 만약 제 노트북에 DDR5-5600 RAM이 있었다면, 생성 속도를 무려 6 tok/s까지 끌어올려 이미 충분히 사용 가능한 수준이 되었을 것입니다. 저는 고품질의 응답을 기다릴 가치가 있다고 생각합니다. 이러한 응답은 총 80B의 인상적인 파라미터 수를 가졌음에도 활성 파라미터 (active parameters)가 약 3.5B에 불과해, 니치(niche)한 주제를 설명하라고 요청할 때 잠재적으로 중요한 사실을 놓치거나 심지어 말을 지어내기도 하는 사실상 구식인 Qwen3 Next 80B의 희소 MoE (Sparse MoE) 아키텍처와 달리, 10B의 활성 파라미터를 가진 Qwen3.5 122B의 일반적인 MoE 아키텍처를 통해 무식할 정도로 밀어붙여 얻어낸 결과물처럼 보이기 때문입니다. 물론 여기에는 단점도 있습니다. 프롬프트 처리 속도의 급격한 저하로 인해, 예를 들어 Wikipedia 아카이브에서 정보를 찾아보는 것을 목표로 하는 에이전트 워크로드 (agentic workloads)에 의미 있게 통합하는 것은 사실상 불가능합니다. Qwen3.6 35B A3B의 속도와 Qwen3.5 122B A10B의 준수한 성능 사이에서 스윗스팟 (sweetspot)을 찾아 32-48GB RAM 범위를 커버할 수 있는 약 60B 규모의 모델이 없다면, 우리는 단 ~100GB의 저장 공간만으로는 디지털 백과사전을 보유하기 어려울 것이라고 생각합니다.
그것을 수용할 수 있는 충분한 메모리가 있다는 전제하에, 우리는 Qwen3.5/3.6 35B A3B 정도로만 겨우 버텨야 할 것입니다. 그렇지 않다면 Gemma 4 26B A4B나 밀집 모델 (dense models)을 사용해야 할 것이며, 특히 통합 메모리 (unified memory) 대신 dGPU에서 LLM을 실행할 때는 더욱 그러할 것입니다. 하지만 만약 당신이 64GB 또는 96GB의 RAM을 갖춘 AMD Strix Halo 미니 PC와 같은 기기를 가지고 있다면, 그런 문제들은 겪지 않을 것이라고 생각합니다. 추신: 저는 이미 Qwen3.5 122B A10B의 REAP 변형 모델들을 시도해 보았으나, 그것들은 완전히 실패작이었습니다. 왠지 모르게 훨씬 더 멍청하며, 매우 느린 프롬프트 처리 속도 (prompt processing speed)라는 핵심적인 문제도 여전히 해결되지 않은 상태로 남아 있습니다. submitted by /u/misha1350 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기