Qwen 3.6 35B A3B: 131K 컨텍스트 및 비전 기능을 6GB VRAM에서 구동하기
요약
본 글은 Qwen3.6-35B 모델을 RTX 2060 6GB VRAM 환경에서 llama.cpp를 사용하여 구동하는 방법을 다룹니다. 특히, CPU 오프로딩 및 특정 파라미터 설정을 통해 대용량 컨텍스트(131K)와 비전 기능을 낮은 사양의 GPU에서도 안정적으로 사용하는 기술적 접근 방식을 제시합니다.
핵심 포인트
- llama.cpp를 활용하여 6GB VRAM 환경에서 35B 모델 구동 가능
- CPU 오프로딩 및 MoE 전문가 레이어 설정을 통해 메모리 제약 극복
- 131K 컨텍스트와 비전 기능을 낮은 사양 하드웨어에서 테스트한 성능 분석 제공
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M 모델을 llama.cpp로 실행했습니다. 이 설정은 RTX 2060 6GB와 32GB DDR4 RAM 환경에서 테스트되었습니다.
성능 분석:
- 초기 속도 (Empty KV cache): 프리필(prefill) 시 약 600 tok/s, 디코드(decode) 시 약 23 tok/s로 시작합니다.
- 컨텍스트 증가에 따른 안정화: 컨텍스트가 늘어나면서 속도는 점차 안정화됩니다. 약 90k 컨텍스트 지점에서는 프리필이 약 485 tok/s, 디코드가 약 15 tok/s 수준에서 유지됩니다.
VRAM 및 자원 관리:
- 비전 프로젝터(vision projector)는 CPU로 실행되며(--no-mmproj-offload), 이로 인해 VRAM 사용량이 5.2 GB 미만으로 유지되어 OOM(Out Of Memory)이나 GPU 충돌을 방지합니다.
- 이미지 인코딩은 CPU에서 처리되므로 속도는 느리지만, 약 1GB의 VRAM 여유 공간을 확보할 수 있습니다.
- 대부분의 MoE(Mixture-of-Experts) 전문가 레이어 또한 CPU로 실행됩니다(--n-cpu-moe 39). 이것이 바로 35B 모델이 애초에 6GB VRAM에 들어갈 수 있는 방식입니다.
실행 명령어:
bat @echo off cd /d "%~dp0" "%~dp0llama-server.exe" ^ -m "C:\\\Qwen3.6-35B-A3B-Uncensored-Q4_K_M extbackslash Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf" ^ --mmproj "C:\\\Qwen3.6-35B-A3B-Uncensored-Q4_K_M extbackslash mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^ --no-mmproj-offload ^ -ngl 99 ^ --n-cpu-moe 39 ^ -c 131072 ^ -np 1 ^ -t 6 ^ -tb 10 ^ -b 2048 ^ -ub 2048 ^ -fa on ^ -ctk q8_0 ^ -ctv q8_0 ^ --load-mode mmap+mlock ^ --jinja ^ --reasoning-format deepseek ^ --reasoning-preserve ^ --spec-type none ^ --image-min-tokens 1024 ^ --temp 0.6 ^ --top-p 0.95 ^ --top-k 20 ^ --min-p 0 ^ --alias Qwen3.6-35B-A3B-Uncensored-Q4_K_M ^ --host 127.0.0.1 ^ --port 8081 pause
하드웨어 및 컨텍스트 정보:
- 하드웨어: RTX 2060 6GB + 32GB DDR4 RAM + i5-10400F CPU
- 컨텍스트: 131072 토큰, Q8_0 KV cache
이 정보가 누군가에게 도움이 되기를 바랍니다. 실행 명령어를 더 좋게 만들 수 있는 팁이 있다면 댓글로 알려주세요. 저는 아이디어가 고갈되었습니다 :D
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기