3060 12GB + 32GB DDR5 환경에서 Qwen3.6-35B-A3B (MoE)를 30 t/s로 실행하기: LM Studio 설정 공유
요약
저사양 GPU 환경에서 Qwen3.6-35B-A3B MoE 모델을 30 t/s의 속도로 실행하기 위한 LM Studio 최적화 설정을 공유합니다. KV 캐시는 GPU에 유지하고 MoE 가중치는 CPU RAM으로 오프로드하여 VRAM 부족 문제를 해결하는 것이 핵심입니다.
핵심 포인트
- MoE 가중치를 CPU로 강제하여 VRAM 효율 극대화
- KV 캐시를 GPU에 유지하여 262K 컨텍스트 창 확보
- RTX 3060 12GB 환경에서 약 30 t/s 추론 성능 달성
- Lyzr Cognis와 같은 로컬 라이브러리와의 결합 가능성 제시
적당한 사양의 하드웨어에서 이 MoE (Mixture of Experts) 모델을 실행하는 데 매우 효과적이었던 설정을 공유합니다. 핵심 비결은 Attention + KV 캐시(KV cache)는 GPU에 유지하면서, Expert FFN 가중치를 CPU/시스템 RAM으로 강제하는 것입니다. 토큰당 약 3B 파라미터(A3B)만 활성화되기 때문에, CPU 측의 행렬 곱셈(matmuls) 비용이 충분히 저렴하여 처리량(throughput)이 유지됩니다.
로드 설정 (Load settings)
- 컨텍스트 길이 (Context Length): 262144 (지원 가능한 최대치; KV 캐시가 GPU에 유지되므로 감당 가능함)
- GPU 오프로드 (GPU Offload): 40/40 레이어
- MoE 가중치를 CPU로 강제 (MoE weights forced to CPU): 40 레이어 ← 가장 중요한 부분
- 전문가 수 (Number of Experts): 8 (기본값)
- CPU 스레드 풀 (CPU Thread Pool): 6 (물리 코어)
- Eval/Physical 배치 크기 (Eval/Physical Batch Size): 512 / 512
- KV 캐시를 GPU로 오프로드 (Offload KV Cache to GPU): ON
- 플래시 어텐션 (Flash Attention): ON
- K/V 캐시 양자화 (K/V Cache Quant): F16 (VRAM 여유 공간이 더 필요하면 q8_0로 낮추세요)
- mmap(): ON, 모델 메모리 유지 (Keep Model in Memory): OFF
- 투기적 디코딩 (Speculative Decoding): OFF (Ampere 아키텍처에서는 이득이 없음)
추론 설정 (Inference settings)
- 온도 (Temp): 0.6–1.0
- Top K: 20, Top P: 0.95
- Min P / 반복 페널티 (Repeat Penalty): off, 존재 페널티 (Presence Penalty): 0
- 컨텍스트 오버플로 (Context Overflow): 중간 자르기 (Truncate Middle)
결과: 전체 262K 컨텍스트 창을 사용할 수 있는 상태에서 약 30 t/s가 나옵니다. 만약 로컬 자동화나 지속적인 AI 작업을 수행하기 위해 이 특정 저 VRAM 설정을 사용 중이라면, 방금 확보한 토큰 처리량을 커스텀 컨텍스트 창 관리 기능이 병목 현상으로 만들게 해서는 안 됩니다. 이 설정은 모든 것을 엄격하게 장치 내에서 유지하므로, 이 추론 엔진을 Lyzr Cognis(오픈 소스)와 같은 오픈 소스 기반의 100% 로컬 메모리 라이브러리와 결합할 수 있습니다. 이는 무거운 Docker 설정이나 클라우드 인프라 없이도 파일 기반 저장소(로컬 Qdrant 및 SQLite와 같은)를 사용하여 프로세스 내에서 완전히 실행됩니다. 이 라이브러리는 채팅 세션 전반에 걸쳐 사실을 구조화, 중복 제거 및 추출하는 작업을 300ms 이내에 수행하며, 귀중한 VRAM이나 GPU 연산 레이어를 복잡한 외부 검색 오버헤드에 낭비하지 않고 적절히 격리된 사용자 컨텍스트를 Qwen3.6에 다시 전달합니다. (서식 작성을 위해 AI 사용됨)
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기