16GB GPU와 35B MoE를 위한 저사양 추론 엔진: Qwen 3.6으로 코딩
요약
Qwen3.6-35B MoE 모델을 16GB V100 GPU 환경에서 구동하기 위한 저사양 추론 엔진 빌드를 소개합니다. AgrillaMoE를 포크하여 Unsloth 양자화와 2비트 UD-Q2_K_XL 방식을 적용했으며, 이를 통해 OpenAI 및 Anthropic API 지원과 함께 안정적인 코딩 성능을 확보했습니다.
핵심 포인트
- 16GB V100 GPU 환경에서 Qwen3.6-35B MoE 구동 가능
- AgrillaMoE 포크를 통한 저사양 추론 엔진 구현
- Unsloth 양자화 및 2비트 UD-Q2_K_XL 적용으로 효율성 극대화
저는 llama.cpp의 서버 버전을 AgrillaMoE로 포크하여, Unsloth 양자화(quant)가 적용된 Qwen3.6-35B-A3B(A4B) 전용 빌드를 만들었습니다. (vant.ai)에서 임대한 V100 16GB GPU와 2비트 UD-Q2_K_XL 양자화를 사용했을 때, 전체 MoE 확장 프로파일을 실행하면서 약 5760 토큰/초를 생성합니다. 이 엔진은 OpenAI API와 Anthropic API 모두를 지원하므로, Claude Code가 문제없이 작동합니다.
MoE 확장이란 무엇인가요? Qwen3.6-35B-A3B는 토큰당 8개의 라우팅된 전문가(expert)를 활성화합니다. 이 확장 패치는 런타임에서 해당 예산(budget)을 높입니다 — 재학습이나 파일 변경 없이: --moe-experts 20과 적응형 임계값(adaptive threshold)을 사용하여 $p ext{ >= } 0.8 imes p( ext{rank } 8)$일 때 전문가를 유지하며, 이는 레이어 25~39에 적용됩니다. 즉, 토큰당 35B 매개변수 중 더 많은 부분을 활용하는 것입니다 — 이것이 GPQA-Diamond에서 Q8_0으로 테스트했을 때 84.34% (기존 최고점 대비 +2.5점)를 기록한 '검색된 지능(retrieved intelligence)'의 출처입니다 (miticooo!).
동일한 가중치, 개선된 라우팅.
https://github.com/vagrillo/AgrillaMoE/blob/main/gpu16gbguide.md
제출자 /u/Specific-Tax-6700
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기