
16GB 사양의 기기에서 Qwen3.6-35B-A3B를 구동하기 위한 DwarfStar 기반 Vulkan/Metal 추론 엔진 구축
요약
저사양 기기에서도 대규모 언어 모델을 구동할 수 있도록 설계된 QuarkStar 추론 엔진을 소개합니다. Vulkan과 Metal을 지원하며, 16GB 메모리 환경에서 Qwen3.6-35B-A3B 모델을 효율적으로 실행할 수 있는 최적화 기술을 제공합니다.
핵심 포인트
- Vulkan 및 Apple Metal 기반의 네이티브 추론 엔진 구축
- 16GB 메모리 기기에서 35B 모델의 완전 상주 추론 지원
- 메모리 부족 시 SSD 전문가 스트리밍 기술 활용
- AMD BC-250 및 M2 Pro 환경에서의 높은 토큰 생성 성능 확인
공개 사항: 저는 QuarkStar의 저자이자 유지 관리자입니다. 저는 Antirez의 DwarfStar에서 영감을 받은 작은 네이티브 추론 엔진인 QuarkStar를 구축했습니다. QuarkStar는 현재 다음을 지원합니다:
- Antirez에서 영감을 받은 동일한 Q2 및 Q2/Q4 양자화 (quantization) 레시피를 사용하는 Qwen3.6-35B-A3B
- Qwen3.6-35B-A3B의 코딩 중심 사후 학습 (post-training) 모델인 KAT-Coder-V2.5-Dev
- Linux에서의 네이티브 Vulkan
- Apple Silicon에서의 네이티브 Metal
- 16 GB 기기에서의 완전 상주 (Fully resident) 추론
- 모델이 메모리에 들어가지 않을 때를 대비한 제한된 SSD 전문가 스트리밍 (SSD expert streaming)
DwarfStar는 훨씬 더 큰 모델을 중심으로 구축되었으며 주로 96/128 GB급 기기를 대상으로 합니다. 저는 스펙트럼의 반대편을 탐구하고 싶었습니다. 즉, 16 GB 기기와 24/32 GB 워크스테이션에서 유용한 로컬 모델을 사용하는 것이며, 심지어 더 작은 8 GB 시스템을 위해 설계된 SSD 스트리밍 경로를 포함합니다. 모든 사람이 로컬 AI 하드웨어에 3,000~5,000달러를 쓸 수는 없습니다. 이 프로젝트는 LLM에 대한 저의 기술을 향상시키려는 의도로 탄생했습니다. 저에게는 추론과 학습에 유용하며, 여러분에게도 유용하기를 바랍니다.
저의 주요 개발 기기는 AMD BC-250입니다. 이는 약 150달러의 가격에 16 GB의 통합 GDDR6를 갖춘 보드입니다. 현재의 Vulkan 패스트 패스 (fast path)는 이 장치에서 RADV를 사용하여 개발되었습니다. 또한 M2 Pro 16 GB에서 네이티브 Metal 백엔드를 개발하고 테스트했습니다.
BC-250 Q2 프리필 (prefill) 및 디코드 (decode) t/s
일부 현재 Q2 상주 (resident) 결과:
| 장치 | 컨텍스트 (Context) | 프리필 (Prefill) | 생성 (Generation) |
|---|---|---|---|
| BC-250 16 GB | 2K | 639.85 tok/s | 81.85 tok/s |
| BC-250 16 GB | 8K | 501.50 tok/s | 74.72 tok/s |
| BC-250 16 GB | 32K | 244.06 tok/s | 51.26 tok/s |
| M2 Pro 16 GB | 2K | 448.75 tok/s | 37.78 tok/s |
| M2 Pro 16 GB | 8K | 270.02 tok/s | 31.08 tok/s |
| M2 Pro 16 GB | 16K | 177.21 tok/s | 25.64 tok/s |
저는 35B 사이즈 클래스가 점점 더 흥미로워질 것이라고 생각합니다. DeepSeek V4 Flash-0731은 지능 대비 활성 파라미터 (intelligence-to-active-parameter) 비율이 얼마나 빠르게 개선될 수 있는지를 최근 다시 한번 보여주었습니다. 따라서 QuarkStar의 모델 지원은 의도적으로 기회주의적입니다. 이 프로젝트는 일반적인 로컬 기기에서 가장 유용한 오픈 체크포인트 (open checkpoints)를 따라갈 것입니다.
어제 발표된 Qwen3.8 27b 및 아마도 해당 제품군(family)의 다른 모델들에 대한 소식과 함께, 저는 밀집 모델 (dense model)을 위한 브랜치도 생성했지만 현재로서는 실험적인 단계입니다. 이것이 병합될지 여부는 새 모델의 성능과, 35B 모델의 MOE (Mixture of Experts) 버전이 언제 출시될지(혹은 출시될지)에 달려 있습니다. 저는 Qwen 3.8과 Quarkstar를 가지고 즐거운 시간을 보낼 수 있을 것 같습니다. 이 프로젝트는 아직 초기 단계이며, Vulkan 하드웨어는 매우 다양합니다. 특히 다음과 같은 분들의 테스트와 피드백을 부탁드립니다:
- BC-250 이외의 GPU를 사용하는 Vulkan 사용자
- Apple Silicon 사용자, 특히 구형 모델이나 8 GB RAM을 탑재한 Mac 사용자
- 커널 (kernels), 양자화 품질 (quantization quality), 또는 SSD 캐싱 (SSD caching) 개선에 관심이 있는 분들
저장소 (Repository): https://github.com/Ninnix/q36
라이선스 (Licence): MIT
특별히 Salvatore에게 감사를 표합니다. 그는 저에게 지속적인 영감의 원천이며, 그의 YouTube 콘텐츠는 제가 소프트웨어 엔지니어로서, 그리고 한 사람으로서 성장하는 데 큰 도움을 주었습니다.
데모 프롬프트 (Demo Prompt): CDN을 사용하여 Three.js로 단일 독립형 HTML 파일을 생성하세요. 수백 개의 빛나는 입자, 회전하는 토러스 링 (torus rings), 안개, 그리고 터널을 통과하는 느린 자동 카메라 비행 기능이 포함된 시네마틱 네온 웜홀 (cinematic neon wormhole)이 열려야 합니다. 마우스 패럴랙스 (mouse parallax)를 추가하고, 각 클릭 시 터널을 따라 가시적인 에너지 펄스가 발사되도록 만드세요. 외부 에셋이나 빌드 단계 없이 절차적 기하학 (procedural geometry)과 재질 (materials)만을 사용해야 하며, 부드럽고 반응성이 좋아야 합니다. /tmp 폴더에서 작업하세요.
데모 제출자: /u/Nicolodeva [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기