carloslfu/slotstream
요약
Slotstream은 105GB에 달하는 대형 AI 모델을 메모리 제약이 있는 Mac에서도 구동할 수 있도록 설계된 도구입니다. SSD에서 Qwen3.8-Flash-Next와 같은 Mixture of Experts(MoE) 모델을 스트리밍하고, 가장 활발하게 사용되는 expert들을 메모리에 캐싱하여 16GB~64GB 사양의 Mac에서도 작동 가능합니다.
핵심 포인트
- 대용량 AI 모델을 저사양 Mac에서 구동 가능
- SSD 스트리밍 및 Expert 캐싱 기술 적용
- MLX와 Metal 기반 네이티브 Swift 바이너리
Repository: carloslfu/slotstream
Language: Swift
Stars: 454
Forks: 34
Topics: apple-silicon, claude-code, inference-engine, llm, llm-inference, local-ai, local-llm, macos, metal, mixture-of-experts, mlx, moe, ollama, on-device-ai, openai-api, qwen, qwen3, swift
Description:
105 GB 크기의 AI 모델을 담지 못하는 Mac에서 실행할 수 있게 합니다. Slotstream은 SSD에서 Qwen3.8-Flash-Next (125B mixture of experts)를 스트리밍하고 가장 바쁜 expert들을 메모리에 캐싱하여, 16GB에서 64GB 사양의 Mac에서도 구동되게 합니다. MLX와 Metal 기반의 네이티브 Swift 바이너리로, Python이나 인터넷 연결 없이 오프라인으로 작동합니다. Claude Code, Codex 및 Ollama 또는 OpenAI 클라이언트와 함께 사용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Coding Assistants의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기