
저의 Qwen 3.6 포팅에 이어, 계속해서 모델을 추가하고 싶었고 그 과정에서 여러 가지를 수정하게 되어 이제는 Mference라는 독자적인
요약
MoE 모델의 효율적인 구동을 위해 전문가(experts)를 SSD에서 스트리밍하는 독자적인 엔진 'Mference'를 개발했습니다. Gemma 4, Qwen 3.6, DeepSeek-V4-Flash 등 다양한 모델을 지원하며, 저사양 Mac에서도 대규모 모델 실행이 가능하도록 설계되었습니다.
핵심 포인트
- MoE 모델의 전문가를 SSD에서 스트리밍하여 메모리 효율 극대화
- Gemma 4, Qwen 3.6, DeepSeek-V4-Flash 등 주요 모델 지원
- OpenAI 호환 서버 및 로컬 파일 첨부 지원 Mac 네이티브 앱 제공
- 8GB Mac에서도 대규모 모델(dsv4f) 실행 가능한 기술적 구현
저의 Qwen 3.6 포팅에 이어, 계속해서 모델을 추가하고 싶었고 그 과정에서 여러 가지를 수정하게 되어 이제는 Mference라는 독자적인 엔진이 되었습니다. TurboFieldfare와 동일한 핵심 아이디어로, MoE (Mixture of Experts) 모델은 토큰당 몇 개의 B (billion) 파라미터만 활성화하므로, 공유 코어와 KV 캐시 (KV cache)를 상주시키고 선택된 전문가 (experts)들을 SSD에서 스트리밍합니다. 현재 구동 가능한 모델은 다음과 같습니다:
Gemma 4 26B-A4B — 약 2 GB, 24 GB M5 Pro에서 31–35 tok/s
Qwen 3.6 35B-A3B — 약 1.45 GB, 19–23 tok/s
DeepSeek-V4-Flash 284B-A13B — 신규. 동일한 24 GB M5에서 피크 메모리 약 6.8 GB, 실제로는 대부분 약 5.3 GB, 최대 4.8 tok/s. 2-bit 동적 양자화 (dynamic quant), 디스크 용량 약 91 GB.
또한 그 과정에서 멀티턴 채팅 (multi-turn chat), OpenAI 호환 서버, 그리고 로컬 PDF/DOCX/PPTX/XLSX 첨부 파일을 지원하는 네이티브 Mac 앱도 추가했습니다. 앞으로는 모델 제품군을 계속 추가하고, 전문가 읽기 대기 시간(현재 디코딩의 약 53%가 연산과 직렬화된 I/O임)을 줄이며, 컨텍스트 (context)를 4K 이상으로 확장하고 싶습니다. 몇 번의 대화 이상으로는 유용하지 않을 수 있지만, 기술적으로 8GB Mac에서도 "사용 가능한" dsv4f를 실행할 수 있습니다. 여기서부터는 점점 더 좋아질 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기