
10GB 미만 메모리에서 Inkling-Small 276B-A12B가 약 2.9 tok/s로 작동
요약
Mference 프로젝트를 통해 Inkling-Small 276B-A12B와 같은 대규모 MoE 모델을 10GB 미만의 메모리 환경에서 구동하는 방법을 소개합니다. Swift와 Metal 기반으로 제작되어 Mac 하드웨어에 최적화되었으며, 소비자급 기기에서의 대형 모델 실행을 목표로 합니다.
핵심 포인트
- Inkling-Small 276B 모델을 10GB 미만 메모리에서 약 2.9 tok/s로 실행 가능
- Swift와 Metal을 사용하여 MLX/llama.cpp 래퍼가 아닌 독자적인 엔진 구축
- Gemma 4, Qwen, DeepSeek 등 다양한 모델 제품군 지원
- 소비자급 하드웨어에서 대규모 MoE 모델 구동 최적화 지향
Mference 출시의 후속 조치로, 이제 Inkling-Small 276B-A12B를 지원하고 실행합니다. pipenetwork/Inkling-Small-MLX-4bit 변환에서 가져온 Inkling-Small (Thinking Machines, Apache 2.0)의 사양은 다음과 같습니다: 총 파라미터 276B, 활성 파라미터(active) 약 12B, 상주 세트(resident set) 3.4 GB, 디스크 용량 약 148 GB입니다. 저의 M5 (24GB)에서 측정한 결과는 다음과 같습니다:
| 프롬프트 유형 | 프롬프트 / 생성(gen) | Prefill (로드 제외) | Decode | 피크 풋프린트(Peak footprint) |
|---|---|---|---|---|
| short-explanation | 59 / 416 | 8.4 s | 2.86 tok/s | 9.48 GB |
| medium-review | 421 / 560 | 60.1 s | 2.93 tok/s | 9.59 GB |
| long-synthesis | 2,785 / 294 | 535.9 s | 2.56 tok/s | 9.56 GB |
256 GB M3 Ultra에서 동일한 세 가지 케이스를 테스트했을 때는 5.31–6.92 tok/s를 기록했습니다. 문제점: 긴 프롬프트의 Prefill 성능이 매우 좋지 않습니다 (2,785 토큰의 경우 첫 토큰이 나올 때까지 거의 9분이 소요됨). 또한 현재는 텍스트 전용입니다. 현재 네 가지 모델 제품군을 지원합니다: Gemma 4 26B-A4B (~2 GB), Qwen 3.6 35B-A3B (~1.45 GB), DeepSeek-V4-Flash 284B-A13B (~6.8 GB), Inkling-Small 276B-A12B (~9.5 GB). 저도 몇 대의 M3 Ultra를 사용할 수 있게 되었으므로, 더 높은 사양에 대해서도 테스트와 최적화를 진행할 예정입니다. 하지만 주요 목표는 동일합니다: 소비자급 하드웨어에서 대규모 MoE (Mixture of Experts) 모델을 구동하는 것입니다. 리포지토리(Repo): https://github.com/NeelM0906/Mference — MLX나 llama.cpp의 래퍼(wrapper)가 아닌 Swift + Metal로 제작되었습니다. Mac 앱, CLI, 그리고 OpenAI 호환 서버를 제공합니다. 기여(Contributions)를 환영합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기