
Turbo-fieldfare: Apple Silicon에서 2GB RAM으로 Gemma 4 26B를 실행하는 오픈 소스 엔진
요약
Apple Silicon 환경에서 Gemma 4 26B 모델을 단 2GB의 RAM만으로 실행할 수 있는 오픈 소스 Swift/Metal 추론 엔진인 Turbo-fieldfare를 소개합니다. M2 및 M5 칩셋에서 효율적인 추론 속도를 보여주며 OpenAI 호환 로컬 서버 기능도 제공합니다.
핵심 포인트
- Apple Silicon 최적화 Swift/Metal 기반 커스텀 엔진
- Gemma 4 26B 모델을 2GB RAM으로 초경량 실행 가능
- M2 MacBook Air에서 5-6 tok/s, M5에서 31-35 tok/s 성능 구현
- OpenAI 호환 로컬 서버 및 도구 호출(tool-call) 지원
이는 M-시리즈 Mac에서 매우 낮은 RAM을 사용하여 Gemma 4 26B-A4B-IT를 실행하는 커스텀 Swift/Metal 추론 엔진 (inference engine)입니다. 약 14 GB 대신 약 2GB를 사용합니다. 보고된 결과에 따르면 8 GB M2 MacBook Air에서 5–6 tok/s, M5 MacBook Pro에서 31–35 tok/s의 속도가 나옵니다. 또한 스트리밍 (streaming) 및 도구 호출 (tool-call) 지원을 갖춘 OpenAI 호환 로컬 서버를 포함하고 있습니다. submitted by /u/minefew [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기