
로컬 LLM study1-a: gemma4:e2b/e4b의 MLX 버전은 얼마나 빠른가
요약
Gemma 4 모델의 MLX 버전 성능을 일반 버전과 비교 분석한 결과입니다. Apple Silicon에 최적화된 MLX 프레임워크를 통해 일반 버전 대비 약 2~5배 빠른 속도를 보여주며, 모델 사이즈는 더 작으면서도 답변의 정확도는 동등하거나 더 높은 수준을 유지합니다.
핵심 포인트
- MLX 버전은 일반 버전 대비 약 2~5배 빠른 추론 속도 제공
- Apple Silicon의 Metal/통합 메모리 아키텍처 최적화 효과
- 일반 버전보다 작은 모델 사이즈로 효율성 증대
- 코드 리뷰 및 버그 탐지 등 주요 태스크에서 높은 품질 유지
이 기사에 대하여
study1에서는 gemma4:e2b와 gemma4:e4b를 포함한 11개 모델을 비교했습니다. 이번에는 Google에서 동일 모델의 MLX 버전(gemma4:e2b-mlx, gemma4:e4b-mlx)이 공개된 것을 확인하여, study1과 동일한 4가지 태스크로 실측하고 일반 버전과 어느 정도 차이가 나는지 검증했습니다. 번외편으로서 「study1-a」의 위치를 가집니다.
확인 경위: 2026년 7월 15일에 Google이 Gemma 4 패밀리의 개선(FA4 Attention, 채팅 템플릿 수정 등)을 Hugging Face 상에서 발표했으나, 실제로 ollama pull gemma4:e2b로 모델 ID를 비교해 본 결과 일반 버전의 다이제스트(digest)는 완전히 일치하였으며, Ollama 배포판에는 반영되지 않은 상태였습니다. 반면, MLX 버전(Apple Silicon용 최적화 빌드)은 양자화 방식(nvfp4)과 사이즈 모두 일반 버전과 다른 별개의 것이며, 실제로 새로 가져올 수 있음을 확인했습니다.
TL;DR
- MLX 버전은 2~5배 빠릅니다. 특히 FizzBuzz와 같이 짧은 태스크일수록 배율이 큽니다. - 답변 내용의 정확도는 일반 버전과 동등하거나 그 이상입니다 (코드 리뷰·버그 탐지는 매우 고품질).
- 다만 한 가지, 데코레이터 설명 태스크에서 일반 버전과 다른 동작이 관찰되었습니다 (상세 내용은 후술).
- 사이즈도 더 작습니다:
e2b-mlx는 6.5GB (일반 버전 7.2GB),e4b-mlx는 8.8GB (일반 버전 9.6GB).
검증 환경
| 항목 | 내용 |
|---|---|
| 칩 | Apple M4 |
| ... | |
-mlx 태그를 사용하려면 Ollama v0.31.0 이상이 필요합니다. |
검증 방법
study1과 동일한 4가지 태스크를 동일한 지시문으로, 각각 독립적인 ollama run 단발 호출로서 실행했습니다 (태스크 간 대화 이력은 공유하지 않았습니다).
- 코드 리뷰 (
divide(a, b)함수) - FizzBuzz 생성 (1~20)
- 버그 탐지 (
calculate_average함수, 문맥 의존적 버그) - 데코레이터의 일본어 설명
결과: 속도
| 태스크 | e2b (일반 버전) | e2b-mlx | 배율 | e4b (일반 버전) | e4b-mlx | 배율 |
|---|---|---|---|---|---|---|
| FizzBuzz | 36.5초 | 8초 | 4.6배 | 43.4초 | 9초 | 4.8배 |
| 버그 탐지 | 35.6초 | 13초 | 2.7배 | 58.8초 | 22초 | 2.7배 |
| 데코레이터 설명 | 32.4초 | 15초 | 2.2배 | 63.5초 | 36초 | 1.8배 |
| 3개 태스크 평균 | 34.8초 | 12.0초 | 2.9배 | 55.2초 | 22.3초 | 2.5배 |
코드 리뷰는 study1 측에 초 단위 기록이 없기 때문에 배율 비교는 불가능하지만, 참고치로서 e2b-mlx 28초, e4b-mlx 31초였습니다.
속도 차이의 요인은 MLX 프레임워크가 Apple Silicon의 Metal/통합 메모리 아키텍처에 최적화되어 있기 때문이라고 생각됩니다. 동일한 GGUF 양자화(llama.cpp 백엔드)로 동작하는 일반 버전과 달리, MLX 버전은 Apple 제작 프레임워크 위에서 네이티브로 동작합니다.
결과: 내용의 질
코드 리뷰·FizzBuzz·버그 탐지: 일반 버전과 동등하거나 그 이상
3개 태스크 모두 정확도는 일반 버전의 기술(study1)과 동등하거나 그 이상이었습니다. 특히 버그 탐지 태스크에서는 e4b-mlx가 "현재 코드를 실행할 경우... 에러는 발생하지 않습니다. 계산 결과는 올바릅니다 (4.0)"라고, 문맥 의존적으로 이번에는 문제가 발생하지 않음을 명시적으로 언어화하여, study1에서 높은 평가를 받았던 일반 버전의 수준을 유지하고 있습니다.
코드 리뷰는 양쪽 모두 0으로 나누기 체크, 타입 힌트(Type Hint), Docstring을 포함한 개선안을 평가표와 함께 제시하는 등 매우 구조화된 답변이었습니다.
데코레이터 설명: 일반 버전과 다른 해석을 함
이 부분이 이번에 유일하게 신경 쓰이는 점입니다. study1에서는 gemma4:e2b (일반 버전)가 "*args/**kwargs를 포함하여 정확함"이라고 Python의 @decorator 구문을 바탕으로 설명을 해주었으나, 이번 e2b-mlx
는 Python이라는 문맥을 명시하지 않았음에도 불구하고, 일반적인 객체 지향의 "Decorator 디자인 패턴" (피자에 토핑을 얹는 비유)으로서 설명하며, Python의 @ 구문이나 함수에 대해서는 일절 언급하지 않았습니다. e4b-mlx 역시 마찬가지로, 커피 아날로지(analogy)를 사용한 설명에 그쳤으며 실제 Python 코드 예시는 보여주지 않았습니다.
"데코레이터를 알기 쉽게 일본어로 설명해 주세요"라는 지시문 자체는 study1과 완전히 동일하며, 태스크 단독으로는 "Python"이라는 단어를 포함하고 있지 않습니다. 일반 버전이 단발적인 질문에서도 Python 문맥을 기본적으로 보완하여 답변했던 것에 반해, MLX 버전은 보다 일반적인 설계 패턴에 대한 해설을 내놓았다는 차이점이 이번 테스트에서 관찰되었습니다. 1회의 실행 결과이므로 단정 지을 수는 없으나, 프롬프트가 모호할 경우의 기본 해석이 모델 빌드에 따라 달라질 수 있다는 점은 실무상 기억해 둘 가치가 있습니다.
요약
| 관점 | 평가 |
|---|---|
| 속도 | 2~5배 빠름. 특히 짧은 태스크에서 현저함 |
| ... |
Apple Silicon Mac에서 구동하는 것을 전제로 한다면, 속도 측면의 이점은 매우 크며, gemma4:e2b-mlx · gemma4:e4b-mlx는 일반 버전의 실질적인 상위 호환으로서 사용할 가치가 있습니다. 다만, 모호한 지시에 대한 기본 해석이 변할 가능성이 있다는 점은 프롬프트를 가능한 한 구체적으로 작성함으로써 보완하는 것이 안전합니다.
🤖 본 기사는 생성형 AI와의 대화(Claude Code)를 바탕으로, 실제로 Ollama를 조작하여 얻은 검증 결과를 구성 및 편집하였습니다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기