MacBook Pro에 적합한 5가지 로컬 모델 벤치마크 — 8GB 환경의 2-bit 27B 모델이 2위를 차지했습니다
요약
MacBook Pro 환경에서 실행 가능한 5가지 로컬 AI 모델의 성능과 RAM 사용량을 벤치마크한 결과입니다. 특히 8GB RAM 환경에서 구동되는 2-bit Bonsai-27B 모델이 높은 효율성을 보이며 종합 2위를 기록했습니다.
핵심 포인트
- Bonsai-27B(2-bit)는 8GB RAM에서 구동 가능하며 도구 호출 성능 1위를 기록함
- Gemma-4-26B는 추론(MATH-500) 분야에서 100%의 압도적 성능을 보임
- Qwen3.6-27B는 코딩(HumanEval+) 테스트에서 100%의 만점을 기록함
- 테스트는 사고 과정(thinking) 기능을 끈 상태로 진행되어 추론 모델에 불리하게 설정됨
저는 단순한 느낌(vibes)에 의존하거나 6,000달러짜리 Mac Studio에서 벤치마크를 수행한 '최고의 로컬 모델' 조언에 지쳤습니다. 그래서 실제로 MacBook Pro에 들어가는 5가지 모델을 대상으로 동일한 코딩 (HumanEval+), 추론 (MATH-500), 일반 (MMLU-Pro), 그리고 30가지 도구 호출 (tool-calling) 테스트를 실행하고 실제 피크 RAM (peak RAM)을 추적했습니다.
| 모델 | RAM | 도구 (Tools) | 코드 (Code) | 추론 (Reason) | 일반 (Gen) | 평균 (Avg) |
|---|---|---|---|---|---|---|
| Bonsai-27B (2-bit) | 8.0 GB | 93% | 80% | 70% | 80% | 81% |
| Gemma-4-26B | 14.7 GB | 87% | 90% | 100% | 60% | 84% |
| Qwen3.6-27B | 15.5 GB | 93% | 100% | 50% | 70% | 78% |
| GPT-OSS-20B | 12.2 GB | 80% | 50% | 80% | 50% | 65% |
| Nemotron-Nano-30B | 18.0 GB | 83% | 50% | 70% | 40% | 61% |
두 가지 사실이 저를 놀라게 했습니다:
- Bonsai-27B는 8GB에 들어가는 삼진법 (ternary, 2-bit) 27B 모델입니다. 이는 파라미터 수가 3분의 1 수준인 모델들보다 적은 용량을 차지하면서도, 전체 2위를 기록했으며 도구 호출 (tool-calling) 점수에서 공동 1위(93%)를 차지했습니다. 이는 기본 16GB MacBook에서 실제 여유 공간(headroom)을 가지고 실행할 수 있는 유일한 모델입니다. 저도 믿기지 않았기에, 테스트 프레임워크(harness)와 5개 모델의 모든 원본 결과 파일은 리포지토리(repo)에 공개되어 있으니 직접 실행해 보시기 바랍니다.
- Nemotron-Nano-30B는 공개된 LiveCodeBench 리더보드에서는 Qwen3와 GPT-OSS를 능가하지만, 제 테스트에서는 일반 지식 40%와 함께 최하위(61%)를 기록했습니다.
주의사항: 모델 간의 공정한 비교를 위해 모든 테스트를 사고 과정(thinking) 기능을 끈 상태(OFF)로 진행했습니다. 이는 추론 모델에 가장 큰 타격을 주는 방식입니다. 사고 과정을 켠 상태로 재테스트를 진행할 예정이며, 제 측의 답변 추출(answer-extraction) 문제일 가능성도 있습니다.
방법론에 대한 사전 경고: 이 테스트는 각 세트당 10개의 질문(도구는 30개)을 사용하는 탐색(probes) 방식이며, 전체 학술 데이터 세트가 아닙니다. 이는 등급을 분류하고 완전히 실패하는 경우를 잡아내기에는 충분하지만, 3점 차이의 격차를 논하기에는 부족합니다. ±10%의 오차는 노이즈로 간주하십시오.
설정: enable_thinking=false, temp=0, M3 Ultra에서 실행 (성능 + RAM은 하드웨어 독립적이며, 디코딩 속도는 Studio에서 측정됨). 모두 OpenAI 호환이므로 Claude Code / Aider / Cursor를 localhost로 지정하여 사용할 수 있습니다.
모델별 노트, RAM에 따른 MacBook 선택 표, 재현 명령어가 포함된 전체 글은 다음에서 확인하십시오: https://rapidmlx.com/blog/best-local-ai-models-macbook-pro
요청 사항을 수행하거나 방법론을 수정하는 것은 언제든 환영합니다. 실제로 지난번 결과가 개선된 방식이 바로 그것이었으니까요.
submitted by /u/Striking-Swim6702 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기