나의 AI 스택을 NVIDIA에서 Apple Silicon으로 옮겼다가 다시 돌아온 이유
요약
로컬 AI 환경 구축을 위해 Mac Mini M4를 사용해 본 경험을 바탕으로, Apple Silicon과 NVIDIA GPU 기반 PC의 성능 및 메모리 관리 차이를 분석합니다. 16GB 통합 메모리의 한계와 VRAM의 독립적 운용 차이가 실질적인 AI 워크로드에 미치는 영향을 다룹니다.
핵심 포인트
- Mac Mini M4는 저전력·저소음 환경에서 소형 모델 추론에 매우 민감하고 빠름
- 16GB 통합 메모리는 OS 및 앱 점유로 인해 대형 모델 로드 시 메모리 부족 발생
- NVIDIA GPU는 VRAM이 OS와 분리되어 있어 모델 로드 및 멀티태스킹에 유리함
- Apple Silicon은 모델 가용성 및 메모리 압박 측면에서 대형 모델 운용에 한계가 있음
나의 AI 스택을 NVIDIA에서 Apple Silicon으로 옮겼다가 다시 돌아온 이유
나는 Mac Mini M4가 로컬 AI를 위한 나의 Windows PC를 대체할 수 있을 것이라 생각하며 구매했다. 스포일러를 하자면: 그렇지 않았다. 하지만 실패한 것도 아니다. 단지 내가 예상했던 것과는 다른 부분에서 뛰어난 성능을 보여주었을 뿐이다.
여기 벤치마크 차트에는 아무도 넣지 않는 실제 수치를 포함한 6개월간의 실제 사용 데이터가 있다.
하드웨어 (The Hardware)
| 기기 (Machine) | CPU/GPU | RAM | 지불 금액 |
|---|---|---|---|
| Mac Mini M4 | 10-core M4, 10-core GPU | 16GB unified | $599 |
| ... |
Mac Mini는 조용하고, 작으며, 전력을 아주 적게 소모한다. 반면 PC는 부하가 걸리면 제트 엔진 소리가 나고 GPU가 작동할 때 200W 이상의 전력을 끌어다 쓴다. 나는 Mac이 AI와 관련된 모든 것에서 PC를 대체하기를 원했다. 내 생각은 절반만 맞았다.
마이그레이션 (The Migration) (1-2개월 차)
나는 Mac Mini에 Ollama를 설치하고, Qwen 3.5 9B를 내려받아 일상적인 메인 도구로 사용하기 시작했다. 가장 먼저 느낀 점은 빠르다는 것이다. 정말 빠르다. 9B 모델 기준으로, 추론 (Inference) 속도가 동일한 모델을 실행하는 RTX 3060보다 더 민첩하게 느껴졌다.
하지만 그 후 더 큰 모델들을 로드하려고 시도했다.
Qwen 3 Coder 30B (Q4_K_M, ~18GB): RTX 3060 (12GB VRAM... 잠깐, 이건 작동하면 안 되는데)에서 문제없이 로드되었다. 아 맞다 — 시스템 RAM으로 오프로드 (Offload)된다. 느리긴 하지만 작동은 한다. Mac Mini에서는? 메모리 부족 (Out of memory). 16GB 통합 메모리 (Unified memory)는 16GB의 자유 메모리가 아니다. Ollama가 시작되기도 전에 OS, 브라우저, 그리고 앱들이 6-8GB를 잡아먹는다.
DeepSeek R1 8B: 둘 다에서 잘 돌아간다. Mac Mini: ~25 tok/s. RTX 3060: ~35 tok/s. GPU가 승리했지만, 대화형 사용 (Interactive use)에 영향을 줄 만큼의 차이는 아니다.
Qwen 3.5 9B: Mac Mini: ~18 tok/s. RTX 3060: ~28 tok/s. 다시 말하지만, GPU가 더 빠르지만 둘 다 즉각적인 느낌을 준다.
지금까지의 상황: Mac Mini는 작은 모델들을 잘 처리한다. 하지만 나는 빠르게 한계에 부딪혔다.
한계 (The Wall) (3개월 차)
세 가지 요소가 나의 "Mac 전용" 꿈을 깨뜨렸다:
1. 메모리 압박 (Memory Pressure)
16GB 통합 메모리는 다음과 같은 것들을 실행하기 전까지는 많게 느껴진다:
- Ollama (로드된 모델을 위해 4-8GB)
- 몇 가지 확장이 설치된 VS Code (2-3GB)
- 20개의 탭이 열린 Safari (3-4GB)
- 터미널, 음악 플레이어, 어쩌면 화상 통화 (2GB)
모델에게 질문을 던지기도 전에 이미 11-17GB를 점유한 상태입니다. macOS는 스와핑 (swapping)을 시작합니다. Ollama는 느려집니다. 기기 전체가 버벅거리기 시작합니다.
128GB RAM을 탑재한 Windows PC는 어떨까요? 저는 30B 모델을 로드하면서 동시에 게임을 실행하고 코드 컴파일까지 할 수 있습니다. RTX 3060의 12GB VRAM은 OS와 경쟁하지 않는 별도의 풀 (pool)입니다.
2. 모델 가용성 (Model Availability)
모든 모델이 Apple Silicon에서 잘 작동하는 것은 아닙니다. M4는 주류 모델 (Llama, Qwen, Mistral)에 대해 뛰어난 지원을 제공하지만, 틈새 모델이나 새로 출시된 모델들은 종종
Windows의 NVIDIA 드라이버는... 괜찮습니다. 문제가 생기기 전까지는 말이죠. 업데이트 하나가 CUDA를 망가뜨리고, 새로운 Ollama 버전은 다른 드라이버를 요구하며, 갑자기 화요일 밤에 nvidia-smi를 디버깅하고 있는 자신을 발견하게 됩니다. Mac은 그냥 작동합니다. 지난 6개월 동안 시스템 업데이트 때문에 Apple Silicon AI 설정이 망가진 적은 단 한 번도 없었습니다.
휴대성 (Portability)
Mac Mini의 플러그를 뽑아 다른 방으로 가져갔다가 다시 꽂았더니, 30초 만에 전체 AI 스택이 다시 온라인 상태가 되었습니다. 풀 타워 PC로 한번 시도해 보세요.
실제 수치 (The Real Numbers)
다음은 초당 토큰 수(tokens/sec)와 전력 소모량을 기록하는 간단한 스크립트로 추적한 한 달간의 실제 사용 데이터입니다:
| 작업 (Task) | Mac Mini M4 | RTX 3060 | 승자 (Winner) |
|---|---|---|---|
| Qwen 3.5 9B, 500-토큰 프롬프트 | 18 tok/s | 28 tok/s | RTX 3060 |
| ... |
내가 실제로 하고 있는 일
저는 승자를 가리려는 시도를 그만두었습니다. 두 기기 모두 각자의 역할이 있습니다:
Mac Mini M4:
- 상시 가동되는 오케스트레이션 (라우팅, 스케줄링, 알림)
- 빠른 작업을 위한 소형 모델 추론 (4-9B)
- 코딩 및 개발 (나의 데일리 드라이버)
- 24/7 가동, 전력 비용 월 약 $3
Windows PC + RTX 3060:
- 헤비 추론 (30B 모델, 이미지 생성)
- 사용하지 않을 때는 Vast.ai에서 GPU 대여
- CUDA가 필요하거나 8GB 이상의 VRAM이 필요한 모든 작업
- 필요할 때만 사용 (On-demand), 24/7 가동 아님
이것은 벤치마크에 따른 결론이 아닙니다. 워크플로우(Workflow)에 따른 결론입니다. Mac Mini는 두뇌이고, PC는 근육입니다. 작업 유형별로 이를 분리함으로써 "어떤 기기를 사용해야 하지?"라는 결정 피로를 없앴고, 두 기기 모두 각자 잘하는 일에서 더 빨라졌습니다.
솔직한 최종 결론
로컬 AI를 위해 기기를 한 대만 구매해야 하고 대형 모델을 실행하고 싶다면: NVIDIA GPU를 사세요. 끝입니다. 생태계, 메모리 아키텍처, 그리고 순수 추론 속도는 여전히 본격적인 워크로드(Workload)에 있어 타의 추종을 불허합니다.
소형 모델과 오케스트레이션을 위해 조용하고 효율적이며 항상 켜져 있는 기기를 원한다면: Mac Mini M4가 훌륭합니다. 다만, 모든 것을 전용 GPU로 대체할 수 있을 것이라고 기대하지는 마세요.
만약 이미 두 기기를 모두 가지고 있다면? 통합하려고 애쓰지 마세요. 각 기기가 잘하는 일에 맞춰 사용하세요. 분리되어 있다는 것 자체가 하나의 기능(feature)입니다.
Sam Hartley는 Mac Mini와 Windows PC를 통해 분리된 AI 스택(split AI stack)을 운영하는 1인 개발자입니다. 이 기사를 작성하는 동안 어떤 벤치마크(benchmark)도 해를 입지 않았습니다. 그저 수많은 time 명령어와 전력 측정기(power meter)만 사용했을 뿐입니다.
여러분의 설정(setup)을 댓글로 남겨주세요. 다른 분들도 저와 같은 분리된 방식을 찾았는지, 아니면 단일 기기 설정으로 모든 것을 해결했는지 궁금합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기