
Mac Studio와 M4 Max를 활용한 Apple Silicon의 로컬 AI 성능 탐구 — M4 Max가 GB10 및 Strix
요약
Apple Silicon의 M4 Max와 Mac Studio가 로컬 AI 환경에서 갖는 강점을 분석합니다. 높은 메모리 대역폭과 대용량 통합 메모리를 통해 LLM 추론 시 발생하는 병목 현상을 해결하는 Apple Silicon만의 독보적인 성능을 다룹니다.
핵심 포인트
- LLM 추론의 디코드 단계는 메모리 대역폭에 크게 의존함
- Apple Silicon은 높은 메모리 대역폭과 대용량 통합 메모리 제공
- Nvidia GB10 및 AMD Strix Halo와 비교한 로컬 AI 성능 탐구
- 합리적인 비용으로 대규모 모델 구동이 가능한 유일한 플랫폼
2026년 저희의 로컬 AI 탐험은 지금까지 두 가지 주요 플랫폼에 초점을 맞추었습니다. 하나는 DGX Spark와 Dell Pro Max with GB10에서 볼 수 있는 Nvidia의 GB10이며, 다른 하나는 Corsair AI Workstation 300과 Ryzen AI Halo에서 볼 수 있는 AMD의 Ryzen AI Max+ 395, 즉 Strix Halo입니다. 저희는 일반적으로 이러한 종류의 로컬 AI 개발 샌드박스에 대해 GB10 시스템을 선호해 왔습니다. 이들의 뛰어난 전반적인 성능과 광범위한 AI 소프트웨어 호환성은 원시 LLM 추론 처리량(inference throughput)이 아주 높지 않더라도 사용하기 쉽게 만듭니다.
하지만 Apple의 Mac Studio는 대용량 통합 메모리 풀, 강력한 GPU, 그리고 GB10이나 Strix Halo가 제공할 수 있는 것보다 빠른 토큰당 초(tokens-per-second) 처리량을 가능하게 하는 높은 메모리 대역폭을 가진 시스템을 원하는 로컬 AI 개척자들에게 또 다른 매력적인 선택지입니다. 그리고 Apple이 Max 및 Ultra 칩에 사용하는 것만큼 넓은 메모리 버스를 가진 통합 메모리 SoC를 누군가 구축하기 전까지는, 사실상 Apple Silicon만이 이러한 설계의 칩에서 더 많은 메모리 대역폭을 제공하는 유일한 게임 체인저입니다.
애초에 로컬 LLM 성능에 왜 그렇게 메모리 대역폭에 초점을 맞춰야 할까요? 아주 간단히 말하자면, LLM 추론의 디코드(decode) 단계는 거의 항상 순차적이기 때문입니다. 모든 출력 토큰(프리필 과정의 일부로 생성되는 첫 번째 토큰부터 시작하여)은 다음 토큰을 생성하기 위해 모델의 모든 레이어를 통과해야 하며, 따라서 레이어 내의 활성 모델 가중치(active model weights)는 토큰이 각 레이어를 거치는 동안 메모리에서 GPU로 스트리밍되어야 합니다.
각 레이어의 개별 토큰에 필요한 계산량이 매우 적기 때문에, 전체 디코드 (decode) 프로세스의 속도는 기본적으로 해당 모델 가중치(model weights)를 GPU 메모리로부터 얼마나 빠르게 스트리밍할 수 있는지에 달려 있습니다. 이로 인해 대규모 모델을 유지하기 위한 대용량 메모리 풀(memory pools)과 해당 모델 가중치를 GPU로 스트리밍하기 위한 높은 메모리 대역폭 (memory bandwidth)을 갖춘 시스템이 매력적으로 다가오며, Apple Silicon은 (상대적으로) 합리적인 비용으로 이 두 가지 특성을 모두 가질 수 있는 유일한 플랫폼입니다.
Apple의 마지막 Mac Studio 리프레시(refresh)는 2025년 3월이었으며, 두 가지 버전의 시스템이 도입되었습니다. 상위 모델은 28-CPU-코어, 60-GPU-코어 모드와 32-CPU-코어, 80-GPU-코어 모델 모두에서 819GB/s의 메모리 대역폭을 제공하는 M3 Ultra SoC를 사용합니다.
Mac Studio의 M4 Max 버전은 단순히 코어 수 차이를 넘어 사양 면에서 더 큰 차이를 보이는 두 가지 버전으로 구성됩니다. 기본 M4 Max는 410GB/s의 메모리 대역폭을 갖춘 14-코어 CPU (10개의 성능 코어와 4개의 효율 코어)를 포함하며, 546GB/s의 메모리 대역폭을 갖춘 16-코어 CPU (12개의 성능 코어와 4개의 효율 코어)로 업그레이드할 수 있습니다.
저희는 출시 당시 이 두 시스템을 모두 리뷰했습니다만, Apple은 LLM 특화 테스트를 위해 16-코어 CPU, 40-코어 GPU, 128GB 메모리를 탑재한 또 다른 M4 Max를 관대하게 대여해 주었습니다. 당시 해당 시스템의 가격은 약 3,699달러였으며, 이는 DGX Spark의 권장 소비자 가격인 3,999달러와 근접한 수준이었습니다.
하지만 RAMpocalypse(램포칼립스)가 지속됨에 따라, Mac Studio는 구성 옵션이 더욱 제한적이고 재고를 찾기도 어려워졌습니다. 저희가 테스트한 M4 Max 버전은 현재 RAM이 최대 64GB로 제한되며, 해당 시스템의 인도 기간(lead times)은 두 달 이상 소요됩니다. 그럼에도 불구하고, 적어도 이 시장에서 달러당 가치가 의미가 있었던 시절을 기준으로 본다면, Mac Studio는 DGX Spark 및 보다 일반적인 GB10 플랫폼과 가장 비교 가능한 시스템입니다.
성능 결과에 들어가기에 앞서, 저희는 M4 Max의 40코어 GPU의 세부 사항을 파헤쳐 보고 싶었습니다. 하지만 Apple은 각 GPU 코어를 구성하는 셰이더 ALU (Shader ALU)의 수를 포함하여, 자사 GPU에 대한 상세한 아키텍처 (Architectural) 정보를 거의(혹은 전혀) 공유하지 않습니다. 따라서 M4 Max를 GB10이나 Ryzen AI Max+ 395의 Radeon 8060S와 직접적으로 비교하기는 어렵습니다.
| |
Nvidia GB10
|
AMD Ryzen AI Max+ 395
|
Apple M4 Max (16코어 CPU, 40코어 GPU)
|
| --- | --- | --- |
| 구매 가능처 |
| B&H - $4,999 |
| Amazon - $3,649.99 B&H - $6,793.60 |
| B&H - $8,499 |
| CPU 성능 코어 (Performance cores) | 10 | 16 | 12 |
| CPU 효율 코어 (Efficiency cores) | 10 | | 4 |
| GPU 코어/SM/CU 수 | 48 | 40 | 40 |
| 셰이더 ALU (Shader ALUs) | 6,144 | 2,560 | 5,120 (?)
| GPU 클럭 (GPU clock) | ~2450 MHz (typical) | 2900 MHz | ??? |
| 통합 메모리 (Unified memory) | 128GB LPDDR5X-8533 | 128GB LPDDR5X-8000 | 128GB LPDDR5X-8533(?)
| 메모리 버스 폭 (Memory bus width) | 256 bit | 256 bit | 512-bit(?)
| 메모리 대역폭 (Memory bandwidth, GB/s) | 273 | 256 | 546 |
Strix Halo에 탑재된 Radeon 8060S는 40개의 RDNA 3.5 컴퓨트 유닛 (Compute Units)을 갖추고 있으며, 각 유닛은 64개의 셰이더 ALU (Shader ALUs)를 포함하여 총 2,560개를 보유하고 있습니다. AMD는 약 14.8 TFLOPS의 피크 FP32 벡터 연산 (Peak FP32 vector math) 성능을 달성하기 위해 8060S의 클럭을 2900MHz로 높게 설정했습니다.
한편, GB10은 각 128개의 셰이더 ALU (Shader ALUs)를 가진 48개의 Blackwell SM을 보유하여 총 6,144개의 CUDA 코어를 갖추고 있으며, 저희 테스트 결과에서도 2450MHz로 비교적 높은 클럭을 보여주었습니다. 이는 무려 30 TFLOPS에 달하는 이론적 FP32 벡터 연산 (FP32 vector compute) 성능을 제공합니다.
하지만 과거 Apple이 M1 GPU를 처음 공개했을 당시, 회사는 각 코어가 128개의 실행 유닛 (execution units)을 포함하고 있다고 밝혔습니다. 동일한 구조가 현재의 Apple GPU까지 이어졌다고 가정한다면, 40코어 M4 Max GPU는 5,120개의 실행 유닛 (execution units) 또는 셰이더 ALU (shader ALUs)를 보유하게 됩니다. 이는 클럭 속도를 알지 못하는 상태에서 피크 FLOPS (peak FLOPS)나 기타 이론적 성능 지표에 대해 더 자세히 추측하기는 조심스럽지만, 최소한 GPU의 규모를 짐작할 수 있는 지표를 제공합니다.
Apple은 M4 Max에 대해 가공되지 않은 메모리 대역폭 (memory bandwidth) 수치만을 제공하지만, 간단한 계산을 통해 이 칩이 546 GB/s의 정격 메모리 대역폭 (memory bandwidth)을 달성하기 위해 GB10 및 Strix Halo보다 두 배나 넓은 512비트 버스 (512-bit bus) 상의 LPDDR5X-8533을 사용할 가능성이 높다고 추측할 수 있습니다. 하위 모델인 M4 Max는 LPDDR5X-6400을 사용할 가능성이 높습니다. 결과적으로, M3 Ultra는 두 변형 모델 모두에서 LPDDR5X-8533을 사용하는 768비트 너비의 버스 (768-bit-wide bus)를 사용할 것으로 보입니다.

(이미지 출처: Tom's Hardware)
저희는 초기 리뷰에서 Mac Studio의 설계를 자세히 다루었지만, 다시 익숙해지기 위해 빠르게 살펴보는 것도 가치가 있습니다. 시스템의 상단과 측면은 상단의 검은색 Apple 로고가 박혀 있는 것을 제외하면 대체로 특징이 없습니다. 전면 패널에는 두 개의 10Gbps USB Type-C 포트와 UHS-II SD 카드 리더기가 있습니다.

(이미지 출처: Tom's Hardware)
Studio의 열 설계 (thermal design)는 시스템의 원형 받침대 주변에 있는 통풍구에서 공기를 흡입한 후 섀시 뒷면의 통풍구를 통해 배출하는 영리한 흡기 시스템을 사용합니다.

(이미지 출처: Tom's Hardware)
저희가 테스트한 M4 Max Studio는 후면 패널에 최대 120Gbps의 데이터 전송 속도를 지원하는 무려 4개의 Thunderbolt 5 포트를 갖추고 있습니다. 오늘 테스트를 진행하고 있지는 않지만, Exo와 같은 유틸리티를 사용하여 Mac Studio의 저지연 클러스터링 (low-latency clustering)을 위해 Thunderbolt 5 상의 RDMA (RDMA over Thunderbolt 5)를 활성화할 수 있습니다. 이 포트들은 또한 Thunderbolt 디스플레이 또는 DisplayPort 2.1 Alt Mode를 지원합니다.
이 시스템에는 또한 5Gbps로 작동하는 두 개의 USB 3 포트, 10Gb Ethernet, HDMI 2.1 포트 및 헤드폰 잭이 있어, 2026년의 컴팩트한 데스크톱에서 실질적으로 원하는 모든 연결성을 갖추고 있습니다.
이러한 기본 사항들을 살펴보았으니, 이제 테스트로 넘어가 보겠습니다.
LLM 추론 (Inference) 성능을 테스트하기 위해, 우리는 소스에서 빌드할 때 Apple Silicon에 대한 네이티브 Metal/MLX 지원을 포함하는 llama.cpp를 다시 한번 활용했습니다. 벤치마킹 프레임워크로는 llama-benchy 프로젝트를 사용했습니다.

(이미지 출처: Tom's Hardware)
우리는 다양한 메모리 점유율과 아키텍처를 가진 세 가지 모델을 테스트했습니다: 최근의 전문가 혼합 (Mixture-of-Experts, MoE) 모델인 Qwen 3.6-35B-A3B, 소형 밀집 (Dense) 모델인 Gemma 4 12B, 그리고 OpenAI의 대형 전문가 혼합 (Mixture-of-Experts, MoE) 모델인 gpt-oss-120b입니다. 테스트에는 이 모델들의 Unsloth 4비트 양자화 (Quantization) 버전을 사용했습니다.

Tom's Hardware

Tom's Hardware
Qwen 3.6-35B-A3B 테스트를 시작하며, Mac Studio는 Strix Halo를 능가하는 프롬프트 처리 속도를 보여주었으나, 특히 컨텍스트 (Context)가 길어질 경우 GB10에는 여전히 뒤처지는 모습을 보였습니다.
처리량 (Throughput) 결과로 넘어가면, M4 Max는 GB10과 Strix Halo 모두를 앞서며, 모든 컨텍스트 깊이에서 두 시스템보다 더 높은 초당 토큰 (Tokens-per-second) 처리량을 기록했습니다.
하지만 서류상으로는 GB10 및 Strix Halo보다 두 배 높은 메모리 대역폭 (Memory Bandwidth)을 가졌음에도 불구하고, Qwen 3.6-35B-A3B에서 M4 Max의 실제 토큰 처리량 개선은 단 25%에 그쳤습니다. 이는 분명 반가운 결과이지만, 두 배의 메모리 대역폭을 사용할 때 기대할 수 있는 속도 향상에는 훨씬 못 미치는 수준입니다.

Tom's Hardware

Tom's Hardware
반면에 밀집 (Dense) 모델인 Gemma 4 12B는 Mac Studio의 대역폭 이점이 정말 빛을 발하는 것으로 보입니다. 이 모델의 경우 초당 토큰 (Tokens-per-second) 처리량이 메모리 대역폭에 따라 더 선형적으로 확장되며, 이에 따라 Mac Studio는 GB10 대비 1.8배, Strix Halo 대비 2.26배 높은 처리량을 제공합니다.
하지만 프롬프트 처리 속도(prompt processing speeds)는 여기에서 Strix Halo와 비슷하거나 심지어 약간 더 낮은 수준이며, 이는 지연 시간(latency)이 중요한 애플리케이션을 사용하는 경우 아주 만족스러운 결과는 아닙니다.

Tom's Hardware

Tom's Hardware
마지막으로 gpt-oss-120b를 살펴보겠습니다. 프롬프트 처리 속도는 다시 한번 Strix Halo와 GB10 사이의 수치를 기록했으며, 초당 토큰 수(tokens-per-second) 처리량은 두 시스템보다 훨씬 높습니다. 하지만 Mac Studio의 초당 토큰 수 처리량은 훨씬 더 높은 메모리 대역폭(memory bandwidth)에도 불구하고, 평균적으로 GB10보다 1.5배, Strix Halo보다 1.6배 높습니다. 이는 여전히 인상적인 격차이지만, 메모리 대역폭이 추론 파이프라인(inference pipeline)의 성능을 판단하는 하나의 구성 요소일 뿐이라는 점을 보여줍니다.
전반적으로, 우리의 LLM 추론 테스트 결과는 M4 Max GPU가 대규모 통합 메모리 풀(unified memory pools)을 가진 경쟁 시스템보다 초당 훨씬 더 많은 토큰을 생성할 수 있지만, 메모리 대역폭 사양만으로는 실제 전달되는 성능을 나타내는 좋은 대리 지표(proxy)가 될 수 없음을 보여줍니다. LLM 추론에서 M4 Max를 통해 얻는 실제 성능 향상은 실행하려는 모델의 아키텍처(architecture)에 크게 의존하므로, 실제 벤치마킹(benchmarking)이 여전히 중요합니다.
이미지 생성 성능
로컬에서 실행하고자 하는 AI 워크로드(workload)가 LLM만 있는 것은 아닙니다. 이미지 및 비디오 생성 또한 중요하며, 이러한 확산 모델(diffusion models)의 성능은 일반적으로 기반이 되는 GPU의 연산 처리량(compute throughput)에 의해 제한됩니다.

(이미지 출처: Tom's Hardware)
Mac Studio에서 Flux.2 Klein 이미지 생성 테스트를 실행했을 때, ComfyUI 워크플로가 기본적으로 사용하는 FP8 데이터 타입에 대한 GPU 지원이 명백히 부족하여 초기 실행에 실패했습니다.
우리는 ComfyUI 워크플로를 수정하여 Mac Studio에서 Flux.2 Klein의 기본 FP16 버전을 사용할 수 있도록 했지만, 이러한 초기 호환성 문제는 Apple Silicon에서의 이미지 또는 비디오 생성 경험이 GB10나 심지어 Strix Halo만큼 매끄럽지 않을 수도 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기