M5 Ultra Mac Studio 리뷰
요약
본 기사는 Mac Studio와 RTX 5090 등 다양한 GPU 환경에서 Qwen 3.8 27B 같은 대형 언어 모델(LLM)의 생성 속도를 비교 분석합니다. M5 Ultra가 이전 세대 대비 성능 향상을 보였으나, vLLM이나 SGLang과 같은 최적화된 프레임워크를 사용하는 RTX 5090 환경이 훨씬 높은 처리량(tok/s)을 보여주었습니다.
핵심 포인트
- vLLM 등 최적화 도구 사용 시 RTX 5090의 성능이 매우 높음 (최대 300 tok/s).
- M5 Ultra는 메모리 용량이 크지만, 고성능 추론 속도 면에서는 전용 GPU가 우위.
- 로컬 환경에서 LLM을 구동하는 것은 비용 효율적이며, 개발 생산성을 크게 향상시킬 잠재력이 있음.
- Mac Studio M5 Ultra의 가격은 과거 최고급 컴퓨터와 비교했을 때 합리적인 수준임.
가장 궁금했던 Mac Studio와 RTX 5090의 생성 속도 비교가 글 하단 차트에 숨어 있음. Qwen3.8 27B의 프롬프트 길이별 생성 속도는 다음과 같음.
프롬프트 길이 8K / 64K / 128K / 256K 순으로, RTX 5090 PC는 59 / 51 / 44 / 측정 불가 tok/s, M5 Ultra는 48 / 39 / 32 / 24 tok/s, M3 Ultra는 31 / 23.5 / 20 / 15 tok/s임.
더 많은 비교 수치는 이 섹션에서 확인 가능함.
RTX 5090 수치가 너무 낮게 나옴. ninfer에서 NVFP4와 MTP를 쓰면 200 tok/s 이상 가능함.
M3에서 M5로 넘어가며 프롬프트 처리 성능이 도약한 그래프가 인상적임. GLM 5.3-flash도 로컬에서 약 30 tok/s로 돌아가는데, 내 생각에는 대략 Opus 4.8급인 듯함.
거슬리는 차트 애니메이션은 다음 CSS 필터로 끌 수 있음. macstories.net##*:style(animation: none !important; transition: none !important)
Mac에서 27B 밀집 모델을 돌리는 건 그다지 합리적이지 않음. 대역폭은 적당하고 메모리는 넉넉한 환경이라면 MoE가 훨씬 잘 맞음.
밀집 모델이니 성능이 뒤처지는 건 당연함. 대신 Qwen 3.8 Next를 5090에서 돌려보고 속도를 비교해보면 됨. 5090의 VRAM은 32GB로, 본문의 M5가 가진 256GB와 달리 모델이 들어가지 않으니 속도가 거의 0에 가까울 것임.
500W RTX PRO 6000에서 Qwen 3.8 27B UD-Q4_K_M을 기본 llama-bench로 측정하면 pp512 3,920 tok/s, tg128 81 tok/s가 나옴. 5090은 VRAM이 더 적을 뿐 칩이 사실상 같으니 속도도 비슷할 것임. mtp-bench에서 MTP3를 쓰면 140 tok/s임.
이는 llama.cpp 기준이고, 이 카드에서 잘 돌아가는 vLLM이나 SGLang은 더 빠름. vLLM의 NVIDIA/Qwen3.8-27B-NVFP4는 기본 프리필이 약 13,000 tok/s이고, 생성 속도는 기본 72 tok/s에서 mtp7 적용 시 157 tok/s, dflash7 적용 시 215 tok/s까지 올라감. mtp-bench의 code_python 프롬프트에서는 DFlash2가 거의 300 tok/s에 도달함.
2011년에 최고 사양 27인치 iMac을 3,700달러에 사서 10년 썼는데, 현재 가치로는 5,510.05달러임. 당시 Mac Pro 타워와 Cinema Display 조합은 더 비쌌고, 중상급 기종이었던 iMac보다는 지금의 Studio M5 Ultra와 비교하는 게 맞아 보임.
2011년의 5,700달러는 현재 8,488.46달러, 7,700달러는 11,466.87달러에 해당함. 지금 Mac Studio M5 Ultra 가격은 9,466.8711,466.87달러이고, 메모리 가격이 2년 전과 같았다면 여기서 약 2,0003,000달러를 빼면 됨. 현재 가격도 과거 최고급 컴퓨터와 크게 다르지 않음. 물가상승률 계산
첫 리뷰로는 훌륭하지만 저자가 개발자는 아니므로, M5 Mac Studio의 로컬 모델로 20x 구독 요금제에 필적하는 개발 생산성을 낼 수 있는지는 아직 모름. 새 하드웨어에 맞춰 커널에서 손쉽게 개선할 수 있는 부분이 있는지도 궁금함.
충분히 활용한다면 OpenRouter에서 돌릴 수 있는 어떤 모델보다도 M5 Mac Studio가 비용 효율적이라고 봄. 검열 없이 사이버 작업을 수행하는 공개형 에이전트를 실행하는 데도 가장 경제적인 선택이 될 것임.
개발자가 이 하드웨어로 일주일 내내 Astra-Ultra 같은 사용 경험을 얻을 수 있게 된다면 흥미로운 전환점이 될 것임. 그때는 20x 클라우드 구독보다도 가치가 높다고 할 수 있음.
Kimi K3처럼 현재 가장 큰 공개 모델조차 Astra 수준과는 거리가 멂. 최고 사양 M5 Ultra에서도 SSD에서 가중치를 계속 읽어야 하므로 최대 약 0.5 tok/s에 그칠 것임. 지금까지 최고 용량 M5 Max의 SSD 속도는 약 13GB/s임.
백그라운드에서 간단한 질의응답을 하기에는 괜찮지만 본격적인 코딩용과는 거리가 멂. 읽어 들인 가중치를 계층별로 재사용하도록 여러 추론 흐름을 배치 처리해 전체 처리량을 높이는 실험은 해볼 수 있음. Kimi 계열은 에이전트 군집을 잘 지원하므로 이 지점에서는 “Ultra”가 어느 정도 의미를 갖지만, 개별 세션 성능은 더 떨어짐. 결국 백그라운드 작업용이며, 24시간 내내 충분히 활용해야 하드웨어값을 회수할 가능성이 생김.
아쉽지만 로컬 모델의 생산성은 최첨단 모델과 아직 큰 차이가 있음. 언젠가는 충분히 쓸 만해지겠지만 지금은 아님. 최첨단 모델도 코딩을 겨우 잘하는 수준이고, Opus 4.5가 처음으로 괜찮은 코딩 모델이었다고 봄.
그래도 로컬 모델 성능을 계속 발전시키는 일은 반드시 필요함. 모델 개발사들이 안전을 명분으로 규제를 장악하지 못하게 해야 함.
Apple 웹사이트에는 512GB 메모리 옵션이 10월 출시라고 나옴. 업그레이드 비용이 4,000~6,000달러 더 붙는다고 보면, 2TB 저장장치를 넣은 Ultra는 15,000달러를 넘을 것임. OpenAI Pro 구독료 약 12년 치에 해당함.
앞으로 어느 방향으로 갈지는 예측하기 어려움. 제한을 제거한 모델을 쓰려면 비밀 조직에 들어가야 하는 세상이 된다면 이런 Mac이 의미 있을 것임. 반대로 개인용 사이버 무기를 의무 등록하게 된다면 구매 기록만으로도 처벌받을 위험이 생김.
실제 작업을 외장 디스크에 두고 과시용으로 샀다고 둘러대도 시스템에 흔적은 남음. 규제 사각지대에서 비공식 서버를 빌리는 방법도 대금을 주고받을 수 있어야 성립함. 그래도 이 장비는 작으니, 통신 연결을 갖춘 전기차에 싣고 친척 농장에 두는 식으로 숨길 수는 있음.
512GB 옵션은 값어치가 없다고 봄. 그만큼 큰 가중치를 쓰면 속도가 심하게 떨어짐. 대형 공개 가중치 모델을 적당한 속도로 완전히 비공개 추론할 수 있는 256GB가 적정선임.
지금 OpenAI에 절반을 선납하고, OpenAI Pro를 12년 동안 중단 없이 제공한다는 철통같은 계약이라도 맺을 수 있는 것처럼 계산하는 셈임.
하드웨어 얘기가 나온 김에 덧붙이면, 이 기사의 SSD 테스트 결과가 꽤 흥미로웠음. 이미 알려진 내용일 수도 있음.
어느 정도 성능을 갖춘 모델을 돌리려는 목적이라면 로컬 AI로 돈을 아끼려다 실망할 가능성이 큼. 로컬 AI에 기대할 다른 이유는 많지만 비용 절감은 아니라고 봄.
테스트한 구성의 가격은 18,000달러임. 이 제품 때문에 5090이 가성비 좋은 선택처럼 보일 줄은 몰랐음.
5090의 VRAM은 32GB임. Qwen 27B처럼 작은 모델을 돌리려고 18,000달러짜리 구성을 사는 건 어리석음. 이런 장비에서는 단일 5090에 들어가지 않는 GLM Flash나 Qwen Next를 쓰는 것임.
완전히 동등한 비교는 아니지만, 지금 비교 대상으로 삼을 만한 건 가격과 256GB 메모리 용량이 비슷한 DGX Spark 2대임. 에이전트 반복 실행에서 메모리 대역폭과 연산 성능 중 무엇이 중요한지가 핵심인 만큼, 대부분에게는 단순 성능 수치보다 코딩 벤치마크의 작업당 완료 시간이 더 유용함.
좋은 기사이고 M5의 전망도 밝지만, 다른 플랫폼과 비교한 자료가 더 나와야 정확한 위치를 알 수 있을 것임.
속도와 작업 완료 시간을 구분하는 건 새로운 논점이자 좋은 접근임. 연산 비용만 따로 떼어 볼 수는 없음. 직접 장비를 보유하면 시행착오 비용이 줄고 세밀한 유지관리도 쉬워지는 등 여러 요소가 달라짐.
필요한 메모리 용량만 확보되면 생성 속도는 주로 대역폭이 결정하며, M1부터 M3까지 Ultra는 모두 약 800GB/s임. 대부분에게 투자 대비 효율이 가장 좋은 선택은 RAM이 충분한 가장 저렴한 중고 Ultra라고 봄.
나도 eBay 알림을 걸어 중고 M2 Ultra를 샀고 만족스러운 효율을 얻고 있음. 적어도 내 용도에서 비슷한 성능을 얻으려고 15,000달러를 쓰는 것보다는 훨씬 나음.
M1부터 M3까지는 프롬프트 처리에서 연산 성능이 병목이었다고 봄. 이 기사의 M3와 M5 간 큰 격차도 메모리 대역폭만으로는 설명되지 않음. 생성 속도만 따로 보면 맞는 얘기임.
이번 제품은 M5 Max 2개를 결합한 구성이므로 대역폭이 약 1.2TB/s임.
이 기기 얘기만 나오면 늘 로컬 AI가 따라오는 게 재미있음. 로컬 모델 애호가라면 이해하지만, 경제성이 맞는지는 모르겠음.
나는 업무용으로 같은 제품을 주문했는데, iOS 시뮬레이터와 Xcode 빌드 프로세스를 많이 띄워 로컬 에이전트를 더 많이 동시에 실행하려는 목적임.
총비용이 0달러라니, 하드웨어값은 얼마인지 궁금함.
전기요금만으로도 구독료보다 더 나올 수 있다고 봄.
다른 댓글에서는 약 15,000달러로 추산하니, 적어도 0달러는 아님.
MLX 양자화 모델을 비교할 때는 품질 벤치마크 수치도 반드시 공개해야 함. 원본 모델과 같은 품질이라고 받아들여서는 안 됨. MLX는 비교적 단순한 양자화 방식을 사용하므로, 양자화 인지 학습(QAT) 없이 낮은 비트 수로 줄이면 llama.cpp 쪽보다 품질이 떨어짐.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기