BaseRT: Apple M5 Neural Accelerators를 통한 최고 수준의 LLM 추론 성능 향상
요약
Apple M5의 전용 Neural Accelerator를 활용하여 LLM 추론 성능을 극대화하는 Metal 기반 런타임 BaseRT를 소개합니다. BaseRT는 Metal 4 텐서 API를 통해 행렬 연산을 가속하며, llama.cpp 및 MLX 대비 압도적인 프롬프트 처리량을 제공합니다.
핵심 포인트
- Apple M5의 온다이 매트릭스 유닛을 활용한 BaseRT 런타임 공개
- llama.cpp 대비 최대 6.4배, MLX 대비 3.9배 높은 프롬프트 처리량 달성
- MoE 모델 및 행렬 곱셈 연산에서 탁월한 성능 향상 입증
- Metal 4 텐서 코어를 활용한 온디바이스 LLM 추론의 새로운 한계 설정
Apple의 M5 세대는 모든 코어가 전용 Neural Accelerator를 탑재한 재설계된 GPU 아키텍처를 도입했습니다. 이 Neural Accelerator는 Metal 4 텐서 API를 통해 노출되는 온다이(on-die) 매트릭스 유닛입니다. 우리는 Apple Silicon 상의 대규모 언어 모델(LLM)을 위한 네이티브 Metal 추론 런타임인 BaseRT를 통해, 이러한 유닛을 활용함으로써 Apple 하드웨어에서의 추론 처리량(throughput)을 llama.cpp 및 MLX보다 실질적으로 훨씬 높게 끌어올릴 수 있음을 보여줍니다. BaseRT의 프레임워크 프리(framework-free) 설계를 기반으로, 우리는 직접 작성한 Metal 4 텐서 코어 커널 제품군(dense 및 mixture-of-experts GEMM, flash-attention prefill 커널 포함)을 추가했습니다. 이 커널들은 추론의 연산 집약적(compute-bound)인 행렬 곱셈을 M5 Neural Accelerators로 라우팅하는 동시에, 메모리 집약적(memory-bound)인 디코딩(decode) 경로는 기존의 특화된 커널에 남겨둡니다. Apple M5 Pro에서 1B 미만부터 35B 파라미터에 이르는 Qwen3, Qwen3.5/3.6, Llama 3.2, Gemma 4 제품군을 아우르는 15가지 모델 구성에 대해 테스트한 결과, BaseRT는 llama.cpp보다 최대 $6.4 imes$, MLX보다 최대 $3.9 imes$ 높은 프롬프트 처리(prompt-processing) 처리량을 제공했습니다. 특히 행렬 곱셈이 지배적인 mixture-of-experts 모델에서 가장 큰 격차를 보였으며, 디코딩(decode) 성능에서도 llama.cpp 대비 최대 $1.75 imes$, MLX 대비 최대 $1.33 imes$ 앞서는 우위를 유지했습니다. 이러한 결과는 온디바이스(on-device) LLM 추론의 새로운 성능 한계를 설정하며, M5의 텐서 코어가 Apple Silicon에서 프롬프트 처리를 위한 결정적인 레버임을 보여줍니다. BaseRT는 https://github.com/basecompute/baseRT 에서 공개적으로 사용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기