Apple M5가 아직 Matmul 코어를 완전히 활용하지 못하고 있는 이유
요약
Apple M5 실리콘의 INT8 활성화 함수 지원 기능을 활용하여 Gemma4 모델의 추론 속도를 개선한 사례를 다룹니다. 작성자가 직접 구축한 w8a8 커널을 통해 프리필(prefill) 성능을 기존 대비 약 1.4배 향상시켰습니다.
핵심 포인트
- Apple M5는 INT8 활성화 함수(w4a8)를 하드웨어적으로 지원함
- 현재 추론 백엔드들이 M5의 INT8 지원 기능을 충분히 활용하지 못하고 있음
- w8a8 커널 구현을 통해 Gemma4 프리필 속도를 1.4배 향상시킴
- M5 MacBook Air에서 토큰 처리 속도를 2,193 tps에서 3,029 tps로 개선
현재 MLX(및 Mac용 Llama.cpp)는 모든 곳에서 16bit 활성화 함수 (activations)를 실행합니다. 그럼에도 불구하고, M5 세대 실리콘은 실제로 INT8 활성화 함수 (activations)를 지원합니다. 실제로 w4a8 d_type을 허용합니다. 단지 아직 어떤 추론 백엔드 (inference backends)도 이를 사용하지 않고 있을 뿐입니다. 저는 몇 가지 w8a8 커널 (kernels)을 구축했고, Gemma4 프리필 (prefill) 작업에서 1.4배의 속도 향상을 달성했습니다. 제 M5 MacBook Air에서 이는 E2B의 베이스라인 프리필 (prefill) 속도를 130,173개 토큰 입력 기준 기존 2,193 tps에서 3,029 tps로 끌어올렸습니다. *작은 컨텍스트 길이 (context lengths)에서는 훨씬 더 빠릅니다; /u/maddie-lovelace 가 제출한 거의 10k tps에 근접합니다 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기