MLX-Serve 26.10.1 출시: 전반적인 속도 향상
요약
MLX-Serve 26.10.1 버전이 출시되어 전반적인 속도 향상을 제공합니다. Qwen3.8 27B 모델은 M5 Ultra, M4 Max 등 다양한 Apple Silicon 환경에서 성능 개선을 보였으며, Gemma 4와 같은 여러 모델에 걸쳐 최적화가 이루어졌습니다.
핵심 포인트
- M5 Ultra/M4 Max 등 Apple Silicon 환경에서 전반적인 속도 향상 확인
- GGUF 모델이 자체 MLX 엔진으로 실행되어 안정성 및 성능 개선 (실험적)
- Qwen-Image 2.1을 통해 지침 기반 사진 편집 기능 추가
- 총 18개 지원 모델에 걸쳐 최적화가 이루어짐
MLX-Serve 26.10.1이 출시되었습니다: 모든 면에서 속도가 빨라졌습니다.
정확히 더 빠릅니다. Qwen3.8 27B는 drafter를 통해 M5 Ultra에서 +66%, M4 Max에서 +28%, M1 Pro에서 +37%의 성능을 보여줍니다.
Qwen Flash Next:
M4 Max에서 디코드(decode) 시 +11%,
M5 Ultra에서 프리필(prefill) 시 +51% (최대 ~5400 PP!!!!)
Gemma 4, Qwen, LFM2.5, Spark, Bonsai 2 모두 더 빨라졌으며, 26.9.6과 동일한 바이트를 출력합니다 (총 18개 모델에 걸쳐).
새로운 기능:
- GGUF 모델이 llama.cpp 폴백(fallback) 대신 Zig와 Metal로 작성된 자체 MLX 엔진에서 실행됩니다. (실험적)
- 🍣 Sushi-format Flash Next 패키지가 직접 실행됩니다.
- Qwen-Image 2.1은 지침을 통해 사진을 편집합니다.
- 모든 지원 모델에 대해 기본적으로 Drafting 기능이 활성화됩니다.
테스트하고 수정해 준 모든 분들께 깊이 감사드립니다: @STRML_, @sbusso, @wutang_superfan, lborloz, LXD-8 @alinselea zeeshanhaque21 @Lojza3D, h9q2cyxvgm-ui @kennethrdegraff, @CowboyCoderHQ, codysk, @Beamsters1, @CerebralCoding_, @AjAbsaki 등. 감사합니다! 만약 제 이름을 포함하지 못했다면 댓글을 남겨주세요. 가시성을 위해 말씀드립니다. 저는 주로 GH 핸들로 사람들을 알고 있습니다.
@ashxhart와 @Spangler3000에게 특별히 감사드립니다!
5대의 장비에서 벤치마크 및 테스트를 진행했습니다: https://t.co/BDeBKRq6Kd
GH 릴리스 다운로드 + 변경 로그:
웹사이트: https://t.co/qxuPXH75o1
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: 오픈소스 LLM의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기