
현재 Mac에서 DS4 Flash를 실행하는 가장 좋은 방법 (192GB+ VRAM)
요약
Mac M3 Ultra 환경에서 DeepSeek-V4-Flash 모델을 최적화하여 실행하는 방법을 소개합니다. MXFP4 양자화 버전을 활용하여 MLX 프레임워크 기반으로 매우 빠른 토큰 생성 속도를 구현했습니다.
핵심 포인트
- M3 Ultra Mac에서 DS4 Flash 모델의 최적 실행 방법 공유
- MXFP4 양자화 버전을 통한 높은 효율성 확보
- dspark/mtp 지원으로 초당 최대 43토큰의 빠른 속도 달성
- MLX 프레임워크를 활용한 Mac 전용 최적화
이 양자화 (quant) 버전을 발견해서 공유하고자 합니다. 제 Mac (m3 ultra)에서 실행하기 위해 지금까지 찾아낸 것 중 가장 좋았기 때문입니다. dspark/mtp 지원이 되어 제가 시도해 본 그 어떤 것보다 빠르게 작동합니다. 이 코드의 tok/s (초당 토큰 수)는 생성이 진행됨에 따라 실제로 증가했으며, 34tok/s로 시작하여 43tok/s로 끝났습니다. 캐시된 토큰 (cached tokens)은 기본 채팅 프롬프트였고, 13k는 제가 보낸 쿼리 (query)였습니다. https://huggingface.co/Vontra/DeepSeek-V4-Flash-0731-MXFP4-MLX /u/Professional-Bear857 님이 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기