M3Max 64GB Mac에서 oMLX를 사용하여 Qwen3.8-Flash-Next-oQ4e-mtp 실행 후기
요약
M3Max 64GB Mac에서 oMLX를 활용하여 Qwen3.8-Flash-Next-oQ4e-mtp 모델을 성공적으로 구동한 후기입니다. 100GB급 모델을 GPU에 할당하여 최대 130k 컨텍스트 윈도우까지 처리할 수 있음을 보여주었습니다.
핵심 포인트
- M3Max Mac에서 oMLX를 통해 대규모 LLM 구동 성공
- 100GB 모델을 GPU에 할당하여 실행 가능
- 최대 130k 컨텍스트 윈도우 처리 능력 확인
- 캐시 효율성 90.9%, 프롬프트 처리 속도 140 tok/s 기록
정말 놀랍습니다! M3Max 64GB로 Qwen3.8-Flash-Next-oQ4e-mtp를 oMLX로 구동할 수 있었습니다! 불과 몇 주 전만 해도 작동시키지 못했습니다. 그냥 재미로 최신 커밋을 시도해 봤는데, 되었습니다! 100GB 모델을 GPU에 58GB 할당하여 실행하는 것이 마치 마법 같습니다! 최대 130k 컨텍스트 윈도우까지 구동할 수 있습니다! PI와 짧은 세션을 실행한 후의 통계는 다음과 같습니다. 요청: 13, 총 프리필 토큰: 321,309, 캐시된 토큰: 292,209, 캐시 효율성: 90.9%, 프롬프트 처리 (캐시 제외): 140.0 tok/s, 토큰 생성: 15.8 tok/s oMLX에서 사용한 설정은 다음과 같습니다: 메모리 가드: 공격적(Aggressive), 핫 캐시 제한 (In-Memory Cache): 2GB, 라이트닝 MTP: 켜기(on), MoE 전문가 오프로드: 켜기(on), 상주 전문가(RESIDENT EXPERTS): 50% 제출자 /u/chibop1 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기