
Zeus (Xiaomi 12 Pro, 12GB RAM)에서 Qwen 3.6 35B MoE (Q4_K_M) 실행하기
요약
BigMoeOnEdge 프로젝트를 통해 12GB RAM을 탑재한 Xiaomi 12 Pro에서 Qwen 3.6 35B MoE 모델을 로컬로 실행하는 데 성공했습니다. RAM 제약으로 컨텍스트 길이는 제한적이지만, 엣지 디바이스에서 대규모 MoE 모델을 구동할 수 있음을 입증했습니다.
핵심 포인트
- 12GB RAM 환경에서 35B MoE 모델 구동 성공
- BigMoeOnEdge 프로젝트를 활용한 최적화
- RAM 제약으로 인해 최대 컨텍스트 8192 토큰 제한
- 초당 약 2.428 토큰의 생성 속도 기록
이 멋진 분에게 감사를 표합니다 - https://www.reddit.com/r/LLM/s/IDUyU3v9ap 그의 프로젝트인 BigMoeOnEdge (https://github.com/Helldez/BigMoeOnEdge) 덕분에, 단 12GB의 RAM만으로 35B MoE 모델을 성공적으로 실행할 수 있었습니다! 제 설정은 제가 "Zeus"라고 부르는 개조된 Xiaomi 12 Pro (12GB RAM)입니다. https://www.reddit.com/r/LocalLLaMA/s/5zBUl15jd6 물론 병목 현상은 있습니다. RAM 제약으로 인해 현재 최대 컨텍스트 (context)는 8192 토큰으로 제한됩니다. 하지만 이 정도 크기의 모델이 엣지 디바이스 (edge device)에서 로컬로 실행되는 것을 보는 것은 정말 놀라운 일입니다. 아직 이미지-텍스트 (Image-to-Text, vision) 기능은 테스트하지 않았지만, 다음 단계로 이를 작동시키기를 정말 기대하고 있습니다. 영상을 확인해 보세요! 완전히 편집되지 않은 실시간 녹화 영상이므로 실제 가공되지 않은 생성 속도를 확인할 수 있습니다. 또한, 다음은 텍스트로 된 통계 데이터입니다:
생성 (generation): 107 tokens, 0.412 s/token (2.428 tok/s)
연산 (compute): 88.1% CPU 점유율 (4개 스레드에서 토큰당 1.4508 cpu-s), 토큰당 51.93 major faults
프리필 (prefill): 24 tokens, 5.499 s (4.4 tok/s) | 모델 로드 (model load) 14.421 s | TTFT 19.920 s
moe-stream: read 14589.9 MiB (136.35 MiB/token), decode 0.412 s/token (연산 0.314 + 캐시 관리 (cache mgmt) 0.014 + flash I/O 0.382 s/token, 357 MiB/s)
moe-cache: 70.8% hit, resident 2998.5 MiB
moe-overlap: stall 0.084 s/token (flash reads가 FFN 연산과 중첩됨)
/u/Aromatic_Ad_7557 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기