M5 Air 32gb에서 DeepSeek v4 Flash 0731 4bit 구동 시 ~50tps prefill, ~1tps decode 달성
요약
M5 Air 32GB 환경에서 DeepSeek v4 Flash 모델을 구동하며 prefill 속도를 최적화하는 실험 결과입니다. Streamed experts 기법과 자체적인 트릭을 통해 50tps 이상의 prefill 속도를 달성했습니다.
핵심 포인트
- M5 Air 32GB에서 DeepSeek v4 Flash 4bit 구동 성공
- Streamed experts 기법을 통한 prefill 속도 최적화
- Prefill 시 적은 수의 experts 사용 시에도 KV cache 활용 가능 확인
- 실험을 통해 prefill 속도 약 50tps, decode 약 1tps 달성
현재 이 서브레딧(sub)에서 떠돌고 있는 streamed experts 기법과 제가 직접 고안한 몇 가지 트릭을 사용하여 prefill 속도를 조금 더 높이기 위한 실험을 진행하고 있습니다. 지금까지 꽤 즐거운 경험이었습니다. 300b 모델을 Air에서 구동하는 것 자체가 우스꽝스러우면서도 만족스러운 일이니까요. 저장소(Repo)가 공유할 수 있을 만큼 깔끔한 상태는 아닙니다. 아직 원클릭 서비스(one-click serve)가 가능한 수준은 전혀 아닙니다. 특히 제가 구현한 초보적인 수준의 streamed experts 방식이 실제 KV cache 생성이 시작되기 전, 턴 사이에 약 30초 정도의 지연(tax)을 발생시켰기 때문에 공유하기가 망설여졌습니다. 지금은 개선되어 마지막 벤치마크에서는 약 3초 정도로 줄었습니다. 또한 그 사이에 발견한 재미있는 사실이 하나 있는데, prefill 시점에 기본값보다 적은 수의 experts를 실행하더라도 KV cache가 여전히 완벽하게 사용 가능하다는 점입니다. 보수적으로 실행하면 각 위치에서 95% 이상의 동일한 top logits를 얻을 수 있습니다. 더 공격적으로 실행하면 그 성능을 잃게 되지만, 항상 치명적인 것은 아닌 것 같습니다. 예를 들어, needle in haystack 성능은 여전히 유지될 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기