엄청난 속도가 필요한가요? 네 ⚡️
요약
DeepSeep v4.1 Flash를 4x DGX Sparks 환경에 적용한 테스트 결과를 공유합니다. Prose 디코드는 단일 스트림에서 87 tok/s, 4개 스트림에서는 163.6 tok/s의 속도를 보여주며, 코드 디코드는 4개 스트림에서 246.8 tok/s에 달하는 높은 성능을 기록했습니다.
핵심 포인트
- DeepSeep v4.1 Flash를 4x DGX Sparks 환경에서 테스트함.
- Prose 디코딩은 4개 스트림에서 163.6 tok/s의 속도를 보임.
- 코드 디코딩은 4개 스트림에서 최대 246.8 tok/s를 기록함.
- M5 Ultra 512 GB와 같은 장비가 이 성능을 능가할 수 있을지 기대됨.
엄청난 속도가 필요한가요? 네 ⚡️
DeepSeep v4.1 Flash를 4x DGX Sparks에 적용하니... 황당합니다 🤯
디코드 개선 사항
- Prose 디코드는 이제 단일 스트림에서 87 tok/s입니다.
- 4개 스트림에서는 163.6 tok/s입니다.
- 코드 디코드는 124.8 tok/s입니다.
- 4개 스트림에서는 246.8 tok/s입니다.
프리필(Prefill) 수치?
16k-128k에서 5800-5925 tok/s
256k에서 5394 tok/s
마치 빠른 API 같습니다! 만약 4x DGX Sparks를 가지고 있다면, 가능한 한 빨리 이것을 시도해 봐야 합니다. M5 Ultra 512 GB가 이것을 능가할 수 있을지 궁금하네요.
현재 개선 사항은 TP=4에만 해당하며 TP=3에는 영향을 주지 않습니다. @majewskizby님께 멋진 PR을 제공해 주셔서 감사합니다!
여기에서 받으세요:
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: 오픈소스 LLM의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기