
GLM 5.3 Flash NVFP4 모델에서 DFlash2 및 NextN 기반 추측 디코딩 성능 비교
요약
GLM 5.3 Flash NVFP4 모델을 활용하여 DFlash2와 NextN 기반의 추측 디코딩(speculative decoding) 성능을 비교 분석했습니다. 그 결과, NextN이 테스트된 모든 병렬성 수준에서 DFlash2를 크게 능가하는 우수한 성능을 보여주었습니다.
핵심 포인트
- NextN은 DFlash2 대비 전반적인 추측 디코딩 성능이 뛰어남.
- N=16 조건에서 NextN은 1K context당 197.1 tok/s를 기록하며 DFlash2(108.7 tok/s)보다 월등히 높음.
- NextN은 긴 컨텍스트(4K)에서도 높은 성능을 유지하여 우수성을 입증함.
안녕하세요, 친구들! GLM 5.3 Flash NVFP4 모델을 사용하여, 4× @NVIDIAAI DGX Spark 클러스터로 이번에는 DFlash2와 NextN 기반의 speculative decoding 성능을 비교했습니다. NextN 측에서는 EAGLE을 통해 speculative decoding을 실행했습니다. 두 서버 프로필 모두 TP4, C16/128K, high effort, BF16 KV cache 및 요청당 1,024 출력 토큰으로 서비스되었습니다. 제가 측정한 값은 prefill을 포함한 평균 총 tok/s 결과입니다.
결과가 매우 좋습니다! NextN speculative decoding은 테스트된 모든 병렬성 수준에서 DFlash2 기준선을 명확하게 뛰어넘습니다. 특히 N=16 수준에서 DFlash2가 1K context로 108.7 tok/s를 생성하는 동안, NextN은 1K context로 197.1 tok/s 값에 도달했습니다. 게다가 NextN은 4K context에서도 158.7 tok/s를 보여 DFlash2의 짧은 컨텍스트 성능을 여유롭게 넘어섰습니다. 🔥
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기