
GLM-5.3-Flash NVFP4 + DFlash2 통합을 위한 4x NVIDIA DGX Spark 기반 TP4 배포 패키지
요약
본 글은 GLM-5.3-Flash NVFP4와 DFlash2 통합을 위한 4x NVIDIA DGX Spark 기반 TP4 배포 패키지를 공개합니다. 이 패키지에는 모델, 런타임 버전, 필요한 패치, 시작/복구 작업, 정확성 검사 및 벤치마크 도구가 모두 포함되어 있습니다. 이 설정을 통해 단일 요청당 평균 디코드 속도는 33.37 token/s, 네 개의 동시 요청에 대한 총 디코드 속도는 70.43 token/s를 달성했습니다.
핵심 포인트
- GLM-5.3-Flash와 DFlash2 통합을 위한 재현 가능한 배포 패키지 제공
- NVIDIA DGX Spark 환경에서 TP4 분산 추론 구현 및 테스트 완료
- 단일 요청 33.37 token/s, 동시 요청 70.43 token/s의 성능 측정 결과 제시
- 214개 Python 및 7개 shell 테스트를 통과한 안정적인 시스템 구축
여러분 안녕하세요, GLM-5.3-Flash NVFP4 + DFlash2 통합을 위해, 4x NVIDIA DGX Spark 상에서 TP4 배포를 재현 가능한 패키지로 만들었습니다. 제가 준비한 repo에는; 고정된 모델 및 runtime 버전, 필요한 patch, 모델/이미지 준비, 네 개의 노드에 걸친 시작 및 복구 작업, 정확성 검사, 그리고 benchmark 도구들이 모두 모여 있습니다. 🎉
제가 사용한 프로필은 다음과 같습니다:
- 131.072 token context
- 4 동시 요청
- DFlash2 block size 8
- Draft attention을 위한 FA4
- BF16 KV cache 및 폐쇄형 radix cache
이 매개변수들로 추론(inference)했을 때 얻은 결과는 다음과 같습니다:
- 단일 요청당 중앙값 디코드 속도: 33.37 token/s
- 네 개의 동시 요청에 대한 중앙값 총 디코드 속도: 70.43 token/s
- 120K token needle retrieval: 세 가지 다른 깊이에서 성공적인 결과
측정 범위, 알려진 제한 사항 및 재현 단계를 repo에 문서화했습니다. 마지막 소프트웨어 검사에서도 214 Python 테스트, 7 shell 테스트 그룹, 그리고 고정된 SGLang 리소스를 사용한 명령어/patch 호환성 확인을 통과했습니다. DGX Spark 상에서 분산 추론(distributed inference) 및 speculative decoding으로 작업하는 분들께 유용하기를 바랍니다. 좋은 사용 되시길 바랍니다. 🎉
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기