2x GH200을 위한 최적화된 DSv4-Flash: SGLang에서 10,000 tok/s PP 및 >300 tok/s TG 달성
요약
GH200 듀얼 시스템 환경에서 DSv4-Flash 모델의 추론 성능을 극대화하는 최적화 방법을 소개합니다. vLLM과 SGLang을 활용하여 매우 긴 컨텍스트에서도 높은 Prefill 및 Decode 속도를 달성하는 구체적인 설정과 트릭을 다룹니다.
핵심 포인트
- GH200 환경에서 vLLM 소스 빌드 및 특정 캐시 레이아웃 패치 적용
- 비동기 스케줄링 비활성화 및 DSpark 설정을 통한 성능 최적화
- SGLang 사용 시 ARM64 빌드 및 버그 수정을 통해 높은 디코드 속도 달성
- 1M 컨텍스트 구현 시에도 효율적인 HBM 메모리 관리 및 속도 유지
제 글에는 사용할 수 있는 몇 가지 PR(Pull Request)과 매우 긴 컨텍스트(context)에서 PP(Prefill) 속도를 높이는 좋은 트릭이 포함되어 있습니다. 도움이 되길 바랍니다! 요약하자면: 이 듀얼 GH200 박스에서 vLLM v0.26.0을 소스에서 빌드하고, 병합된 DSV4 캐시 레이아웃 패치(PR #48993)를 추가하며, 비동기 스케줄링(async scheduling)을 비활성화한 뒤, DSpark를 6개의 예측 토큰(predicted tokens)에서 실행하면 다음과 같은 성능을 얻을 수 있습니다: 약 276 decode tok/s 및 192 GB의 HBM에서 1M 컨텍스트 구현. SGLang의 경우, ARM64에서 빌드되고 DSpark 로더 버그가 수정되면 모든 디코드(decode) 워크로드에서 더 빠르며 약 317.0 tok/s에 도달합니다. /u/Reddactor에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기