Deepseek v4 flash - prefill/pp에서 100-150 t/s 더 빠른 속도
요약
Deepseek v4 flash 모델의 prefill 및 pipeline parallel 속도를 개선하기 위한 CUDA 버전 최적화 방법을 다룹니다. CUDA 13.2 이상의 버전에서 발생하는 DeviceTopK 이슈로 인한 성능 저하를 해결하기 위해 CUDA 13.1로의 다운그레이드를 권장합니다.
핵심 포인트
- CUDA 13.2 이상 버전에서 DeviceTopK 사용으로 인한 PP 속도 저하 발생
- 성능 최적화를 위해 CUDA 13.1 버전으로 다운그레이드 권장
- 또는 CUDA 13.3과 호환되는 특정 fork 버전을 사용하여 문제 해결 가능
- DS4 Flash 모델이 행렬 곱셈 외의 작업에서 병목 현상을 겪고 있음
여기에는 두 가지 선택지가 있습니다 (선호하는 순서대로):
- CUDA 버전을 13.3에서 13.1로 다운그레이드하십시오 (버그 때문에 13.2는 건너뛰세요) <- 이 방법을 권장합니다 (이 점을 지적해 준 u/fairydreaming에게 감사드립니다)
- CUDA 13.3과 호환되는 이 검증된 fork를 사용하십시오: https://github.com/vektorprime/working_ds4_speed
저는 어제 nvidia profiler와 몇 가지 LLM의 도움을 받아 이 문제를 해결하고 있었습니다 ( https://www.reddit.com/r/LocalLLaMA/comments/1vcs7bl/ds4_flash_full_model_in_offload_600_ts_pp_and/ )
1번 항목에 대한 추가 정보는 다음과 같습니다 (fairydreaming의 인용문):
"CUDA를 다운그레이드하고 다시 컴파일하십시오. 13.2 버전부터는 top-k를 위해 argsort 대신 DeviceTopK가 사용되는데, 이것이 PP(pipeline parallel) 속도를 엉망으로 만듭니다."
요약하자면, DS4 Flash는 행렬 곱셈 (matrix multiplication) 이외의 작업에 많은 시간을 소비하고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기