DeepSeek V4 Flash 0731 (Q4)가 단일 RTX PRO 6000에서 프리필(prefill) 1,328 tok/s 및
요약
Krasis를 활용하여 단일 RTX PRO 6000 GPU에서 DeepSeek-V4-Flash-0731 모델의 프리필(prefill) 속도를 대폭 향상시킨 성능 측정 결과입니다. VRAM 제한을 극복하기 위해 전문가(experts)를 스트리밍하고 관리하는 최적화 기법을 적용했습니다.
핵심 포인트
- RTX PRO 6000에서 최대 1,328 tok/s의 프리필 속도 달성
- VRAM 효율을 위해 전문가(experts)를 스트리밍하고 관리하는 방식 채택
- 긴 컨텍스트에서도 안정적인 디코드 속도 유지
- 코딩 에이전트와 같이 긴 프롬프트가 필요한 작업에 유용
저는 Krasis에서 DeepSeek-V4-Flash-0731의 속도를 높이는 작업을 진행해 왔으며, 이제 단일 RTX PRO 6000 96GB에서 긴 프롬프트의 프리필(prefill) 속도를 상당히 끌어올렸습니다. 이것은 INT4 전문가(experts)를 사용하는 타이밍 제한이 없는 내부 Krasis 결과입니다. 이는 HTTP 왕복(round-trip) 속도가 아닙니다:
프롬프트 크기 | 프롬프트 처리(Prompt Processing)
약 1K | 152 tok/s
2,043 | 321 tok/s
8,623 | 906 tok/s
23,348 | 1,328 tok/s
62,403 | 1,204 tok/s
약 1K 프롬프트 이후의 디코드(decode) 속도는 50, 100, 250 토큰을 생성할 때 각각 29.4, 28.2, 28.5 tok/s였습니다. 62K 프롬프트 이후에는 각 새로운 토큰이 주의(attend)해야 할 컨텍스트가 훨씬 더 많아짐에 따라 19.4 tok/s를 기록했습니다.
Krasis는 전체 GPU 프리필(prefill)을 위해 제한된 VRAM을 통해 모델을 스트리밍한 다음, 디코드(decode) 중에 가장 빈번하게 사용되는 전문가(experts)를 VRAM에 유지하고 나머지는 시스템 RAM에서 제공합니다. 이 구성에서는 11,008개의 라우팅된 전문가(routed experts) 중 6,440개를 상주(resident) 상태로 유지했습니다. 전문가 가지치기(expert pruning)는 발생하지 않았습니다.
Krasis v1.0.19는 여기서 다운로드할 수 있습니다: https://github.com/brontoguana/krasis
아직 최적화할 부분이 더 남아 있으며, 특히 프리필(prefill) 속도는 더 높아질 수 있다고 생각하지만, 현재 속도도 매 요청마다 많은 컨텍스트를 보내는 경향이 있는 코딩 에이전트(coding agents)에게는 이미 유용할 것이라고 생각합니다. 비슷한 하드웨어에서 시도해 보시는 분이 있다면 결과가 어떤지 알려주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기