
100G 스위치를 사용한 4xGB10 환경에서의 GLM 5.2 구동: 330k 컨텍스트, ~25 t/s 생성, ~650 t/s 프리필
요약
100G 스위치와 GB10 하드웨어를 활용하여 GLM 5.2 모델을 330k 컨텍스트 환경에서 구동하는 최적화 구성법을 소개합니다. TP4와 DCP2 설정을 통해 높은 프리필 및 디코딩 속도를 확보하는 구체적인 벤치마크와 하드웨어 비용을 공유합니다.
핵심 포인트
- TP4+DCP2 구성을 통해 330k 컨텍스트에서 약 25 t/s의 생성 속도 달성
- 프롬프트 길이에 따라 프리필 속도가 최대 1000 t/s까지 증가 가능
- 모델을 10% 프루닝할 경우 코딩 능력은 보존되나 지시 이행 능력은 일부 저하됨
- 약 16,000달러 규모의 하드웨어 구성으로 Mac Studio 대비 우수한 성능 제공
~360k KV 풀을 위한 TP4+DCP2 구성입니다. 프롬프트가 길어지면 프리필 (Prefill) 속도가 900-1000 t/s까지 증가합니다. DCP4를 사용하여 660k까지 구동할 수도 있지만, 이 경우 프리필 속도가 ~400까지 떨어집니다. DCP를 낮추면 프리필이 ~750까지 올라갑니다. 저는 Z.ai의 권장 사항과 달리 5개의 초안 토큰 (drafted tokens) 대신 4개를 사용하고 있습니다. 디코딩 (Decode) 속도는 산문 (prose)의 형태에 크게 의존합니다. 일반적인 사고 (Thinking) 작업은 ~20 tok/s, 코딩 (Code)은 25-35 tok/s가 나옵니다. Pi에서의 일반적인 턴 (turns)은 ~24 tok/s 정도입니다. 만약 1M 이상의 컨텍스트 (ctx)나 더 높은 동시성 (concurrency)이 필요하다면, 모델을 5-10% 정도 프루닝 (Pruning) 하면 가능할 것입니다. 일상적인 사용 환경에서 10%의 데이터 프리 프루닝 (data-free prune)은 모델의 코딩 능력을 보존하는 것으로 보이지만, 세부적인 수준에서의 지시 이행 능력 (adherence to instructions)은 일부 상실됩니다.
저의 하드웨어 비용은 약 16k 달러였습니다. 현재 시점에서는 아마 1-2k 달러 정도 더 비쌀 것입니다.
- 2x Acer GN100 (각 3799달러)
- 2x Asus GX10 (각 3499달러)
- 1x Mikrotik CRS504 ($650)
- 4x NADDOD QSFP56 DAC 케이블 (각 $66, CRS504의 경우 QSFP28로 교체 가능)
일반적인 관점에서 빠르거나 경제적으로 현명한 선택은 아니지만, 실행 가능한 구성입니다. 그리고 GLM을 로컬에서 구동하고 싶다면, 아마도 디코딩 속도가 12 tok/s (연산 제한 발생) 및 프리필 속도가 50 tok/s 정도일 512GB Mac Studio보다 이 방식이 더 나은 선택이라고 생각합니다. 아래는 llama-benchy를 사용한 벤치마크 결과이며, NL 산문 (NL prose) 기준이므로 일반적인 에이전트 워크플로우 (agentic workflow)보다는 느립니다.
| Depth | Prefill (pp2048) | Decode (tg512) |
|---|---|---|
| 0 | 597.9 ± 6.4 | 21.7 ± 0.6 |
| 8k | 602.6 ± 0.8 | 21.5 ± 0.8 |
| 32k | 597.7 ± 0.2 | 21.8 ± 0.6 |
Pi에서의 짧은 턴 결과입니다.
패치 및 레시피: https://github.com/CosmicRaisins/glm-5.2-gb10
/u/SpaceRaisins가 r/LocalLLaMA에 게시함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기