듀얼 DGX Spark 사용자용: GLM 5.3 flash가 50% 이상의 성능 향상을 달성하다
요약
작성자는 GLM 5.3 모델의 최신 버전을 테스트한 결과를 공유하며, 이 버전이 디코드 속도에서 50~90%의 성능 향상을 보여 매우 인상적이라고 평가했습니다. 특히 DeepSeek v4.0 flash보다 더 빠르고 지능적인 성능을 보였으며, 기술 코딩 및 비전 분야 전반에 걸쳐 Claude Opus 4.8 수준의 성능을 달성했다고 언급합니다.
핵심 포인트
- GLM 5.3 최신 버전이 디코드 속도에서 대폭 개선됨 (50~90% 향상).
- DeepSeek v4.0 flash보다 빠르고 지능적이며, Claude Opus 4.8 수준의 성능을 보임.
- 프리필 속도는 다소 떨어졌으나, 전반적인 성능 향상이 이를 상쇄함.
- 기술 코딩, DevOps/Sysadmin, 비전 등 다양한 분야에서 우수한 성능을 입증함.
지난 몇 달 동안 저는 DeepSeek v4.0 flash (NVFP4)를 사용했습니다. 처음에는 0731을, 그 다음에는 무료 개선 사항이었기 때문에 visionexp를 사용했습니다. 저는 약 65 tps의 디코드(decode) 속도와 거의 2k의 프리필(prefill) 속도를 얻었으며, 총합 약 200 tps의 누적 디코드를 위해 45개의 에이전트를 병렬로 실행했습니다. 이 때문에 저는 GLM 5.3으로 전환하는 것을 꺼렸는데, 그 이유는 디코드와 프리필을 절반 수준으로 낮추고, 여러 에이전트와의 확장성이 좋지 않았으며, 많은 사람들이 불평했던 반복 버그(repetition bug)가 있었기 때문입니다. 그러다가 며칠 전, 이 레시피의 최신 버전이 공개되었는데; 디코드에서 5090%의 개선을 보였습니다. 그래서 저는 과감하게 시도해 봤고, 와우, 정말 감명받았습니다. 이는 새로운 DeepSeek v4.1 flash(듀얼 DGX Sparks에서 실행되지 않음)보다 더 지능적이며, 디코드 속도 면에서는 DeepSeek v4.0 flash보다 더 빠릅니다. 프리필 속도는 약간 떨어졌지만, 저는 그 대가로 기꺼이 감수할 정도입니다. Test visionexp-final (recorded) glm53-low Δ B1 count-to-300 92.5 95.9 +4% B1 bulk SQL INSERT 88.3 97.2 +10% B2 chat 38.7 42.5 +10% B2 count 92.8 96.0 +3% B2 code 63.5 69.3 +9% B2 prose 32.8 37.1 +13% B2 tool 79.8 85.1 +7% B2 battery mean 61.5 66.0 +7% B2 accepted tok/step 3.26 of 6 (54%) 3.55 of 8 (44%) see note B3 prefill @1.5K 1738 1376 -21% B4 prefill @32K 1902 1576 -17% B4 prefill @128K 1758 1578 -10% B4 decode @32K 41.1 44.2 +7% B4 decode @128K 49.5 47.1 -5% B5 c1 aggregate 91.7 90.1 -2% B5 c2 aggregate 45.4 51.4 +13% B5 c4 aggregate 63.4 58.6 -7% B5 c6 aggregate 79.1 77.5 -2% B7 soak (40 min at c4) 522 req, 0 err, 87.4 agg 503 req, 0 err, 0 soft-empty, 83.6 agg −4% B8 byte-stable probes 8/8 6/8 worse B8 garble gate 30/30 clean 30/30 clean = B8 non-Latin / U+FFFD not measured 3/3 clean, 0 U+FFFD new gate KV pool 1,988,929 tok @ gmu 0.85 560,362 tok (6 GiB/rank pin) −72% NRestarts through the pass 0 0 = 제가 며칠 동안 테스트해 본 결과, 기술 코딩, devops/sysadmin 및 비전(식물 인식) 분야 모두에서 기대했던 것보다 더 좋습니다. 기본적으로 Claude Opus 4.8 수준입니다.
물론 더 많은 생각을 해야 하므로 이전보다 느리지만, 티켓에서 몇 시간 동안 걱정 없이 계속 작동시키기에는 충분히 좋습니다. 업그레이드하지 않을 이유를 모르겠네요. 그러니 한번 시도해보고 즐겨보세요! 제출자: /u/swiebertjee [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기