완전히 로컬로 구동하는 작은 파쿠르 시뮬레이션
요약
작성자는 로컬 환경에서 GLM 5.3 Flash 모델을 DGX Sparks 두 대에 구동한 경험을 공유했습니다. vllm TP2 레시피를 사용하여 프리필 및 디코드 속도를 측정했으며, 특히 비전 및 3D 이해도와 안정적인 상호작용 속도에 깊은 인상을 받았다고 언급했습니다.
핵심 포인트
- GLM 5.3 Flash 모델을 로컬 DGX Sparks 환경에서 구동함.
- vllm TP2 레시피를 통해 성능(Prefill/Decode) 측정 결과를 공유.
- 모델이 비전 및 3D 이해도가 높고 상호작용 속도가 안정적임.
- Claude Code를 스캐폴드로 사용했으며, 컨텍스트 크기는 260k에 달함.
이번 주말에 이걸 구현해 봤습니다. 완전히 로컬 환경에서 GLM 5.3 Flash를 2대의 DGX Sparks에서 구동했습니다.
vllm TP2 레시피: https://github.com/tonyd2wild/GLM-5.3-Flash-NVFP4-DFlash2-2x-DGX-Spark
프리필(Prefill): ~1500t/s
디코드(Decode): 100k 토큰에서 ~40t/s
Claude Code를 스캐폴드(scaffold)로 사용했으며, 컨텍스트 크기는 260k입니다.
이 모델에 정말 깊은 인상을 받았습니다. 작업 종류에 따라 GLM 5.1과 5.3 사이의 느낌을 합니다. 비전과 3D 이해도가 좋습니다. 상호작용 속도도 안정적입니다. 드디어 집에서 '충분히 좋은' 수준의 환경을 구축했다고 느끼며, 앞으로 더 좋아질 것에 기대하고 있습니다.
제출자: /u/-dysangel-
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기