단일 DGX Spark에서 Qwen3.8-27B (밀집 모델, Qwen Flash 아님) 실행하기
요약
본 기사는 단일 DGX Spark 환경에서 Qwen3.8-27B 밀집 모델을 구동한 결과를 공유합니다. 최적화된 캐싱 알고리즘과 StairCut 방법을 적용하여, 150k 컨텍스트 프리필이 밀리초 단위로 처리되며 디코딩 속도는 작업에 따라 50–90 tok/s를 달성했습니다.
핵심 포인트
- 단일 DGX Spark에서 Qwen3.8-27B 실행 가능성을 입증함.
- 최적화된 캐싱 및 StairCut 방법론을 활용하여 성능 향상.
- 150k 컨텍스트 프리필 처리 속도가 밀리초 단위로 빠름.
- 디코딩 속도는 작업에 따라 50–90 tok/s를 기록함.
Qwen3.8-27B (밀집 모델, Qwen Flash 아님)을 단일 DGX Spark에서 실행했습니다.
최적화된 캐싱 알고리즘과 StairCut 방법을 활용하여, 약 150k 컨텍스트 프리필(context prefill)이 밀리초 단위로 처리되며, 디코딩 속도는 작업에 따라 50–90 tok/s에 달합니다.
이 클립은 5시간 동안 연속 실행한 후 기록한 것으로, Qwen에게 탑 정원 디자인을 맡기고 새로운 아이디어를 끊임없이 반복하고 구현하게 했습니다.
Repo:
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: 오픈소스 LLM의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기