로컬 Qwen3.8 모델을 이용한 저지연 SGLang/vLLM 테스트 결과: DFlash2 2.8배 성능 향상
요약
본 기사는 로컬 환경에서 Qwen3.8 계열 세 가지 모델(27B Dense, 27B Uncensored, Flash-Next MoE)을 비교 테스트한 결과를 담고 있습니다. 특히 DFlash2 drafter를 사용한 추측적 디코딩(Speculative decoding) 결과, Spec-Bench 점수가 최대 2.8배 향상된 것이 주요 성과입니다. 또한 SGLang과 vLLM 엔진 간의 성능 비교 및 다양한 에이전트 테스트 결과를 제시합니다.
핵심 포인트
- DFlash2 사용 시 추측적 디코딩으로 성능을 2.8배 향상시킬 수 있음.
- SGLang은 전반적으로 빠르나, 단일 내보내기에서는 vLLM이 더 나은 성능을 보임.
- Flash-Next 모델이 영상 편집, 디자인 등 복합 에이전트 테스트에서 우수한 결과를 기록함.
- 27B Dense 모델은 아레나 전투와 CAPTCHA 같은 특정 영역에서 강점을 보임.
안녕하세요,
지난번에는 Qwen3.8-Flash-Next 단독으로 테스트했습니다. 이번에는 세 가지 Qwen3.8 체크포인트(checkpoint)를 동일한 RTX PRO 6000에서 같은 10가지 테스트에 걸쳐 비교해 보았습니다:
RadixArk/Qwen3.8-27B-NVFP4 (dense)
orcarouter/Qwen3.8-27B-Uncensored-NVFP4 (dense, uncensored fine-tune)
RadixArk/Qwen3.8-Flash-Next-NVFP4 (MoE)
각 모델은 동일한 프롬프트를 받았고, 각자의 모델 카드(model card)에 명시된 샘플러를 사용했으며, 작업당 한 번의 시도를 했습니다.
전투, 성, 볼런(ball run)을 담은 영상:
짧은 요약:
승리한 테스트 항목: Flash-Next 5개, 27B 4개, Uncensored 0개 (단, 장문 컨텍스트 회상(long-context recall)은 세 모델 모두 100%로 동점).
사전 채우기(Prefill), 전체 창(full window): Flash-Next 22.4초, 27B 97초, Uncensored 99초 (동일한 전력 제한이 아니므로 섹션 1 참고).
27B 모델에 대한 추측적 디코딩(Speculative decoding): DFlash2 drafter를 사용한 결과, Spec-Bench 점수가 한 사용자에게서 75에서 210 tok/s로, 2.8배 향상되었습니다.
SGLang vs vLLM: 전반적으로 SGLang이 더 빨랐습니다(210 대 160 tok/s). 하지만 이는 주로 체크포인트의 영향이었습니다. 두 엔진 모두에서 실행한 단일 내보내기(export) 테스트에서는 vLLM이 16% 더 빨랐습니다(169 대 146).
도구 사용(Tool use, BFCL 서브셋, 사고 과정): 27B 73.3%, Uncensored 70.8%, Flash-Next 64.5%.
전투 아레나: 27B가 700/1000점을 기록하며 Claude Fable 5.1 (678점)과 GPT-5.6 (473점)을 앞섰습니다. 이 두 모델은 최대 사고 과정(max thinking)으로 각각의 채팅 앱을 통해 진입했습니다.
루브 골드버그 기계: Flash-Next만이 공을 컵에 넣는 데 성공했습니다. 두 27B 모델 모두 전체 약 111K 토큰 답변 예산 동안 생각하는 데 시간을 보내며 부품을 배치하지 못했습니다.
CAPTCHA (40개의 퍼즐, 로컬 복사본): 27B 24/40, Flash-Next 21/40, Uncensored 19/40.
관찰 항목: Flash-Next가 가장 좋은 복셀 성(voxel castle), 최고의 디자인 보드, 그리고 최고의 비디오 편집 결과물(제 루브릭 기준 20점 만점에 19점)을 보여주었습니다.
설정
GPU: NVIDIA RTX PRO 6000 Blackwell 한 장, 96GB
CPU: AMD Ryzen 9 9950X
시스템 RAM: 96GB DDR5
27B 및 Uncensored: lmsysorg/sglang:v0.5.20, DFlash2 drafter, 262,144-token window, 4 슬롯
Flash-Next: lmsysorg/sglang:dev-qwen38-next-local, 내장 MTP drafter, 262,144-token window, 1 슬롯. BFCL 실행 시에는 27B와 마찬가지로 sglang:v0.5.20을 사용했습니다.
Sampler: 에이전트 테스트를 위해 모델 카드에 명시된 최고 노력도의 사고(thinking) 설정이 적용되었습니다. BFCL과 니들 테스트는 카드에 명시된 비사고 설정을 사용합니다.
에이전트 테스트(SVG, 영상 편집, 복셀, 디자인, Rube Goldberg, CAPTCHA)는 bash, read, write 및 edit 기능을 가진 코딩 에이전트 Pi 내부에서 실행됩니다. CAPTCHA는 스크린샷, 마우스, 키보드만 사용합니다.
하나의 워크스테이션에 한 번에 하나의 모델 서버를 두고, 모든 수치는 저장된 실행 결과에서 가져왔습니다.
- 속도: drafter, SGLang vs vLLM, 그리고 긴 프롬프트
27B 모델의 경우, 속도 매트릭스를 실행했습니다. 모든 drafter와 두 개의 엔진, 네 가지 빌드(세 가지 NVFP4 내보내기 중 하나는 Uncensored 파인튜닝이며, 다른 하나는 전체 정밀도의 BF16)를 사용했습니다. 각 암은 콜드 부팅을 통해 자체 서버를 할당받았고, 카드의 sampler와 400W 제한이 적용되었습니다. '사용자 한 명'은 480개의 프롬프트에 대한 Spec-Bench 중앙값입니다. 엔진: lmsysorg/sglang:v0.5.20 및 vllm/vllm-openai:v0.29.0.
어떤 drafter가 더 나은지 (tok/s, 사용자 한 명):
Drafter SGLang · RadixArk NVFP4 vLLM · Inferact NVFP4
none 75 59
MTP (모델에 내장) 160 113
DSpark 174 137
DFlash2 210 160
DFlash2 + torch.compile 214 실행 안 함
DFlash2가 두 엔진 모두에서 우수했습니다. MTP의 2.9개 토큰 대비 단계당 약 3.7개의 draft된 토큰을 유지했습니다.
어떤 빌드가, 어느 엔진에서 더 나은지 (tok/s):
빌드 · 엔진 DFlash2, 사용자 1명 No drafter, 사용자 1명 DFlash2, 사용자 4명 (총합)
RadixArk NVFP4 · SGLang 210 75 607
Inferact NVFP4 · vLLM 160 59 517
Uncensored NVFP4 · SGLang 146 46 473
Uncensored NVFP4 · vLLM 169 63 538
BF16 · SGLang (전체 정밀도) 97 29 291
엔진 간의 격차는 빌드에 따라 달라집니다.
RadixArk의 SGLang 내 export가 전반적으로 가장 빨랐지만, 두 엔진 모두에서 실행한 유일한 export(Uncensored)에서는 vLLM이 16% 더 빨랐습니다.
NVFP4 export는 상호 교환할 수 없습니다. 아키텍처, 비트 수(4 bits), 엔진(SGLang), drafter가 모두 같지만: RadixArk의 export는 210 tok/s를 기록했고 Uncensored는 146 tok/s를 기록했습니다.
4-bit vs full precision: DFlash2를 사용한 NVFP4는 BF16 속도의 2.2배입니다.
Prefill은 엔진에 관계없이 작동합니다: 전체 245K 토큰 창은 모든 NVFP4 arm(SGLang 또는 vLLM)에서 96–103초가 걸렸고, BF16은 129–135초가 걸렸습니다.
Metric Qwen3.8-27B 27B-Uncensored Flash-Next
Prefill, full window 97초 99초 22.4초
Decode, Spec-Bench, one user 210 tok/s 146 tok/s 미실행
Drafter vs no drafter 2.8× 3.2× 해당 없음 (n/a)
27B는 전체 245K 토큰 창을 뒤에 두고도 223 tok/s로 계속 작성합니다. Speculative decoding은 내용에 크게 의존합니다: 수학(maths)은 339 tok/s, 역할극(roleplay)은 149 tok/s였습니다. 이 패턴은 두 27B 빌드 모두에서 동일했습니다.
한 가지 중요한 주의사항이 있습니다. Flash-Next의 속도 테스트는 2026년 9월 12일, 600W 전력 제한(power cap) 하에서 실행되었습니다. 저는 나중에 카드를 400W로 옮겼고, 27B 매트릭스는 그 제한 하에서 작동했습니다. 제 전력 스윕(power sweep) 결과, 50W가 제거될 때마다 prefill이 약 6%씩 손실되어 일부 격차는 이 전력 제한 때문입니다. Moe 또한 도움이 됩니다.
https://preview.redd.it/jx28sde1j4th1.png?width=1484&format=png&auto=webp&s=eb0abbfb00f1058a71865cb5ba9d3e2e02de0513
2. 도구 사용(Tool use): dense 27B가 선두를 차지합니다.
이것은 전체 리더보드가 아닌, BFCL v4 서브셋(11개 카테고리) 중 900건의 사례입니다. 생각하는 과정은 잘못되었으며, 카드에서 나온 temperature 0.7과 top_p 0.8을 사용했습니다.
Metric Qwen3.8-27B 27B-Uncensored Flash-Next
BFCL core 73.3% 70.8% 64.5%
Tool accuracy 87.8% 88.0% 82.4%
Abstention 79.5% 69.5% 68.5%
Multi-turn 52.5% 55.0% 42.5%
Malformed calls 0.08% 0.27% 0.28%
이 수치는 제가 지난 게시물에서 사용했던 temperature 0을 적용한 Flash-Next BFCL 수치와는 비교할 수 없습니다.
https://preview.redd.it/yqdc2j32j4th1.png?width=3396&format=png&auto=webp&s=243a206611eab4609251c7a8fa149465bbc05c42
3. Long context: 세 모델 모두에게 완벽한 조건
262K 창의 3가지 깊이와 3가지 바늘 유형으로 각각 33%, 66%, 또는 99%를 채우는 로그 파일에 사실을 숨겼습니다. 캐시는 매 요청 전에 플러시되었습니다.
27B: 27/27
Uncensored: 27/27
Flash-Next: 81/81 (이 테스트를 시작할 때 셀당 하나가 아닌 세 개의 샘플을 실행했기 때문에)
가장 큰 프롬프트는 약 259.5K 토큰이었습니다.
https://preview.redd.it/fgeuq733j4th1.png?width=3396&format=png&auto=webp&s=7b221fa5f9f2b14224d3370c3a5b41bfb3fadd7a
4. 배틀 아레나: 로컬 27B가 Claude를 이기다
각 모델은 규칙 시트와 1,000점 예산을 받습니다. 오픈 아레나에서는 아무것도 모르는 상태에서 하나의 군대를 설계하고 13개 군대(9개의 역사적 참고 자료 및 다른 항목)와 싸웁니다. 점수는 1,000 × 평균 승률입니다. 모든 매치업은 200개의 결정론적 전투(100개의 시드, 측면 교체)로 구성됩니다.
순위 | 참가 모델 | 점수 |
1 RadixArk/Qwen3.8-27B-NVFP4 | 700 |
2 Claude Fable 5.1 (chat, max thinking) | 678 |
3 Qwen3.8-27B-Uncensored | 603 |
4 Qwen3.8-Flash-Next | 535 |
5 GPT-5.6 (chat, ultra thinking) | 473 |
가운틀릿에서는 모델이 각 적을 보고 카운터를 만듭니다. 27B는 15개 중 12개를 이겼고, Uncensored도 15개 중 12개를 이겼으며, Flash-Next는 17개 중 13개를 이겼습니다. Flash-Next는 적이 두 개 더 많은 이전 버전의 가운틀릿을 실행했으므로 해당 행은 순위로 취급하지 마십시오.
생각 비용: 27B의 아레나 군대는 4분 동안 39K개의 사고 토큰을 사용했습니다. Flash-Next의 것은 9분 동안 73K개를 사용했습니다.
https://preview.redd.it/1wbb6p28j4th1.png?width=3396&format=png&auto=webp&s=a372f6254ef889aa56e0e149c154886735d47fc2
https://preview.redd.it/o2yccq77j4th1.png?width=1484&format=png&auto=webp&s=1a59ffd33b733094abc19a4e2404742773103398
5. SVG 테스트 역시 사실 확인입니다
프롬프트: 로컬 AI 취미가들이 어떤 카드를 사용하는지, 그리고 현재의 오픈 모델 중 어느 것이 그것에 적합한지 알아내고, 그 모델과 맞는 양자화(quant)와 크기가 표시된 카드 이미지를 그리시오. 세 모델 모두 RTX 3090을 선택했습니다.
각 세션이 실제로 가져온 내용과 모든 라벨을 대조해 보았습니다.
27B: 사실 정보 5/5개 모두 정확했습니다. Qwen3-Coder-30B-A3B는 Q5_K_M에서 21.73 GB였고, 실제 파일 크기였습니다. Q6_K가 25.09 GB인 것은 적재 불가로 올바르게 표시되었습니다.
Flash-Next: 4/5개입니다. 네 가지 파일 크기와 정확한 3.3B 활성 파라미터를 모두 맞혔지만, 3090에 "12VHPWR, 한 번 녹음"이라는 농담을 붙여 라벨링했습니다. 이는 잘못된 카드 정보입니다.
Uncensored: 3/5개입니다. 모델을 "QWEN3.8-27B"로 라벨링했지만, Qwen3.6-27B의 Q4_K_M 파일 크기를 사용했으며, 이 모델이 가져온 내용 중에는 "12 tok/s"라는 수치가 없습니다.
세 모델 모두 8/8 형식 검사를 통과했습니다. 27B는 렌더링 내용을 두 번 확인했고, Flash-Next는 규칙상 한 번만 허용되는 상황에서 세 번이나 확인했습니다.
https://preview.redd.it/oijy66u9j4th1.png?width=1920&format=png&auto=webp&s=7ff5d4a19dbeb73374060241b395fc99ed0d26e6
- 비디오 편집, 복셀 및 디자인
비디오 편집: 모델은 필러(filler), 재촬영본, 욕설이 포함된 원본 132초 분량의 영상을 받습니다. 영상 자체를 보는 것이 아니라 전사(transcription)와 침묵 감지 도구만 사용하고, 이후 FableCut의 도구를 통해 편집을 진행합니다. 총 두 가지 사례가 있었으며, 각각 10점 만점으로 수동 평가되었습니다:
Flash-Next 9 + 10 = 19
27B 8 + 8 = 16
Uncensored 5 + 8 = 13
복셀(three.js의 바벨 성당), 시각적 순위:
Flash-Next만이 금빛 시지그문트 예배당 돔과 언덕을 감싸는 비스와 강줄기를 보여주었습니다.
27B는 깔끔하지만 평범한 성을 지었습니다.
Uncensored는 카메라를 자신이 만든 구조물 안에 배치했습니다.
또한 Flash-Next가 가장 적은 사고 토큰(thinking tokens)을 사용했습니다: 73K, 반면 27B는 101K를 사용했습니다.
디자인 (제 디자인 시스템의 애니메이션 설명 보드), 시각적 순위: Flash-Next가 1위를 차지했고, 두 개의 27B 모델이 공동 2위를 차지했습니다. 세 모델 모두 7/7의 엄격한 규칙을 통과했습니다.
https://preview.redd.it/ue511ppaj4th1.png?width=1920&format=png&auto=webp&s=1ffb968e03b4a003d51517b90cf873c673404f7c
- 루브 골드버그: 단 하나의 장치
설정은 고정된 레벨입니다: 선반 위의 공, 바닥의 컵, 그리고 그 사이에 벽이 있습니다. 모델은 부품 목록(코드 없음)을 작성하고, 2D 물리 엔진이 이를 실행합니다.
90분 동안 원할 때마다 실행하고 테스트해 볼 수 있습니다. 점수는 자동입니다. 공 자체가 컵 안에 들어가는가?
Flash-Next: 예, 12.4초에 성공했습니다. 총 49번의 시뮬레이션 실행을 했고 40개의 부품(35개 이동)을 사용했습니다. 공은 1,672px를 이동했습니다. 224K 개의 사고 토큰을 사용했고 컨텍스트를 8번 압축했습니다.
27B 및 Uncensored: 기계 없음. 둘 다 첫 답변에서 약 111K 토큰을 생각하는 데 사용했으며, 답변당 제한에 도달하여 부품 하나도 작성하지 못하고 중단되었습니다. 모두 동일한 규칙과 한 번의 시도를 받았습니다. 모델이 제한에 도달한 후에도 계속할 수 있도록 하는 규칙은 이 상황을 바꿀 수 있지만, 아직 테스트해보지 않았습니다.
https://preview.redd.it/px8mlhhbj4th1.png?width=1280&format=png&auto=webp&s=1229ddd46d6d3a1cb94f4b5d451a7e152cdcd16d
8. CAPTCHA: 실제 브라우저에서의 로컬 모델
저는 Open CaptchaWorld(20가지 유형의 CAPTCHA, 각 2개씩)를 사용했습니다. 이 모델은 스크린샷만 보고 마우스와 키보드로만 작동합니다. 사이트 자체 검사기가 첫 답변을 표시하며, 이는 7분 이내에 완료되어야 합니다.
| 모델 | 해결 수 | 중앙값 시간 | 사고 토큰 | 전체 부품 사용 |
|---|---|---|---|---|
| Qwen3.8-27B | 24/40 | 55초 | 456K | 40 |
| Flash-Next | 21/40 | 145초 | 1.0M | 40 |
| 27B-Uncensored | 19/40 | 36초 | 401K | 40 |
자체적인 20분 제한을 가진 Flash-Next는 23/40을 해결했습니다. 논문에서는 인간의 경우 93.3%, 최고 에이전트가 전체 세트에 대해 40%를 보고했지만, 이는 동일한 40개의 퍼즐은 아닙니다. 각각 한 번씩 실행했을 때, 3개 퍼즐 차이는 강력한 신호가 아닙니다.
어떤 것을 사용해야 할까요?
에이전트 및 도구 호출에는 RadixArk/Qwen3.8-27B-NVFP4를 사용하세요. 이 모델은 BFCL, 아레나, SVG 사실 확인 및 CAPTCHA에서 우승했습니다.
장문 프롬프트 처리와 무언가를 구축하는 데는 RadixArk/Qwen3.8-Flash-Next-NVFP4가 좋습니다. 특히 시각적인 것을 읽을 때 빠릅니다. 비디오 편집, 복셀(voxel), 디자인 및 루브 골드버그 기계에서 우승했습니다.
오직 거절(refusals)이 실제 문제인 경우에만 orcarouter/Qwen3.8-27B-Uncensored-NVFP4를 사용하세요. 여기서는 아무것도 우승하지 못했고 SVG에서 사실을 지어냈습니다.
자료 (Resources)
설정 파일(Configs), Docker 설정 및 보고서
테스트 하네스(test harness)는 아직 변경 중이므로 비공개입니다.
전투, 성, 볼런(ball run)이 담긴 전체 영상:
AI를 활용하여 이 글을 작성하고 보고서와 대조하는 데 도움을 받았습니다. 위에 제시된 모든 수치는 저장된 실행 결과에서 가져온 것입니다.
어떤 테스트가 가장 흥미로우신가요? 혹시 모델을 테스트할 다른 창의적인 아이디어가 있으신가요?
제출자: /u/FantasticNature7590
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기