DFlash 2 drafter를 Ternary Bonsai 2 27B에 맞게 재학습한 결과: L4에서 2.2배, Mac에서 1.5배
요약
본 기사는 DFlash 2 drafter를 Ternary Bonsai 2 27B 모델에 맞게 재학습한 결과를 공유합니다. L4 환경에서 GSM8K, MATH-500 등 코딩 및 수학 문제 해결 능력이 최대 2.2배 향상되었으며, Mac M4 Pro에서도 코드 완성 성능이 1.5배 개선되었습니다.
핵심 포인트
- L4 환경에서 코딩/수학 문제 해결 능력 2.2배 향상 (GSM8K 등)
- Mac M4 Pro 환경에서도 코드 완성 성능 1.5배 개선
- DFlash 2 drafter를 Bonsai 2에 맞게 미세 조정하여 적용함
- NVIDIA와 Mac 양쪽 플랫폼에서 성능 최적화 결과를 제시
PrismML의 Ternary Bonsai 2 27B는 24 GB 카드 또는 Mac에서 작동하지만, L4에서는 약 30 tok/s, M4 Pro에서는 약 21 tok/s로 디코딩됩니다. z-lab의 DFlash 2 drafter는 bf16 Qwen3.8-27B를 기반으로 학습되었기 때문에 ternary 모델에서는 성능이 떨어집니다. 저는 Bonsai 2 자체의 greedy 출력 1.5M 토큰을 사용하여 이를 미세 조정(fine-tuned)했습니다.
Drafter (safetensors + Q4_K_M GGUF): https://huggingface.co/naklitechie/Qwen3.8-27B-DFlash2-ternary-bonsai2
Setup for all three runtimes: https://github.com/NakliTechie/dflash-mlx-bonsai2/blob/main/docs/USAGE.md
NVIDIA (PrismML의 llama.cpp fork, prism branch):
llama-server -m Ternary-Bonsai-2-27B-PQ2_0.gguf -md Qwen3.8-27B-DFlash2-r3-Q4_K_M.gguf \ --spec-type draft-dflash --spec-draft-n-max 7 --spec-type ngram-mod \ -ngl 999 -ngld 999 -fa on --jinja
- One L4, greedy: GSM8K 2.17x, MBPP 2.17x, MATH-500 2.20x, MT-Bench 1.39x.
- Code edits: ngram-mod 스택 적용 시 3.15x (drafter 단독으로는 2.46x).
- 정확도는 세트당 1~2 문제 이내입니다.
Mac: bstnxbt/dflash-mlx의 포크 버전으로, verify 단계에 8행 2비트 Metal GEMM을 사용합니다.
- M4 Pro: 원시 코드 완성(raw code completion)에서 1.5x, 채팅 코드(chat code)에서 1.3x, 수학 문제에서 1.2x 성능을 보입니다.
Browser: LocalMind (https://localmind.naklitechie.com) 내의 WGSL 포트로, Bonsai 2 27B에 기본 적용됩니다.
- 코드에서는 1.18x를 보이며, 출력은 동일합니다. 채팅과 산문(prose)은 거의 변화가 없습니다. temperature는 0을 사용하세요.
Credit: z-lab (DFlash 2), PrismML (Bonsai 2, llama.cpp fork), 그리고 bstnxbt (dflash-mlx). 제시된 수치는 L4와 M4 Pro 각각에서 나온 것이며, 3090, 4090 또는 다른 Apple 칩에서의 결과도 환영합니다.
submitted by /u/naklitechie [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기