가장 중요한 것은 작은 것들입니다. - llama.cpp - 여러 업데이트 (Boost & Fixes)
요약
llama.cpp의 최신 업데이트를 통해 Mamba-2 가속을 위한 ggml-cuda의 chunked SSD matmul 추가 및 Metal 백엔드용 FWHT 커널이 도입되었습니다. 또한 GPT-OSS 모델을 위한 Eagle3-v3 지원과 다양한 버그 수정이 포함되었습니다.
핵심 포인트
- Mamba-2 prefill 가속을 위한 ggml-cuda chunked SSD matmul 추가
- M4 Max 환경에서 Metal 백엔드 FWHT 커널 성능 향상 확인
- GPT-OSS 모델에 대한 Eagle3-v3 지원 추가
- Vulkan 및 SYCL 백엔드 관련 버그 수정 및 기능 개선
ggml-cuda: Mamba-2 prefill 가속을 위한 chunked SSD matmul 추가 - #22675 Nemotron-Nano-9B-v2 ub base (scan) branch (SSD) 속도 향상 128 5,404 5,351 −1% (both scan) 256 6,180 7,110 +15% 512 6,627 7,778 +17% 1k 6,814 8,152 +20% 2k 6,759 8,190 +21% 4k 6,660 8,118 +22% 8k 6,387 7,761 +22% pp16384 tok/s (base=scan, branch=SSD at ub>128) RTX 6000 Pro MaxQ에서 테스트됨. ggml-metal: metal 백엔드를 위한 FWHT 커널 - #25924 llama-bench -r 15를 사용하여 M4 Max에서 unsloth/DeepSeek-V4-Flash-UD-IQ2_XXS로 테스트됨. K cache 벤치마크 base PR head 속도 향상 f16 pp512 228.90 ± 1.55 t/s 228.46 ± 1.38 t/s -0.19% f16 tg16 9.958 ± 0.258 t/s 10.073 ± 0.165 t/s +1.16% q8_0 pp512 211.70 ± 2.32 t/s 218.92 ± 2.17 t/s +3.41% q8_0 tg16 8.975 ± 0.262 t/s 9.292 ± 0.262 t/s +3.54% q4_0 pp512 213.46 ± 1.21 t/s 220.27 ± 1.59 t/s +3.19% q4_0 tg16 8.988 ± 0.160 t/s 9.101 ± 0.163 t/s +1.25% spec: gpt-oss를 위한 eagle3-v3 지원 추가 - #25794 다음 항목에 Eagle3 추가: https://huggingface.co/ggml-org/gpt-oss-20b-GGUF https://huggingface.co/ggml-org/gpt-oss-120b-GGUF 수정 사항: sycl: oneDNN flash-attention 경로에서 SDPA scale의 use-after-return 수정 #25880 vulkan: FA에 iq4_nl 지원 다시 추가 - #24585 스레드 제목의 시작 부분은 u/autisticit으로부터 가져옴 (/u/pmttyji가 제출한 [link] [comments] 내용을 여러 스레드를 피하기 위해 하나의 스레드로 통합했습니다. 누군가 GPT-OSS 모델에 eagle3를 공유해 주세요. 또한 GPT-OSS 모델로 다른 spec decoding을 시도해 본 분이 계신가요? 벤치마크와 함께 피드백을 공유해 주세요)
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기