llama.cpp v0.6.0 업데이트: 새로운 배치 API, GLM-5.3-Flash 지원 및 Metal 최적화
요약
llama.cpp v0.6.0 업데이트는 새로운 `llama_batch_ext` 확장 배치 API를 도입하여 혼합 토큰/임베딩 처리를 지원합니다. GLM-5.3-Flash, Clef 등 다양한 하이브리드 모델을 지원하며, Metal 및 Vulkan 최적화 플래시 어텐션 커널과 새로운 서버 엔드포인트도 추가되었습니다.
핵심 포인트
- 혼합 토큰/임베딩 처리를 위한 `llama_batch_ext` API 도입
- GLM-5.3-Flash 등 320B 하이브리드 모델 지원 강화
- Metal 및 Vulkan 기반의 플래시 어텐션 최적화 추가
- 결정 모델(Clef 등)을 위한 `/v1/systemone` 서버 API 제공
개요
llama.cpp v0.6.0은 혼합 토큰/임베딩 입력과 MTP/deepstack 상태 임베딩을 위한 새로운 llama_batch_ext 확장 배치 API (with llama_process)를 도입하고, GLM-5.3-Flash (GLM5-Next) 320B 하이브리드 모델, Clef 의사결정 모델(텍스트 및 비전), 그리고 Qwen4Exp용 MTP 추측 디코딩을 지원합니다. 또한, 의사결정 모델(laya, julia-1, lev, openjev, kev, nimble)을 위한 새로운 /v1/systemone 서버 API를 제공하며, Hugging Face Hub 데이터 계층 및 모델 다운로드 파이프라인으로 Web UI를 전면 개편하고, F16 KV용 Metal 텐서-API 플래시 어텐션 커널과 Vulkan에서 양자화된 K/V에 대한 희소 플래시 어텐션을 추가했으며, ggml을 v0.26.0으로 업데이트했습니다.
주요 변경 사항
-
llama_process()를 포함하는 새로운llama_batch_ext확장 배치 API는 혼합 토큰/임베딩 배치를 지원하며 MTP 및 deepstack 모델용 개별 토큰 -
Qwen4Exp 및 Gemma4에서 MADVISE 기반의 PLE 텐서 프리페칭을 사용하는 새로운
llama_prefetch_rows()추가 #29599
API 변경 사항
include/llama.h:llama_embd,llama_process(), 및llama_process_type을 갖는 새로운llama_batch_ext배치 API #24669, 새로운llama_get_causal_attn()#28876 추가, 세션 포맷이LLAMA_SESSION_VERSION11 및LLAMA_STATE_SEQ_VERSION4로 상향됨include/llama-cpp.h: 새로운 확장 배치 API를 위한llama_batch_ext_ptr및 해제자(deleter) 추가 #24669tools/mtmd/mtmd.h:mtmd_get_memory_usage()가 이제image_max_tokens및use_non_causal을 갖는mtmd_memory_usage구조체를 반환 #29773tools/server: 결정 모델용 새로운/v1/systemone엔드포인트 #29818 및/v1/embeddings가 이제 타입 지정된 비전/오디오/비디오 콘텐츠를 허용함 #29556
새로운 모델
-
GLM-5.3-Flash (GLM5-Next): mHC 및 MoE를 갖춘 320B KDA/DSA 하이브리드 텍스트+비전 모델 #27773
-
Ling 3.0 VL: BailingMoeV3 아키텍처에 통합됨 #29151
-
Nimble 결정 모델 #29844
-
LFM2.5-Encoder-230M/350M용
Lfm2BidirectionalForMaskedLM등록됨 #29862 -
재순위 지정기(rerankers)를 위한
classifier_pooling지원 추가 #29627 -
예시(examples), 추측 디코딩(speculative decoding), mtmd 및 서버 기능을 새로운
llama_batch_extAPI로 마이그레이션함 #29385 #29601; 이제 배치(batches)는 임베딩 토큰(embd)과 원시 토큰(raw tokens)을 모두 허용함 #29622 -
llama_prec_policy를 추가하고 모델 기반의 W4A4 (NVFP4/MXFP4) mul_mat 경로를 구현함 #24364 -
Qwen4Exp: 인덱서 점수 메모리(indexer score memory) 절반화 #29825, 마스크 구성 최적화 #29824,
-sm텐서 재활성화 #28569; GLM5-Next: 비어 있는 인덱서 슬롯(dead indexer slots)에 고유한 스캐터 행(unique scatter rows) 추가 #29745 -
KV 캐시: 불일치하는 KV 캐시 회전 복원 문제 수정 #28498, 실패한 복원 후 K/V 및 순환 상태 정리(cleanup) 기능 수정 #27530 및 순환 메모리 내 유효하지 않은 assert 수정 #29799
-
추측 디코딩: 간단한 초안(draft) 및 MTP에 대한 확률적 샘플링 구현 #27694, 잘림 후 temp > 0에서 n-gram 초안 거부 문제 수정 #29924, 레이어 입력의 원래 배치 순서 유지 #29019, EOG에서 초안 토큰 수락 중지 #29638
-
k-pool 모델: 예상치 못한 그래프 재할당 문제 수정 #29958 및 kpool 리-풀(re-pool) 경계가 기존 풀에 고정되도록 제한함 #29805
-
불균일한 K/V 헤드 크기를 가진 융합된 qkv에 대한 텐서 분할을 수정함 #29294, 재귀 상태를 한 번만 수집하여 예약 영역이 모든 분할을 커버하도록 함 #29856, 그리고 학습 시 KV 처리를 올바르게 처리함 #28520
-
Context:
causal_attn토글 시 스케줄러를 재예약하지 않도록 함 #28751 -
DFlash drafts: 변환 중 Gemma 임베딩 스케일을 기록하고 MiMo에 대한 dflash 지원을 추가함 #29802 및 #29650
멀티모달리티 변경 사항 (Multi-modality changes)
- 비(非)인과 모델에서
max_image를n_ubatch로 제한함 #29773 - LFM2 오디오의 멜 전처리기를 수정함 #29403
- 입력 처리를
llama_batch_ext로 마이그레이션함 #29385
서버 변경 사항 (Server changes)
서버 변경 사항 (Server changes)
- 전용 의사 결정 파이프라인을 갖춘 새로운
/v1/systemonedecision-model API #29818 추가, nimble decision model로 확장됨 #29844 - Clef에 비전 입력 지원 #29969
GET /v1/models와GET /models가 새로운architecture객체에서 모델의 입력/출력 모달리티를 보고함 #29987/v1/embeddings: 타입이 지정된 콘텐츠(비전/오디오/비디오) 입력을 허용하며 #29556, 유효하지 않은 임베딩 요청에 대해 HTTP 400을 반환함 #29060- 인과적 LLM 리랭커(Qwen3, Qwen3-VL)를 위한 RANK 풀링 배치 분할 허용 #28876
- 부분 미디어 자르기 거부 #24076
- 로깅: 라우터 모드에서 자체 포함 색상 및 로그의 하위 명령 분리 #29895, 프리셋이 로그 파일을 설정할 수 있도록 허용 #29334, 프리셋 허용 목록에서 죽은
LLAMA_ARG_HF_REPO_FILE키 수정됨 #29938 n_batch를n_ubatch로 제한하여 laya 중단 문제 수정됨 #29903- UI가 서비스되지 않을 때 내장 UI의 service worker 제거됨 #29565
- 새로운 모델 다운로드 파이프라인 #27959, Hugging Face Hub 데이터 레이어 #27947, 모델 메모리 적합성 추정 #27957 및 사이드카(sidecars), 양자화(quants), 기능 파싱을 위한 모델 ID 문법 #27946
- 타입 안정성 API 타입, 페치 헬퍼 및 다운로드 준비 모델 스토리지 배관(plumbing) #29582
- 공유 모델 표시 기본 요소(Shared model display primitives) #29644
- 미리보기 및 다운로드에서 누락된
svg use및 애니메이션 요소를 수정함 #28962 - 채팅 메시지 통계 전반에 걸쳐
toLocaleString()포맷을 일관되게 사용하도록 함 #27990
ggml 변경 사항
- ggml이 v0.26.0으로 업데이트됨: 새로운
alloc_buffer_n/get_alloc_size_n버퍼 할당 API, SYCL, Vulkan 및 Metal용 희소 플래시 어텐션 커널(sparse flash attention kernels), 그리고 주요 라이트닝 인덱서 개선 사항 (점수 메모리 절반화, 타일링, MUSA 지원). CPU 백엔드는 BF16 연산과 타일링된 k-양자화 mul_mat을 얻었으며, CUDA는 모델 기반 W4A4 (NVFP4/MXFP4) mul_mat 경로와 MMVQ 공유 전문가 융합(shared-expert fusion)을 얻었고, Hexagon 백엔드는 샘플러와 더 많은 양자화 유형을 추가함. 엄격한 GGUF 크기 검증으로 모델 로딩이 빨라졌고, Windows ARM64 MSVC 빌드가 활성화되었으며, WebGPU/OpenVINO/OpenCL/SYCL이 수많은 새로운 커널, 연산(ops) 및 수정 사항들을 채택함.
에셋 (Assets)
Nightly 빌드: b11429
추가 정보 (More info)
변경 로그 (Changelog) v0.5.0 이후
AI 자동 생성 콘텐츠
본 콘텐츠는 llama.cpp Releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기