공지: llama.cpp가 이제 MTP를 사용하지 않더라도 모든 draft-mtp 아키텍처에 대해 기본적으로 MTP 텐서를 로드합니다
요약
llama.cpp가 draft-mtp 아키텍처를 사용하는 GGUF 모델 로드 시 MTP 텐서를 기본적으로 로드하도록 업데이트되었습니다. 이로 인해 추측적 디코딩 활성화 여부와 관계없이 추가적인 VRAM/RAM 사용량이 발생할 수 있습니다.
핵심 포인트
- MTP/NextN 텐서가 포함된 GGUF 모델의 기본 로드 방식 변경
- spec-type 옵션 없이도 MTP 텐서를 자동으로 로드함
- MTP 사용 여부와 무관하게 추가적인 메모리(VRAM/RAM) 점유 발생
만약 사용 중인 GGUF에 MTP/NextN 텐서가 포함되어 있다면 (GLM-5.2, hy_v3, qwen35moe, step35 등), 최근의 llama.cpp 빌드는 --spec-type draft-mtp를 전달하지 않더라도 기본적으로 이를 로드합니다. 이전에는 speculative decoding (추측적 디코딩)을 실제로 활성화하지 않으면 이 텐서들이 건너뛰어졌습니다.
대부분의 커뮤니티 GGUF는 기본적으로 MTP 블록을 포함하고 있으므로, 이는 MTP 사용 여부와 관계없이 로드할 때마다 추가적인 VRAM/RAM 사용량(약 1개의 추가적인 MoE 레이어)이 발생함을 의미합니다.
https://github.com/ggml-org/llama.cpp/pull/25980 를 참조하세요.
submitted by /u/Shoddy_Bed3240
[link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기