Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
ggml 라이브러리에서 LoongArch 아키텍처를 위한 LSX 명령어 지원이 추가되었습니다. fp16 로드/스토어 최적화 및 다양한 양자화 방식(q8_0, q6_K, iq4_xs)에 대한 내적 연산 구현을 포함합니다.
llama.cpp에서 RPC 장치만 존재할 때 로컬 iGPU를 연산 장치에서 제외하던 버그를 수정했습니다. 이로 인해 Strix Halo와 같이 iGPU가 주요 장치인 시스템에서 모델 로딩이 실패하던 문제가 해결되었습니다.
llama.cpp 프로젝트에 DeepSeek-OCR 2 지원이 추가되었습니다. 멀티 타일 동적 해상도(mtmd) 기술을 포함하며, 연산 최적화 및 다양한 플랫폼용 빌드가 제공됩니다.
llama.cpp 프로젝트에서 CUDA PDL 디스패치 오류를 해결하기 위해 호스트 측에서 PTX 버전을 확인하는 로직을 추가했습니다. 또한 해시 분포 개선을 위해 MurmurHash3 mixer를 구현하고 코드 품질을 개선했습니다.
llama.cpp 프로젝트에서 DeepSeek V3.2 모델 제품군을 지원하기 위한 업데이트가 진행되었습니다. 범용 DeepSeek Sparse Attention(DSA) 구현과 NVFP4 지원을 통해 모델 추론 효율성을 높였습니다.
llama.cpp 프로젝트에서 AMD MFMA 하드웨어를 위한 양자화된 matmul 라우팅 최적화 패치가 적용되었습니다. 양자화 방식별로 최적의 배치 임계값을 다르게 설정하여 AMD CDNA 아키텍처에서의 추론 성능을 대폭 향상시켰습니다.
llama.cpp의 Vulkan 백엔드에서 F16/32 데이터 타입에 대한 MUL_MAT_VEC 연산 최적화를 진행했습니다. Intel BMG 환경에서 Qwen3.5-9B 모델 테스트 시 약 4.8%의 성능 향상을 달성했으며, 정렬된 로드 사용 및 OOB 읽기 문제를 수정했습니다.
llama.cpp의 Vulkan 백엔드에 f16 데이터 타입을 위한 REPEAT 연산 지원이 추가되었습니다. 이번 업데이트를 통해 Vulkan 파이프라인 최적화와 데이터 타입 처리 방식의 개선이 이루어졌습니다.
llama.cpp 프로젝트에서 MiniCPM5 모델을 위한 토크나이저 지원이 추가되었습니다. convert_hf_to_gguf_update.py를 통해 사전 토크나이저 해시를 추가하고 정규식 처리를 구현하여 모델 변환 호환성을 높였습니다.
llama.cpp에서 buft probe 오류를 해결하기 위해 ffn_latent를 MUL_MAT으로 태깅하는 업데이트가 진행되었습니다. 이를 통해 Nemotron 3 Super 120B 모델의 추론 속도가 64.9 t/s에서 103.22 t/s로 크게 개선되었습니다.
llama.cpp의 ggml 라이브러리에서 컨텍스트 크기 계산 오류와 메모리 누수 문제를 수정했습니다. 분할 상태 캐시 이동 및 정적 할당 텐서를 위한 여유 공간 확보를 통해 안정성을 개선했습니다.
ggml 라이브러리에 GGUF 모델 로딩을 위한 새로운 함수인 `gguf_init_from_callback` 및 `gguf_init_from_buffer`가 추가되었습니다. 이번 업데이트는 메모리 로드 방식의 일관성을 확보하고 오프셋 계산 오류 및 오버플로 방어 로직을 강화하는 데 중점을 두었습니다.
이번 릴리스는 ggml 라이브러리의 성능 개선 및 플랫폼 지원 확대를 다루고 있습니다. OpenMP를 활용하여 양자화(quant) 초기화 과정을 병렬화했으며, macOS, Linux, Android 등 다양한 운영체제와 아키텍처에 맞는 최신 바이너리를 제공합니다.
llama.cpp의 서버 기능에서 체크포인트 생성 로직을 개선했습니다. 채팅 템플릿 기반의 프롬프트 토큰 위치 탐색과 컨텍스트 체크포인트 생성을 통해 효율적인 프롬프트 배칭을 지원합니다.
SYCL에서 MoE prefill 처리량을 개선하기 위한 최적화 작업이 진행되었습니다. 기존의 복잡한 매핑 방식을 카운팅 정렬 기반의 연속적 매핑 방식으로 교체하여 연산 효율을 높였습니다.
Vulkan 백엔드에서 Snake 활성화 함수를 위한 연산 융합(Operator Fusion) 기능을 추가했습니다. 5개의 개별 연산을 단일 요소별 커널로 재작성하여 F32, F16, BF16 파이프라인에서 성능을 최적화합니다.
/slots 엔드포인트의 JSON 응답에 프롬프트 토큰 관련 필드들을 추가합니다. 이를 통해 클라이언트가 프롬프트 평가 진행 상황을 실시간으로 모니터링할 수 있습니다.
llama.cpp의 Metal 커널 최적화 및 테스트 확장 업데이트입니다. concat 커널의 row batching을 통해 GPU 점유율을 높이고, CPY 연산의 다양한 텐서 형상 지원을 위한 테스트 케이스를 대폭 강화했습니다.
server_context_impl의 destroy() 함수에서 추측 디코더와 MTP 관련 리소스를 해제하지 않아 발생하던 VRAM 누수 문제를 해결했습니다. 절전 모드 진입 시 명시적인 리셋 과정을 추가하여 메모리 부족(OOM) 오류와 use-after-free 문제를 방지합니다.
HuggingFaceBio의 Carbon-3B 모델을 지원하기 위해 HybridDNATokenizer를 위한 새로운 BPE 프리타입을 추가했습니다. DNA 염기 서열을 6-mer 단위로 청킹하고 처리하는 로직을 llama.cpp 컨벤션에 맞춰 구현하고 리팩터링했습니다.