Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp의 최신 업데이트를 통해 CUDA 메모리 관리 로직이 개선되었습니다. 활성화된 백엔드가 없는 경우 디바이스를 재설정하고, 디바이스 및 호스트 버퍼 카운팅 기능을 추가했습니다.
llama.cpp의 샘플러 이름 매칭 로직을 개선하여 표준 이름과 대체 이름(alias) 간의 호환성을 높였습니다. 대소문자 구분 없이 샘플러 이름을 인식하도록 수정하여 llama-server UI에서의 설정 오류 문제를 해결했습니다.
llama.cpp의 kv-cache 셀 공유 시 발생하는 크기 불일치 및 어설션 오류를 해결하는 업데이트입니다. 맞춤형 타겟 컨텍스트가 초안 기본값보다 작을 때 K/V 텐서가 넘쳐흐르는 문제를 수정했습니다.
llama.cpp 프로젝트에서 Qwen-VL 기반 모델을 위한 'frame merge' 기능을 지원합니다. 이번 업데이트를 통해 Qwen3.5 모델의 비디오 지원이 추가되었으며, 다양한 플랫폼용 바이너리 릴리즈가 포함되었습니다.
llama.cpp의 OpenCL 커널 성능 개선 사항을 담은 업데이트입니다. get_rows, cpy, concat 및 q6_k flat gemv 연산의 최적화를 통해 연산 효율을 높였으며, 다양한 OS 및 하드웨어 환경을 위한 바이너리를 제공합니다.
llama.cpp의 Vulkan 백엔드 업데이트를 통해 Intel GPU를 위한 fwht 지원이 추가되었습니다. shmem reduction 기술을 활용하며, 다양한 OS 및 하드웨어 환경을 위한 최신 바이너리 릴리즈를 포함합니다.
llama.cpp 프로젝트에서 CUDA 백엔드의 multi-column MMVQ 최적화 로직을 SYCL로 포팅했습니다. 이를 통해 다양한 양자화 유형을 지원하며, 작은 멀티 컬럼 배치에서도 가중치 재정렬 커널이 작동하도록 개선되었습니다.
llama.cpp의 b9503 버전이 릴리스되었습니다. 이번 업데이트에서는 Gemma 4 오디오 프로젝터의 임베딩 크기 처리 관련 버그 수정이 포함되었습니다.
ggml 라이브러리에서 WASM SIMD128 인트린직을 사용하여 q4_1_q8_1 벡터 연산을 최적화했습니다. 이를 통해 WebAssembly 환경에서의 연산 속도를 기존 스칼라 구현 대비 약 3.42배 향상시켰습니다.
llama.cpp의 server 모듈에서 새로운 토큰이 존재할 경우 불필요한 체크포인트 복구가 발생하는 문제를 해결했습니다. 새로운 토큰이 없을 때만 조건부로 계산을 적용하여 중복되는 KV 상태 복구를 방지합니다.
ggml-webgpu의 FlashAttention 리팩터링과 양자화 지원 표준화에 관한 업데이트입니다. K/V 양자화 분리 및 타일 경로에 양자화 로직을 추가하여 성능과 구조를 개선했습니다.
llama.cpp의 ggml-cpu 라이브러리에서 RVV(RISC-V Vector) 양자화 벡터 내적 연산을 더 높은 VLENs(512b, 1024b)로 확장하는 업데이트가 진행되었습니다. 다양한 양자화 방식(iq4_xs, q6_K 등)에 대한 구현이 추가되어 RISC-V 환경에서의 추론 성능 최적화를 목표로 합니다.
llama.cpp 프로젝트에서 PDL 사용 시 발생하는 레이스 컨디션을 방지하기 위해 restrict 키워드를 비활성화하는 업데이트가 진행되었습니다. 아키텍처별 전처리기 지시문을 통해 성능 저하를 최소화하며, hopper 아키텍처에 대한 지원도 추가되었습니다.
llama.cpp의 b9488 릴리스 노트로, Qwen3 SSM 아키텍처 지원이 추가되었습니다. macOS, Linux, Android, Windows 등 다양한 플랫폼을 위한 바이너리 배포가 포함되어 있습니다.
llama.cpp 프로젝트에서 IBM의 Granite Multilingual Embeddings R2 모델 지원을 추가했습니다. 97m 및 311m 파라미터 모델을 위한 토크나이저 설정, SwiGLU FFN 지원, GGUF 키 업데이트 등 기술적 구현 사항을 포함합니다.
llama.cpp의 common_prompt_batch_decode 과정에서 발생하는 세션 상태 저장 및 복구 오류를 수정했습니다. session_tokens 저장 시 토큰 개수를 n개로 조정하여 동일 토큰이 잘못된 위치에서 재생되는 버그를 해결했습니다.
llama.cpp 프로젝트에 추론 노력 수준(reasoning effort levels)을 조절할 수 있는 Thinking 모드 토글과 개선된 채팅 폼 UI가 추가되었습니다. 모델의 사고 과정을 감지하고 제어할 수 있는 기능과 함께 다양한 플랫폼용 바이너리 업데이트가 포함되었습니다.
llama.cpp의 Hexagon DSP 최적화 업데이트로, 행렬 곱셈(matmul), Flash Attention, GDN 연산의 성능을 개선하고 중복 로직을 제거했습니다. Qwen3.5-2B 모델의 특정 오류를 수정하고 다양한 데이터 타입에 대한 효율적인 커널 라우팅을 지원합니다.
llama.cpp 서버에 실시간 추론 중단 기능을 위한 제어 엔드포인트를 도입했습니다. TOCTOU 문제를 방지하기 위해 슬롯 ID 대신 채팅 완료 ID를 사용하여 추론 제어의 정확성을 높였으며, UI에서 사고 단계(thinking phase)를 추적할 수 있는 기능을 추가했습니다.
llama.cpp 프로젝트의 speculative decoding 관련 업데이트 사항을 담고 있습니다. n_outputs_max 로직 수정, draft-simple 자동 활성화 제거 및 다양한 플랫폼용 바이너리 릴리즈를 포함합니다.