Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp의 Vulkan 백엔드 업데이트를 통해 Intel GPU를 위한 fwht 지원이 추가되었습니다. shmem reduction 기술을 활용하며, 다양한 OS 및 하드웨어 환경을 위한 최신 바이너리 릴리즈를 포함합니다.
llama.cpp 프로젝트에서 CUDA 백엔드의 multi-column MMVQ 최적화 로직을 SYCL로 포팅했습니다. 이를 통해 다양한 양자화 유형을 지원하며, 작은 멀티 컬럼 배치에서도 가중치 재정렬 커널이 작동하도록 개선되었습니다.
llama.cpp의 b9503 버전이 릴리스되었습니다. 이번 업데이트에서는 Gemma 4 오디오 프로젝터의 임베딩 크기 처리 관련 버그 수정이 포함되었습니다.
ggml 라이브러리에서 WASM SIMD128 인트린직을 사용하여 q4_1_q8_1 벡터 연산을 최적화했습니다. 이를 통해 WebAssembly 환경에서의 연산 속도를 기존 스칼라 구현 대비 약 3.42배 향상시켰습니다.
llama.cpp의 server 모듈에서 새로운 토큰이 존재할 경우 불필요한 체크포인트 복구가 발생하는 문제를 해결했습니다. 새로운 토큰이 없을 때만 조건부로 계산을 적용하여 중복되는 KV 상태 복구를 방지합니다.
ggml-webgpu의 FlashAttention 리팩터링과 양자화 지원 표준화에 관한 업데이트입니다. K/V 양자화 분리 및 타일 경로에 양자화 로직을 추가하여 성능과 구조를 개선했습니다.
llama.cpp의 ggml-cpu 라이브러리에서 RVV(RISC-V Vector) 양자화 벡터 내적 연산을 더 높은 VLENs(512b, 1024b)로 확장하는 업데이트가 진행되었습니다. 다양한 양자화 방식(iq4_xs, q6_K 등)에 대한 구현이 추가되어 RISC-V 환경에서의 추론 성능 최적화를 목표로 합니다.
llama.cpp 프로젝트에서 PDL 사용 시 발생하는 레이스 컨디션을 방지하기 위해 restrict 키워드를 비활성화하는 업데이트가 진행되었습니다. 아키텍처별 전처리기 지시문을 통해 성능 저하를 최소화하며, hopper 아키텍처에 대한 지원도 추가되었습니다.
llama.cpp의 b9488 릴리스 노트로, Qwen3 SSM 아키텍처 지원이 추가되었습니다. macOS, Linux, Android, Windows 등 다양한 플랫폼을 위한 바이너리 배포가 포함되어 있습니다.
llama.cpp 프로젝트에서 IBM의 Granite Multilingual Embeddings R2 모델 지원을 추가했습니다. 97m 및 311m 파라미터 모델을 위한 토크나이저 설정, SwiGLU FFN 지원, GGUF 키 업데이트 등 기술적 구현 사항을 포함합니다.
llama.cpp의 common_prompt_batch_decode 과정에서 발생하는 세션 상태 저장 및 복구 오류를 수정했습니다. session_tokens 저장 시 토큰 개수를 n개로 조정하여 동일 토큰이 잘못된 위치에서 재생되는 버그를 해결했습니다.
llama.cpp 프로젝트에 추론 노력 수준(reasoning effort levels)을 조절할 수 있는 Thinking 모드 토글과 개선된 채팅 폼 UI가 추가되었습니다. 모델의 사고 과정을 감지하고 제어할 수 있는 기능과 함께 다양한 플랫폼용 바이너리 업데이트가 포함되었습니다.
llama.cpp의 Hexagon DSP 최적화 업데이트로, 행렬 곱셈(matmul), Flash Attention, GDN 연산의 성능을 개선하고 중복 로직을 제거했습니다. Qwen3.5-2B 모델의 특정 오류를 수정하고 다양한 데이터 타입에 대한 효율적인 커널 라우팅을 지원합니다.
llama.cpp 서버에 실시간 추론 중단 기능을 위한 제어 엔드포인트를 도입했습니다. TOCTOU 문제를 방지하기 위해 슬롯 ID 대신 채팅 완료 ID를 사용하여 추론 제어의 정확성을 높였으며, UI에서 사고 단계(thinking phase)를 추적할 수 있는 기능을 추가했습니다.
llama.cpp 프로젝트의 speculative decoding 관련 업데이트 사항을 담고 있습니다. n_outputs_max 로직 수정, draft-simple 자동 활성화 제거 및 다양한 플랫폼용 바이너리 릴리즈를 포함합니다.
llama.cpp의 llama_context 최대 출력 제한 관련 업데이트 사항을 다룹니다. VRAM 절약을 위한 메모리 예약 최적화와 n_outputs 관련 파라미터 조정이 포함되었습니다.
llama.cpp의 Metal 커널 업데이트를 통해 GLU 커널을 템플릿화하여 f16 및 f32 지원을 강화했습니다. 메모리 대역폭 효율을 위해 네이티브 타입을 사용하면서도, 수치 안정성을 위해 실제 연산은 float로 수행하도록 최적화되었습니다.
llama.cpp 프로젝트에 EXAONE 4.5 모델 구현이 추가되었습니다. GQA 지원, 비전 마커 처리, Qwen2.5-VL 스타일의 인코딩 경로 라우팅 등 멀티모달 기능을 위한 기술적 업데이트가 포함되었습니다.
llama.cpp의 Vulkan 백엔드에서 Q3_K/Q6_K 양자화 데이터의 블록 로드 및 32비트 정수 뺄셈 최적화를 구현했습니다. 이를 통해 Intel BMG 및 Xe2 아키텍처에서 상당한 성능 향상을 달성했습니다.
llama.cpp의 벤치마크 도구인 llama-bench에서 `-fa auto` 옵션 지원이 추가되었습니다. 또한 `-ngl` 기본값을 -1로 설정하고 README를 업데이트하여 사용 편의성을 높였습니다.