Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp 프로젝트에서 OpenCL을 활용한 Flash Attention 커널 개선 사항을 반영했습니다. f16, f32 및 양자화된 q4_0, q8_0 형식을 지원하며, 패딩 및 마스킹 최적화를 통해 연산 효율을 높였습니다.
llama.cpp의 CUDA 구현에서 ggml_cuda_cpy에 cudaMemcpy2DAsync 패스트 패스를 추가하여 성능을 최적화했습니다. 텐서가 완전히 연속적이지 않은 경우에도 요소별 스칼라 복사 대신 비동기 2D 복사를 사용하여 효율성을 높였습니다.
llama.cpp 프로젝트에서 분할 계산(split compute) 시 발생하는 동기화(synchronization)를 줄이기 위한 최적화 작업이 도입되었습니다. CUDA 백엔드에서 비동기 복사 기능을 강화하여 토큰 간 동기화 오버헤드를 감소시키고 성능을 향상시킵니다.
llama.cpp 프로젝트에서 OpenVINO를 2026.2.1 버전으로 업데이트하고 독립형 릴리스 패키지를 지원합니다. 연산자 개선 및 백엔드 최적화를 통해 성능과 호환성을 높였습니다.
llama.cpp의 SYCL 백엔드에서 듀얼 GPU를 위한 텐서 병렬성(--split-mode tensor) 지원이 추가되었습니다. 데이터 크기에 따라 FP32 직접 복사 또는 BF16 압축 방식을 선택하여 PCIe 대역폭 효율을 최적화합니다.
llama.cpp 프로젝트에서 Hexagon 아키텍처를 위한 MUL_MAT 및 MUL_MAT_ID 연산을 대폭 재작업했습니다. 32x32 타일형 가중치 리팩토링, HVX 레지스터 최적화, DMA 정렬 등을 통해 연산 효율성을 극대화했습니다.
llama.cpp의 Vulkan 셰이더 컴파일 과정에서 발생하는 빌드 오류 감지 로직을 개선했습니다. 기존에는 셰이더 컴파일 실패 시에도 빌드가 성공으로 처리되어 손상된 라이브러리가 생성될 위험이 있었으나, 이제는 종료 코드를 정확히 확인하여 빌드를 중단합니다.
llama.cpp의 b9767 버전 릴리스 노트입니다. ggml-webgpu의 소규모 배치 디코딩 성능을 개선하고 다양한 운영체제 및 하드웨어 아키텍처를 위한 바이너리를 제공합니다.
llama.cpp의 Vulkan 백엔드에서 결과 확인 및 테스트 옵션 활성화 시 발생하는 링크 오류를 수정했습니다. 특정 옵션 사용 시 CPU 참조 그래프 계산을 위해 필요한 ggml-cpu 라이브러리를 자동으로 링크하도록 개선되었습니다.
llama.cpp의 서버 기능 업데이트로 모델 다운로드가 전용 자식 프로세스로 이동되었습니다. SSE를 통한 실시간 로드 진행 상황 추적 기능이 추가되었으며, 다양한 OS 및 아키텍처를 위한 최신 바이너리가 배포되었습니다.
llama.cpp 프로젝트에서 Step3.5/3.7 Flash MTP3 지원을 위한 업데이트가 진행되었습니다. MTP 레이어 오프셋 추가, 추측적 멀티 헤드(speculative multi-head) 프로세스 구현 등 추론 성능 최적화를 위한 다양한 API와 기능이 포함되었습니다.
llama.cpp의 Windows 환경에서 test-args-parser가 무작위로 실패하던 문제를 해결하기 위한 수정 사항입니다. Windows의 UTF-8 인자 처리 과정에서 프로그래밍 방식으로 생성된 argv가 덮어씌워지는 현상을 방지합니다.
llama.cpp의 GLM-DSA 로더가 인덱서 텐서를 선택적으로 로드할 수 있도록 업데이트되었습니다. 이를 통해 일부 레이어에만 인덱서가 포함된 GLM-5.2 GGUF 모델 로드 시 발생하던 오류를 해결했습니다.
llama.cpp 프로젝트에서 Qwen 3.5 및 3.6 모델을 위한 eagle3 지원 기능이 추가되었습니다. 하이브리드 모델을 위한 지연된 경계 체크포인트 복구 기능을 포함하며, 다양한 OS 환경을 위한 바이너리 업데이트가 함께 제공됩니다.
ggml-cpu의 Power10 MMA Q8/Q4 행렬 곱셈(matmul)에서 K tails를 지원하도록 패치되었습니다. 이를 통해 K가 kc로 나누어떨어져야 했던 제약이 제거되어 더 많은 워크로드가 MMA 커널을 사용할 수 있게 되었습니다.
llama.cpp의 서버 엔드포인트에 'X-Accel-Buffering: no' 헤더를 추가하여 Nginx 리버스 프록시의 응답 버퍼링 문제를 해결했습니다. 이를 통해 스트리밍 응답이 끊기지 않고 원활하게 전달되도록 개선되었습니다.
llama.cpp 프로젝트에서 Metal API를 위한 rope_back 연산자를 구현했습니다. 기존 RoPE 커널을 함수 상수를 활용해 재사용함으로써 순방향과 역방향 회전을 전환할 수 있게 하여 코드 중복을 방지했습니다.
llama.cpp의 Metal 백엔드에서 concat 연산자가 f16 및 bf16 텐서 타입을 지원하도록 업데이트되었습니다. 이를 통해 Apple Silicon 환경에서 다양한 데이터 타입에 대한 연산 효율성을 높였습니다.
llama.cpp의 SYCL 백엔드에 선택적 USM(Unified Shared Memory) 시스템 할당 기능이 추가되었습니다. 이 기능을 통해 대규모 GPU 버퍼를 시스템 메모리에서 할당하여 VRAM 용량 한계를 극복할 수 있습니다.
llama.cpp의 llama-graph에서 NVFP4 관련 엣지 케이스를 수정하고 build_ffn 지원 조합을 제한하는 업데이트가 진행되었습니다. LoRA의 역양자화 및 편향 추가 시점을 조정하여 연산 정확도를 개선했습니다.