Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp의 OpenCL 백엔드에서 cl_khr_integer_dot_product를 지원하지 않는 장치에 대한 버그를 수정했습니다. 이를 통해 특정 기능이 없는 환경에서도 백엔드 초기화 실패를 방지하고 안정성을 높였습니다.
llama.cpp 프로젝트에 Tencent Hunyuan 3(Hy3) 아키텍처 지원이 추가되었습니다. MTP speculative decoding을 지원하며, MoE(Mixture-of-Experts) 구조를 갖춘 Hy3 모델을 GGUF 형식으로 사용할 수 있습니다.
llama.cpp 프로젝트에서 Intel Battlemage 및 Xe2 아키텍처를 감지하여 fattn_vec_nthreads 값을 256으로 최적화하는 업데이트가 진행되었습니다. 기존 Alchemist 권장값인 128은 유지하며 하드웨어별 맞춤 설정을 지원합니다.
llama.cpp 프로젝트에서 특정 조건 시 로그 메시지가 유실되는 문제를 해결하기 위해 종료 전 로그 플러시(Flush) 기능을 추가했습니다. 이 패치는 macOS, Linux, Android 등 다양한 플랫폼의 최신 바이너리에 반영되었습니다.
ggml 라이브러리의 모든 컨볼루션 연산(conv ops)에 대해 im2col dst_type을 통일하는 업데이트가 진행되었습니다. im2col_f16 로직을 수정하여 모든 커널 타입을 허용하도록 개선되었습니다.
llama.cpp 프로젝트의 export-graph-ops 테스트 과정에서 인자 없이 호출될 때 발생하던 세그멘테이션 결함(segfault)을 수정했습니다. 이번 업데이트를 통해 다양한 OS 환경에서 보다 안정적인 테스트 실행이 가능해졌습니다.
llama.cpp의 tokenize 도구가 공통 인자(common args)를 사용하도록 마이그레이션되었습니다. 이를 통해 argv 파싱, Windows UTF-8 처리 및 파일 읽기 기능이 공통 헬퍼로 통합되어 사용 방식의 일관성을 확보했습니다.
llama.cpp의 Vulkan 및 CPU 백엔드에서 f16 SET_ROWS 소스에 대한 완전한 지원을 추가했습니다. Intel 환경의 오류 수정과 오차 임계값 조정, Metal 지원 업데이트를 포함합니다.
llama.cpp의 서버 모드에서 프롬프트 캐시 상태 소유권을 리팩토링하는 업데이트가 진행되었습니다. 프롬프트 삭제 시 체크포인트를 함께 정리하고 관련 데이터를 server_prompt_cache로 이동하여 효율성을 높였습니다.
llama.cpp 프로젝트에서 oneDNN graph API와 XMX 엔진을 활용한 Flash Attention 구현 PR이 공개되었습니다. 이를 통해 Battlemage(Xe2) 아키텍처 기반의 prefill 속도가 대폭 향상되었으며, 멀티 디바이스 동기화 기능이 추가되었습니다.
llama.cpp의 SYCL 구현에서 USM 시스템 할당을 위한 최소 버퍼 크기 임계값을 1 GiB에서 4 GiB로 상향 조정했습니다. 이는 가용 VRAM보다 큰 모델을 실행할 때 발생하는 디바이스 메모리 오버커밋 문제를 개선하기 위함입니다.
llama.cpp 프로젝트에서 CUDA를 사용한 양자화된 연결(quantized concat) 시 텐서 연속성 요구 사항을 완화하는 업데이트가 진행되었습니다. 이를 통해 비연속적 텐서에 대한 지원이 강화되었으며 관련 테스트 케이스가 추가되었습니다.
llama.cpp 프로젝트에서 CUDA 기반의 GGML_OP_LIGHTNING_INDEXER 구현을 포함한 업데이트가 진행되었습니다. generic vector kernel과 wmma kernel을 활용하여 성능을 최적화하고, 아키텍처 요구 사항을 Turing으로 완화하는 등의 개선이 포함되었습니다.
llama.cpp 프로젝트에서 Adreno A7x GPU의 컴파일러 오류로 인한 MoE 커널 문제를 해결하기 위해 일부 커널 사용을 제외했습니다. 특정 장치에서 가중치가 손상되어 잘못된 출력이 발생하는 현상을 방지하기 위한 업데이트입니다.
Adreno 850 GPU의 컴파일러 호환성 문제를 해결하기 위해 FA 및 MoE 가중치 리팩(repack) 기능을 비활성화하는 워크아라운드가 적용되었습니다. 또한 DX 컴파일러 버전 파싱 로직을 수정하여 안정성을 높였습니다.
llama.cpp의 ggml-cuda 라이브러리에서 HIP 빌드 시 통합 GPU(integrated GPU) 속성이 잘못 설정되던 문제를 해결했습니다. 기존의 임시 방편이 CUDA 빌드에만 적용되도록 수정하여 AMD ROCm 환경에서의 호스트 버퍼 사용 문제를 복구했습니다.
llama.cpp 서버에서 비어 있거나 존재하지 않는 Origin 헤더를 무시하도록 업데이트되었습니다. 이를 통해 불필요한 CORS 관련 경고 메시지가 발생하는 문제를 해결했습니다.
llama.cpp 프로젝트에서 CUDA 가상 장치(Virtual Devices) 지원 기능이 추가되었습니다. 가상 장치 사용 시 NCCL 경로를 비활성화하고 관련 레이블 및 CI 작업을 포함한 코드 리팩터링이 진행되었습니다.
KleidiAI가 커널 디스패치 과정에서 SME와 SME2를 구분하도록 업데이트되었습니다. 이를 통해 하드웨어 지원 여부에 따라 적절한 커널을 연결하여 SME(v1) 환경에서의 오작동을 방지합니다.
llama.cpp의 Hexagon 가속기 지원을 위한 L2 캐시 처리 로직 재설계 및 성능 최적화 업데이트입니다. 지연 플러싱과 dirty bit 추적을 통해 캐시 효율을 높이고, MUL_MAT 커널 및 워크 큐 API를 개선했습니다.