Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp의 양자화 과정에서 DeepSeek-V4의 i32 타입 라우팅 테이블이 포함되어 발생하던 오류를 수정했습니다. 해당 텐서는 가중치가 아닌 인덱스 테이블이므로 양자화 대상에서 제외되도록 조치했습니다.
llama.cpp 프로젝트에서 DFlash 모델을 위한 K/V 캐시 주입 회전(injection rotation) 기능이 추가되었습니다. 이는 K/V 양자화 사용 시 효율적인 캐시 관리를 지원합니다.
서버가 이제 클라이언트로부터 nullable 파라미터(temperature, top_p 등)에 null 값을 받아들이고 기본값을 요청할 수 있도록 기능을 확장했습니다. 이는 OpenAI 사양 및 json_value 규칙과 일치하며, 필드 평가 가드에서 null을 건너뛰기 위해 has_field()가 has_value()로 변경되었습니다.
UGM 토크나이저의 OOB 읽기 문제를 해결하는 업데이트가 이루어졌습니다. 이 수정은 악성 T5/UGM GGUF 파일로 인한 힙 버퍼 오버플로우 취약점을 방지합니다. 주요 변경 사항으로는 최소 크기 유효성 검사 추가와 안전한 문자열 길이 함수 사용이 포함됩니다.
llama.cpp의 SYCL 백엔드에서 DMMV 경로의 K_QUANTS_PER_ITERATION을 1로 설정하여 GPU 활용도를 개선했습니다. 이를 통해 재정렬(reorder) 기능의 제한을 해제하고 B70 환경에서 추론 성능(t/s)을 크게 향상시켰습니다.
llama.cpp 프로젝트에서 OpenCL을 활용한 Flash Attention 디코딩 성능 최적화 작업이 진행되었습니다. 다양한 양자화 형식(f16, q8_0, q4_0)에 대한 커널 개선과 Gemma-4 모델을 위한 DK=512 환경 최적화가 포함되었습니다.
llama.cpp의 Metal 백엔드에 col2im_1d 연산(f32/f16/bf16)을 추가했습니다. CPU 및 CUDA 경로와 동일한 동작을 보장하며, Apple Silicon 환경에서의 연산 효율성을 높였습니다.
llama.cpp 프로젝트의 CUDA 관련 업데이트 사항을 담고 있습니다. cuBLAS 리팩토링, CDNA 및 BF16 로직 수정, 그리고 다양한 플랫폼용 바이너리 릴리즈를 포함합니다.
llama.cpp의 ggml-cpu에서 AIX 환경의 세그멘테이션 결함을 방지하기 위해 타일형 행렬 곱셈(tiled matmul)의 버퍼 점유율을 최적화했습니다. 이를 통해 AIX 환경에서도 타일형 경로를 안정적으로 사용할 수 있게 되었습니다.
ggml 라이브러리에서 MoE 모델 사용 시 텐서 병렬화와 CPU 오프로딩 옵션이 충돌하여 발생하는 어설션 오류를 수정했습니다. 미러링된 비연속적 텐서가 웜업 단계에서 중단되던 문제를 해결하여 안정성을 높였습니다.
llama.cpp에서 K/V rotation 입력 시 버퍼가 할당되지 않았을 경우 발생하는 중단 문제를 해결하기 위한 가드 로직을 추가했습니다. Speculative decoding 과정에서 텐서 버퍼가 NULL인 상태로 함수가 호출되어 발생하는 오류를 방지합니다.
llama.cpp에서 288명의 전문가를 가진 MoE 모델을 위해 topk-moe fusion을 활성화하는 업데이트가 적용되었습니다. 이를 통해 디코드 단계에서 발생하는 불필요한 그래프 노드를 줄여 성능을 최적화합니다.
llama.cpp의 서버 및 UI에서 느린 prefill 과정 중 연결이 끊기지 않도록 SSE(Server-Sent Events) 핑 메커니즘을 개선했습니다. 1초마다 핑을 보내고 3초 후 연결을 유지하도록 설정하여 안정적인 스트리밍을 지원합니다.
llama.cpp 프로젝트에서 gated_delta_net 연산 시 발생하는 불필요한 CUDA 복사 과정을 제거하여 성능을 최적화했습니다. 중간 테일 쓰기와 복사 커널을 건너뛰고 CUDA 커널이 순환 캐시에 직접 기록하도록 개선되었습니다.
llama.cpp 프로젝트의 Hexagon 아키텍처용 Flash Attention 구현을 최적화하고 정확도를 개선한 업데이트입니다. 양자화 작업 통합, 메모리 DMA 디스패치 정리, 커널 리팩토링 등을 통해 성능을 높였습니다.
llama.cpp 프로젝트에서 Qwen3 및 Qwen-coder-next 모델 지원을 위한 업데이트가 진행되었습니다. 레이어 처리 루프 수정 및 어텐션 정규화를 위한 텐서 추가가 포함되었습니다.
llama.cpp 프로젝트에 DeepSeek V4 모델 지원을 위한 업데이트가 반영되었습니다. 모델 변환, 기본 설정, 상태 저장 및 로드 기능과 함께 성능 최적화를 위한 다양한 버그 수정 및 코드 정리가 포함되었습니다.
llama.cpp 프로젝트에서 MiniCPM5 모델을 위한 전용 도구 호출(tool call) 파서를 구현하고 리팩토링했습니다. PEG 파서 개선 및 Jinja2 템플릿 호환성 수정을 통해 모델의 도구 사용 능력을 최적화했습니다.
llama.cpp 프로젝트에서 OpenCL을 활용한 Flash Attention 커널 개선 사항을 반영했습니다. f16, f32 및 양자화된 q4_0, q8_0 형식을 지원하며, 패딩 및 마스킹 최적화를 통해 연산 효율을 높였습니다.
llama.cpp의 CUDA 구현에서 ggml_cuda_cpy에 cudaMemcpy2DAsync 패스트 패스를 추가하여 성능을 최적화했습니다. 텐서가 완전히 연속적이지 않은 경우에도 요소별 스칼라 복사 대신 비동기 2D 복사를 사용하여 효율성을 높였습니다.