Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp 프로젝트에서 cohere2-MoE 아키텍처 지원을 추가하는 업데이트가 진행되었습니다. MoE 구조를 위한 텐서 수정, 토크나이저 업데이트, 전문가 결합 방식 변경 등 다양한 기술적 최적화가 포함되었습니다.
llama.cpp 프로젝트의 서버 정적 자산(static assets) 처리 방식이 개선되었습니다. 파일 이름 처리 단순화 및 UI 자산의 아카이브 번들링 작업이 포함되었습니다.
llama.cpp의 Vulkan 백엔드에서 비연속적(non-contiguous) unary/glu 연산을 지원하도록 업데이트되었습니다. 인덱스 계산 최적화를 위해 fastdiv를 도입하고, 연산 코드의 구조를 개선하여 효율성을 높였습니다.
llama.cpp 프로젝트의 jinja 템플릿 처리 관련 버그 수정 사항을 담고 있습니다. 첫 번째 인자가 빈 값일 때 split 및 replace 동작이 비정상적으로 작동하던 문제를 해결하고 예약 크기를 수정했습니다.
llama.cpp에서 LFM2/LFM2.5 모델이 json_schema를 무시하던 버그를 수정했습니다. 기존에는 템플릿 핸들러가 도구 호출용 문법만 생성하여 response_format 설정을 반영하지 못했으나, 이번 업데이트로 해결되었습니다.
llama.cpp 프로젝트에서 MTP(Multi-Token Prediction)를 위한 패딩 제거 및 D2D 복사 최적화 작업이 진행되었습니다. ggml_gated_delta_net의 연산 파라미터 수정과 단일 strided ggml_cpy를 통한 캐시 복사 효율화를 포함합니다.
llama.cpp 프로젝트의 SYCL 백엔드를 위한 CI 빌드 및 릴리스 프로세스를 개선했습니다. GitHub 캐시 관리, ccache 최적화, OS별 빌드 설정 수정을 통해 빌드 안정성을 높였습니다.
llama.cpp 프로젝트에 EAGLE3 투기적 디코딩(speculative decoding) 지원이 추가되었습니다. 이번 업데이트를 통해 Gemma4 모델에 대한 EAGLE3 지원과 함께 다양한 파라미터 버그 수정 및 아키텍처 최적화가 이루어졌습니다.
ggml 라이브러리의 CUDA 백엔드에서 스칼라 타입에 대한 연결(concat) 기능을 지원합니다. 또한 concat.cu 업데이트와 Metal CI 이슈 수정을 포함한 llama.cpp의 최신 빌드를 제공합니다.
llama.cpp의 ggml 라이브러리에 1D 전치 합성곱(ConvTranspose1d)을 처리하는 GGML_OP_COL2IM_1D 연산이 추가되었습니다. 이 커널은 오버랩-덧셈 방식을 사용하여 계산 효율성을 높였으며, CPU 백엔드에서 F32, F16, BF16 등 다양한 정밀도를 지원합니다. 테스트 케이스와 내부 검증 로직도 대폭 강화되어 안정성이 향상되었습니다.
llama.cpp의 b9577 릴리스가 발표되었으며, 주요 업데이트 사항으로 `--log-prompts-dir` 플래그를 추가하여 프롬프트 기록 기능을 제공합니다. 이 기능은 각 프롬프트를 지정된 디렉토리에 별도의 텍스트 파일로 저장할 수 있게 합니다.
llama.cpp의 서버 기능에서 통합 KV 캐시를 사용할 때 유휴 슬롯을 RAM으로 내보내는 최적화 작업이 포함되었습니다. 이를 통해 VRAM 캐시 누락을 방지하고 불필요한 전처리를 줄여 효율성을 높였습니다.
llama.cpp 프로젝트에서 SWA(Sliding Window Attention) 전용 초안 헤드 사용 시 발생하는 kq_mask 버퍼 어설션 오류를 수정했습니다. set_input 및 can_reuse 단계에서 각 마스크를 자체 버퍼로 보호하도록 개선되었습니다.
llama.cpp 프로젝트에서 비디오 입력 지원을 위한 mtmd 기능이 추가되었습니다. 서버의 base64 입력 지원, 타임스탬프 추가, CLI 업데이트 등 비디오 처리를 위한 다양한 기능이 포함되었습니다.
llama.cpp의 Vulkan 백엔드에서 B 행렬 로드 시 cm2 decode_vector를 사용하여 성능을 최적화하는 업데이트가 적용되었습니다. vec4 로드 기능과 BK 증가를 결합하여 상당한 속도 향상을 기대할 수 있습니다.
llama.cpp의 최신 업데이트를 통해 CUDA 메모리 관리 로직이 개선되었습니다. 활성화된 백엔드가 없는 경우 디바이스를 재설정하고, 디바이스 및 호스트 버퍼 카운팅 기능을 추가했습니다.
llama.cpp의 샘플러 이름 매칭 로직을 개선하여 표준 이름과 대체 이름(alias) 간의 호환성을 높였습니다. 대소문자 구분 없이 샘플러 이름을 인식하도록 수정하여 llama-server UI에서의 설정 오류 문제를 해결했습니다.
llama.cpp의 kv-cache 셀 공유 시 발생하는 크기 불일치 및 어설션 오류를 해결하는 업데이트입니다. 맞춤형 타겟 컨텍스트가 초안 기본값보다 작을 때 K/V 텐서가 넘쳐흐르는 문제를 수정했습니다.
llama.cpp 프로젝트에서 Qwen-VL 기반 모델을 위한 'frame merge' 기능을 지원합니다. 이번 업데이트를 통해 Qwen3.5 모델의 비디오 지원이 추가되었으며, 다양한 플랫폼용 바이너리 릴리즈가 포함되었습니다.
llama.cpp의 OpenCL 커널 성능 개선 사항을 담은 업데이트입니다. get_rows, cpy, concat 및 q6_k flat gemv 연산의 최적화를 통해 연산 효율을 높였으며, 다양한 OS 및 하드웨어 환경을 위한 바이너리를 제공합니다.