Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp의 서버 기능에서 체크포인트 생성 로직을 개선했습니다. 채팅 템플릿 기반의 프롬프트 토큰 위치 탐색과 컨텍스트 체크포인트 생성을 통해 효율적인 프롬프트 배칭을 지원합니다.
SYCL에서 MoE prefill 처리량을 개선하기 위한 최적화 작업이 진행되었습니다. 기존의 복잡한 매핑 방식을 카운팅 정렬 기반의 연속적 매핑 방식으로 교체하여 연산 효율을 높였습니다.
Vulkan 백엔드에서 Snake 활성화 함수를 위한 연산 융합(Operator Fusion) 기능을 추가했습니다. 5개의 개별 연산을 단일 요소별 커널로 재작성하여 F32, F16, BF16 파이프라인에서 성능을 최적화합니다.
/slots 엔드포인트의 JSON 응답에 프롬프트 토큰 관련 필드들을 추가합니다. 이를 통해 클라이언트가 프롬프트 평가 진행 상황을 실시간으로 모니터링할 수 있습니다.
llama.cpp의 Metal 커널 최적화 및 테스트 확장 업데이트입니다. concat 커널의 row batching을 통해 GPU 점유율을 높이고, CPY 연산의 다양한 텐서 형상 지원을 위한 테스트 케이스를 대폭 강화했습니다.
server_context_impl의 destroy() 함수에서 추측 디코더와 MTP 관련 리소스를 해제하지 않아 발생하던 VRAM 누수 문제를 해결했습니다. 절전 모드 진입 시 명시적인 리셋 과정을 추가하여 메모리 부족(OOM) 오류와 use-after-free 문제를 방지합니다.
HuggingFaceBio의 Carbon-3B 모델을 지원하기 위해 HybridDNATokenizer를 위한 새로운 BPE 프리타입을 추가했습니다. DNA 염기 서열을 6-mer 단위로 청킹하고 처리하는 로직을 llama.cpp 컨벤션에 맞춰 구현하고 리팩터링했습니다.
llama-graph에서 SWA(Sliding Window Attention) 전용 모델 사용 시 발생하는 null-buffer 충돌 문제를 해결했습니다. 특정 레이어가 존재하지 않을 때 백엔드 스케줄러가 버퍼를 할당하지 않아 발생하는 assertion 오류와 null-dereference 문제를 방지하기 위한 가드를 추가했습니다.
NVIDIA Hopper+ 아키텍처 GPU의 성능 최적화를 위해 Programmatic Dependent Launch(PDL) 기능을 도입하고 다양한 커널을 등록했습니다. PDL을 통해 커널 간 실행 중첩과 효율적인 동기화를 구현하며, Hopper+ 외의 아키텍처(Ada 등)에서의 성능 저하 및 컴파일 문제를 방지하기 위한 보호 로직을 포함합니다.
Hugging Face 프로젝트에서 Llama 모델을 실행하기 위한 통합 실행 파일 도입을 위한 변경 사항이 반영되었습니다. 서버용 serve 기능이 추가되었으며, macOS, Linux, Android, Windows, openEuler 등 다양한 운영체제와 하드웨어 가속(CUDA, Vulkan, ROCm, OpenVINO 등)을 지원합니다.
llama.cpp 프로젝트의 MTP(Multi-Token Prediction) 및 투기적 디코딩(Speculative Decoding) 관련 기술적 업데이트 사항을 정리한 내용입니다. 순환 메모리(Recurrent Memory)의 부분 롤백 기능 개선, ngram 및 초안(draft) 설정 최적화, 그리고 다양한 운영체제 및 하드웨어 가속을 위한 빌드 지원 범위 확대를 포함합니다.
Hexagon HTP 연산 지원을 위해 ggml에 TRI HVX 커널이 추가되었습니다. 이번 업데이트에는 TRI 연산에 대한 PR 리뷰 반영과 함께 코드 포맷팅 및 중복 연산 제거 등 다양한 최적화 작업이 포함되었습니다.
llama.cpp b9221 릴리스에서는 Hexagon HTP 백엔드를 위한 HVX 벡터화 커널 기반의 PAD 연산 지원이 추가되었습니다. 이를 통해 제로 패딩 및 순환 패딩을 4개 텐서 차원 전체에서 지원하며, macOS, Linux, Android, Windows, openEuler 등 다양한 플랫폼에 대한 지원 업데이트가 포함되었습니다.
본 변경 사항은 ggml-vulkan 프로젝트의 CMakeLists에 SPIRV-Headers를 검색하는 로직을 추가하여 빌드 및 구성 안정성을 높이는 것을 목표로 합니다. 특히 CI 환경에서 파일들이 예상치 못한 경로(vulkan/)에 위치할 수 있는 문제를 해결하고, 이를 통해 필요한 SPIRV-Headers를 성공적으로 찾을 수 있도록 수정되었습니다. 이 변경은 macOS, Linux, Android, Windows 등 광범위한 플랫폼과 다양한 하드웨어/API 조합(CUDA, Vulkan, SYCL, ROCm 등)에서 프로젝트의 빌드 및 구성 오류를 방지하는 데 기여합니다.
llama-server의 CLI 인자 `--embd-normalize` 플래그가 임베딩 및 디버그 예제에만 등록되어 있어, 서버가 이를 거부하고 기본값(L2)을 사용하던 문제를 해결했습니다. 이 변경 사항은 `LLAMA_EXAMPLE_SERVER`를 업데이트하여 해당 플래그의 예제 세트에 추가하고, 핸들러가 파라미터에서 `embd_normalize` 값을 읽도록 수정함으로써 이루어졌습니다. 요청 본문에 포함된
본 기술 기사는 llama와 spec 관련 기능에 대한 대규모 업데이트 내용을 다루고 있습니다. 주요 내용은 MTP(Multi-Turn Prompting) 지원 강화, speculative decoding의 개선을 위한 GDN 중간 상태 저장 및 부분 롤백 기능을 추가한 것입니다. 또한, 다양한 플랫폼과 아키텍처(macOS, Linux, Windows, Android 등)에 대한 광범위한 호환성 및 최적화 작업이 진행되었으며, 여러 백엔드와 프레임워크 전반에 걸쳐 코드 수정 및 기능 개선이 이루어졌습니다.
이 기술 기사는 ggml-webgpu 프로젝트의 NVIDIA 자체 호스팅 CI 활성화에 대한 내용을 다루고 있습니다. 주요 작업으로는 주소 정밀도 문제 해결, 배치(placement) 수정, f16 포맷팅 및 명명 규칙 완화 시도 등이 포함됩니다. 또한 macOS, Linux, Android, Windows, openEuler 등 다양한 플랫폼과 아키텍처를 지원하기 위한 광범위한 CI 환경 구성을 보여줍니다.
이 기술 기사는 HIP를 사용하여 RDNA3 아키텍처에서 CUDA mma FA 커널을 지원하고 AMD 튜닝을 개선한 내용을 다룹니다. 특히 VKQ(Vector Quantization)의 FP16 누산 작업 시 RDNA3 텐서 코어를 활용하기 위해 타일 크기 조건을 정의했으며, 헤드 크기에 따른 적절한 누산 방식을 적용했습니다. 또한 RDNA3/4 및 CDNA1에 대한 커널 파라미터 튜닝을 통해 성능 개선 사항과 제약 조건(예: 헤드 크기가 128보다 클 때의 성능 한계)을 발견하고 새로운 데이터 레이아웃 항목을 추가했습니다.
본 커밋은 Qwen3.5 모델의 유니코드 토크나이저 처리를 강화하고 회귀 테스트를 추가하는 내용을 담고 있습니다. 특히 `src/unicode.cpp`에 Qwen3.5의 [l{l}l}]+ 정규식(문자 + 결합 문자)을 위한 non-backtracking handler를 추가하여, 긴 입력값에서 발생할 수 있는 스택 오버플로를 방지합니다. 또한 악센트 기호 포함 및 후행 공백 제거 등 전반적인 토큰화 처리의 견고성을 높였습니다.
본 기술 기사는 SYCL 백엔드에서 GPU 메모리 할당 방식을 개선하고, 특히 Intel Arc Pro B70과 같은 멀티 GPU 시스템에서 발생했던 시스템 RAM 고갈(OOM) 문제를 해결한 내용을 다룹니다. 기존의 `sycl::malloc_device`는 VRAM 할당을 시스템 RAM에 1:1로 미러링하여 과도한 메모리 소비를 유발했지만, 새로운 `zeMemAllocDevice` 사용은 호스트 스테이징 없이 P2P 경로를 사용하여 시스템 RAM 사용량을 크게 줄였습니다. 또한, 코드의 안정성과 유지보수성을 높이기 위해 try/catch 제거, 공통 헬퍼 함수 통합, 그리고 Level Zero 지원을 위한 컴파일 및 런타임 플래그 추가 등의 리팩토링 작업도 진행되었습니다.