Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Adreno 850 GPU의 컴파일러 호환성 문제를 해결하기 위해 FA 및 MoE 가중치 리팩(repack) 기능을 비활성화하는 워크아라운드가 적용되었습니다. 또한 DX 컴파일러 버전 파싱 로직을 수정하여 안정성을 높였습니다.
llama.cpp 프로젝트가 Vulkan API를 활용하여 행렬-행렬 곱셈 및 Flash Attention 기능에 `v_dot2_f32_f16` 지원을 추가했습니다. 이는 다양한 플랫폼(macOS, Linux, Android 등)에서 최적화된 성능을 제공하며, 여러 아키텍처와 백엔드(CPU, GPU, NPU)를 포괄합니다.
본 기사는 llama.cpp 프로젝트의 업데이트 내용을 다루며, 기본적인 연산 융합(op fusion) 지원을 추가하고 RMS_NORM+MUL 융합 기능을 구현했습니다. 이를 통해 다양한 플랫폼(macOS, Linux, Android 등)에서 최적화된 성능으로 AI 모델을 구동할 수 있도록 여러 바이너리 버전을 제공합니다.
llama.cpp의 Hexagon DSP 지원 업데이트를 통해 MUL_MAT 및 MUL_MAT_ID 연산에서 Q4_1 양자화 지원이 추가되었습니다. 이를 통해 ggml-hexagon이 전체 그래프를 점유하여 CPU 부하를 줄이고 효율적인 연산이 가능해졌습니다.
NVIDIA Hopper+ 아키텍처 GPU의 성능 최적화를 위해 Programmatic Dependent Launch(PDL) 기능을 도입하고 다양한 커널을 등록했습니다. PDL을 통해 커널 간 실행 중첩과 효율적인 동기화를 구현하며, Hopper+ 외의 아키텍처(Ada 등)에서의 성능 저하 및 컴파일 문제를 방지하기 위한 보호 로직을 포함합니다.
Hexagon HTP 연산 지원을 위해 ggml에 TRI HVX 커널이 추가되었습니다. 이번 업데이트에는 TRI 연산에 대한 PR 리뷰 반영과 함께 코드 포맷팅 및 중복 연산 제거 등 다양한 최적화 작업이 포함되었습니다.
본 변경 사항은 ggml-vulkan 프로젝트의 CMakeLists에 SPIRV-Headers를 검색하는 로직을 추가하여 빌드 및 구성 안정성을 높이는 것을 목표로 합니다. 특히 CI 환경에서 파일들이 예상치 못한 경로(vulkan/)에 위치할 수 있는 문제를 해결하고, 이를 통해 필요한 SPIRV-Headers를 성공적으로 찾을 수 있도록 수정되었습니다. 이 변경은 macOS, Linux, Android, Windows 등 광범위한 플랫폼과 다양한 하드웨어/API 조합(CUDA, Vulkan, SYCL, ROCm 등)에서 프로젝트의 빌드 및 구성 오류를 방지하는 데 기여합니다.
llama-server의 CLI 인자 `--embd-normalize` 플래그가 임베딩 및 디버그 예제에만 등록되어 있어, 서버가 이를 거부하고 기본값(L2)을 사용하던 문제를 해결했습니다. 이 변경 사항은 `LLAMA_EXAMPLE_SERVER`를 업데이트하여 해당 플래그의 예제 세트에 추가하고, 핸들러가 파라미터에서 `embd_normalize` 값을 읽도록 수정함으로써 이루어졌습니다. 요청 본문에 포함된
본 기술 기사는 llama와 spec 관련 기능에 대한 대규모 업데이트 내용을 다루고 있습니다. 주요 내용은 MTP(Multi-Turn Prompting) 지원 강화, speculative decoding의 개선을 위한 GDN 중간 상태 저장 및 부분 롤백 기능을 추가한 것입니다. 또한, 다양한 플랫폼과 아키텍처(macOS, Linux, Windows, Android 등)에 대한 광범위한 호환성 및 최적화 작업이 진행되었으며, 여러 백엔드와 프레임워크 전반에 걸쳐 코드 수정 및 기능 개선이 이루어졌습니다.
이 기술 기사는 ggml-webgpu 프로젝트의 NVIDIA 자체 호스팅 CI 활성화에 대한 내용을 다루고 있습니다. 주요 작업으로는 주소 정밀도 문제 해결, 배치(placement) 수정, f16 포맷팅 및 명명 규칙 완화 시도 등이 포함됩니다. 또한 macOS, Linux, Android, Windows, openEuler 등 다양한 플랫폼과 아키텍처를 지원하기 위한 광범위한 CI 환경 구성을 보여줍니다.
이 기술 기사는 HIP를 사용하여 RDNA3 아키텍처에서 CUDA mma FA 커널을 지원하고 AMD 튜닝을 개선한 내용을 다룹니다. 특히 VKQ(Vector Quantization)의 FP16 누산 작업 시 RDNA3 텐서 코어를 활용하기 위해 타일 크기 조건을 정의했으며, 헤드 크기에 따른 적절한 누산 방식을 적용했습니다. 또한 RDNA3/4 및 CDNA1에 대한 커널 파라미터 튜닝을 통해 성능 개선 사항과 제약 조건(예: 헤드 크기가 128보다 클 때의 성능 한계)을 발견하고 새로운 데이터 레이아웃 항목을 추가했습니다.
본 기술 기사는 SYCL 백엔드에서 GPU 메모리 할당 방식을 개선하고, 특히 Intel Arc Pro B70과 같은 멀티 GPU 시스템에서 발생했던 시스템 RAM 고갈(OOM) 문제를 해결한 내용을 다룹니다. 기존의 `sycl::malloc_device`는 VRAM 할당을 시스템 RAM에 1:1로 미러링하여 과도한 메모리 소비를 유발했지만, 새로운 `zeMemAllocDevice` 사용은 호스트 스테이징 없이 P2P 경로를 사용하여 시스템 RAM 사용량을 크게 줄였습니다. 또한, 코드의 안정성과 유지보수성을 높이기 위해 try/catch 제거, 공통 헬퍼 함수 통합, 그리고 Level Zero 지원을 위한 컴파일 및 런타임 플래그 추가 등의 리팩토링 작업도 진행되었습니다.
이 수정 사항은 issue #22974에 대한 업데이트 내용으로, 중간 결과값을 더하기 전에 float로 캐스팅한 후 최종 결과를 대상 타입으로 캐스팅하여 half+half 연산자의 모호성을 방지하는 것을 목표로 합니다. 이 변경 사항은 macOS/iOS, Linux(다양한 아키텍처 및 API 포함), Android, Windows(CUDA, Vulkan, SYCL 등 다양한 환경 지원), 그리고 openEuler를 포함한 광범위한 플랫폼과 환경에서 적용됩니다.
이 기술 기사는 hexagon 컴파일러 및 관련 라이브러리 업데이트에 대한 내용을 담고 있습니다. 주요 개선 사항으로는 HVX splat helpers를 활용하여 스칼라 VTCM 로드를 제거하고, `hvx_vec_repl` 헬퍼 추가 및 이를 다양한 유스케이스에 적용하는 것이 포함됩니다. 또한 hmx-mm, hmx-fa 등 여러 모듈에서 그룹별 스케일 처리 최적화, 슬로프 로드 최적화, 정렬된 액세스 사용 등의 성능 개선이 이루어졌습니다.
ggml-zendnn 라이브러리에 작은 배치 크기(small batch sizes)에 대한 CPU 백엔드 적응형 폴백 기능이 추가되었습니다. 이 기능을 통해 특정 환경에서 문제가 발생할 경우 자동으로 안정적인 CPU 백엔드로 전환하여 호환성을 높였습니다. 또한, 사용자가 런타임 환경 변수 `GGML_ZENDNN_ADAPTIVE_FALLBACK`을 통해 이 적응형 폴백 동작을 제어할 수 있게 되었습니다.
이 업데이트는 ggml-webgpu 라이브러리에서 멀티모달(multimodal) 기능을 지원하기 위한 정밀도 문제를 해결하는 데 중점을 둡니다. 주요 수정 사항으로는 f32 사용을 위해 공유 메모리 계산 로직 업데이트, GELU 및 관련 함수 수정, flash-attn 경로 수정 등이 포함됩니다. 또한 다양한 운영체제와 아키텍처(macOS, iOS, Linux, Android, Windows 등)에 대한 광범위한 호환성 패치가 이루어졌습니다.
본 업데이트는 CUDA provider를 위한 내부 AllReduce 커널을 도입하여, NCCL 없이도 GPU 간의 텐서 병렬화(tensor parallelism)에 필요한 AllReduce 기능을 구현합니다. 이 새로운 internal provider는 단일 단계 CUDA 커널과 파이프라이닝 기법을 사용하여 효율적인 통신을 제공하며, `ggml-cuda` 라이브러리와 `llama-bench` 도구 모두에서 이를 지원하고 있습니다. 또한, 사용자가 NCCL 또는 내부 Provider를 명시적으로 선택할 수 있도록 환경 변수 및 플래그가 추가되었습니다.
본 기술 기사는 CUDA 기반의 im2col(2D 및 3D) 구현에서 출력 너비(OW)가 GPU 그리드 크기 제한인 65535를 초과할 때 발생하는 문제를 해결하는 방법을 설명합니다. 특히, 긴 오디오 데이터(예: 11초/16kHz)를 처리하는 Conv1d 인코더의 경우 OW가 이 한계를 넘어 '유효하지 않은 구성 인수' 오류를 발생시켰습니다. 이를 해결하기 위해 `block_nums.y`를 실제 OW와 GPU 최대 그리드 크기(`MAX_GRIDDIM_Y`) 중 작은 값으로 클램프하고, 커널 내부에서 스트라이드를 사용하여 나머지 영역을 루프 처리하도록 수정했습니다.
이 커밋은 CUDA 라이브러리에서 `cuda/iterator` 헤더 파일을 직접 포함하도록 수정하여, 기존에 `cub/cub.cuh`를 통해 간접적으로 가져오던 방식의 의존성 문제를 해결했습니다. 이 변경을 통해 컴파일 시점에 `cub` 라이브러리가 항상 `cuda/iterator`를 노출하지 못할 수 있는 잠재적인 오류를 방지하고, 코드의 안정성과 모듈성을 높였습니다.
이 기술 기사는 MiMo-V2.5 모델을 지원하기 위해 Flash Attention MMA/Tiles 기능을 추가하고 관련 최적화를 수행한 내용을 담고 있습니다. 구체적으로 d_kq=192, d_v=128 설정을 위한 flash attention mma/tiles 구현과 (256, 256) fattn 템플릿 적용이 주요 작업입니다. 또한 GQA 처리 수정, 다양한 아키텍처(macOS, Linux, Android, Windows 등) 및 백엔드 환경에 대한 광범위한 테스트와 업데이트가 이루어졌습니다.