Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이 수정 사항은 issue #22974에 대한 업데이트 내용으로, 중간 결과값을 더하기 전에 float로 캐스팅한 후 최종 결과를 대상 타입으로 캐스팅하여 half+half 연산자의 모호성을 방지하는 것을 목표로 합니다. 이 변경 사항은 macOS/iOS, Linux(다양한 아키텍처 및 API 포함), Android, Windows(CUDA, Vulkan, SYCL 등 다양한 환경 지원), 그리고 openEuler를 포함한 광범위한 플랫폼과 환경에서 적용됩니다.
이 업데이트는 vLLM 및 transformers API의 호환성을 높이기 위해 `continue_final_message` 플래그를 추가합니다. 이 플래그는 특히 `add_generation_prompt`가 false로 설정되었을 때 기존의 prefill_assistant 코드 경로를 트리거하도록 설계되었습니다. WebUI는 '계속(Continue)' 버튼 사용 시 이 플래그와 `add_generation_prompt: false` 조합을 전송하며, 이는 향후 채팅 서비스의 템플릿별 prefill 로직 구현에 기반을 마련합니다.
이 기술 기사는 hexagon 컴파일러 및 관련 라이브러리 업데이트에 대한 내용을 담고 있습니다. 주요 개선 사항으로는 HVX splat helpers를 활용하여 스칼라 VTCM 로드를 제거하고, `hvx_vec_repl` 헬퍼 추가 및 이를 다양한 유스케이스에 적용하는 것이 포함됩니다. 또한 hmx-mm, hmx-fa 등 여러 모듈에서 그룹별 스케일 처리 최적화, 슬로프 로드 최적화, 정렬된 액세스 사용 등의 성능 개선이 이루어졌습니다.
ggml-zendnn 라이브러리에 작은 배치 크기(small batch sizes)에 대한 CPU 백엔드 적응형 폴백 기능이 추가되었습니다. 이 기능을 통해 특정 환경에서 문제가 발생할 경우 자동으로 안정적인 CPU 백엔드로 전환하여 호환성을 높였습니다. 또한, 사용자가 런타임 환경 변수 `GGML_ZENDNN_ADAPTIVE_FALLBACK`을 통해 이 적응형 폴백 동작을 제어할 수 있게 되었습니다.
본 업데이트는 reasoning models에서 생성(generation)을 지속적으로 수행하는 기능을 지원합니다. 구체적으로, assistant prefill로 인해 발생하던 차단 문제를 해결하고, 파서가 다음 스트림 청크를 정확히 라우팅할 수 있도록 thinking tags를 조정했습니다. WebUI에서는 Continue 버튼을 통해 reasoning guard를 해제하고, 부분적인 reasoning 내용을 유지하여 CoT(Chain of Thought)의 연속성을 보장합니다.
이 업데이트는 ggml-webgpu 라이브러리에서 멀티모달(multimodal) 기능을 지원하기 위한 정밀도 문제를 해결하는 데 중점을 둡니다. 주요 수정 사항으로는 f32 사용을 위해 공유 메모리 계산 로직 업데이트, GELU 및 관련 함수 수정, flash-attn 경로 수정 등이 포함됩니다. 또한 다양한 운영체제와 아키텍처(macOS, iOS, Linux, Android, Windows 등)에 대한 광범위한 호환성 패치가 이루어졌습니다.
본 업데이트는 CUDA provider를 위한 내부 AllReduce 커널을 도입하여, NCCL 없이도 GPU 간의 텐서 병렬화(tensor parallelism)에 필요한 AllReduce 기능을 구현합니다. 이 새로운 internal provider는 단일 단계 CUDA 커널과 파이프라이닝 기법을 사용하여 효율적인 통신을 제공하며, `ggml-cuda` 라이브러리와 `llama-bench` 도구 모두에서 이를 지원하고 있습니다. 또한, 사용자가 NCCL 또는 내부 Provider를 명시적으로 선택할 수 있도록 환경 변수 및 플래그가 추가되었습니다.
이 기술 기사는 LoRA(Low-Rank Adaptation) 관련 라이브러리의 개선 사항을 다루고 있습니다. 주요 업데이트 내용은 `LoraTorchTensor` 클래스에 `split()` 메서드를 추가하여 텐서 분할 기능을 강화한 것입니다. 또한, Python 타입 검사 수정, `torch.split` 디스패치 로직 개선, 그리고 다양한 버그 및 리팩토링 작업이 포함되어 전반적인 코드 안정성과 사용 편의성을 높였습니다.
본 기술 기사는 CUDA 기반의 im2col(2D 및 3D) 구현에서 출력 너비(OW)가 GPU 그리드 크기 제한인 65535를 초과할 때 발생하는 문제를 해결하는 방법을 설명합니다. 특히, 긴 오디오 데이터(예: 11초/16kHz)를 처리하는 Conv1d 인코더의 경우 OW가 이 한계를 넘어 '유효하지 않은 구성 인수' 오류를 발생시켰습니다. 이를 해결하기 위해 `block_nums.y`를 실제 OW와 GPU 최대 그리드 크기(`MAX_GRIDDIM_Y`) 중 작은 값으로 클램프하고, 커널 내부에서 스트라이드를 사용하여 나머지 영역을 루프 처리하도록 수정했습니다.
이 커밋은 CUDA 라이브러리에서 `cuda/iterator` 헤더 파일을 직접 포함하도록 수정하여, 기존에 `cub/cub.cuh`를 통해 간접적으로 가져오던 방식의 의존성 문제를 해결했습니다. 이 변경을 통해 컴파일 시점에 `cub` 라이브러리가 항상 `cuda/iterator`를 노출하지 못할 수 있는 잠재적인 오류를 방지하고, 코드의 안정성과 모듈성을 높였습니다.
이 기술 기사는 MiMo-V2.5 모델을 지원하기 위해 Flash Attention MMA/Tiles 기능을 추가하고 관련 최적화를 수행한 내용을 담고 있습니다. 구체적으로 d_kq=192, d_v=128 설정을 위한 flash attention mma/tiles 구현과 (256, 256) fattn 템플릿 적용이 주요 작업입니다. 또한 GQA 처리 수정, 다양한 아키텍처(macOS, Linux, Android, Windows 등) 및 백엔드 환경에 대한 광범위한 테스트와 업데이트가 이루어졌습니다.
이 기술 기사는 GGML_OP_GATED_DELTA_NET 연산을 위해 Hexagon 프로세서에 HTP(High Throughput) 커널을 구현하는 과정을 다룹니다. 이 개선 사항은 프롬프트 처리(PP) 경로와 토큰 생성(TG) 경로 모두에서 최적화된 융합 커널을 제공하며, 특히 TG 경로의 K/Q/게이트 벡터 재로드 오버헤드를 2배 감소시킵니다. 또한 macOS, Linux, Android, Windows 등 광범위한 다양한 아키텍처와 프레임워크(CUDA, Vulkan, ROCm, OpenVINO 등)를 지원하도록 포팅 범위를 확장했습니다.
본 기술 기사는 CUDA 환경에서 'snake'라는 복잡한 활성화 연산자(y = x + sin(a*x)^2 * inv_b)를 단일 요소별 커널로 병합하는 과정을 다룹니다. 이를 통해 기존의 여러 개별 연산자로 분해되던 구조를 효율적으로 재작성하여, BigVGAN이나 Vocos 같은 오디오 디코더에서 발생하는 계산 부하를 줄이고 성능을 최적화합니다. 이 작업은 F32, F16, BF16 등 다양한 데이터 타입과 여러 플랫폼(CUDA, CPU, macOS, Linux 등)에 걸쳐 테스트 및 적용되었습니다.
이 기술 기사는 OpenCL을 사용하여 Adreno GPU에 대한 Q4_0 MoE GEMM 및 CLC 패스 검증(sanity check) 기능을 추가한 업데이트 내용을 담고 있습니다. 주요 개선 사항으로는 코드 가독성 향상을 위한 `#if` 블록 분할, 사용하지 않는 `cl_program` 제거, 그리고 전반적인 공백 수정 등이 포함되었습니다. 이 릴리스는 macOS, iOS, Linux, Android, Windows 등 광범위한 플랫폼과 다양한 백엔드(CUDA, Vulkan, SYCL, ROCm 등)를 지원하며, 여러 아키텍처 및 운영체제 환경에 걸쳐 테스트가 이루어졌음을 보여줍니다.
이 기술 기사는 'llama' 프로젝트의 디바이스 상태 저장 및 복구 기능을 개선한 업데이트에 대한 배포 목록을 제공합니다. macOS, iOS, Linux(다양한 아키텍처 및 백엔드 지원), Android, Windows, openEuler 등 광범위한 플랫폼과 환경에서 다양한 빌드가 포함되어 있습니다. 이는 llama 모델의 범용성과 접근성을 크게 향상시키는 중요한 업데이트입니다.
이 기술 기사는 Mimo v2.5 모델을 지원하기 위한 업데이트 내용을 담고 있습니다. 주요 수정 사항으로는 `modify_tensors`의 행 분할 문제 해결, 어텐션 가중치 스케일링(attn_value scale) 누락 처리, 그리고 TP (Tensor Parallelism) 반복 순서 조정 등이 포함됩니다. 또한, Mimo v2.5 모델에 대한 GGUF 변환 및 다양한 운영체제/하드웨어 아키텍처(macOS, Linux, Windows, Android 등)에서의 지원을 확장하고 최적화하는 작업이 이루어졌습니다.
이 기술 기사는 Llama 모델의 상태 복원(restore state) 과정에서 불필요한 시퀀스 ID(seq_id) 확인 로직을 제거하는 개선 사항에 대한 릴리스 노트를 담고 있습니다. 이 최적화는 다양한 운영체제 및 아키텍처 환경(macOS, iOS, Linux, Android, Windows 등)에서 Llama 모델의 성능과 안정성을 향상시키는 것을 목표로 합니다.
ggml 라이브러리가 OpenCL 메모리 추정 기능을 추가하고 이를 통해 성능 최적화가 가능해졌습니다. 또한, macOS, iOS, Linux, Android, Windows 등 광범위한 운영체제와 아키텍처를 지원하며 다양한 백엔드(CUDA, Vulkan, ROCm, SYCL 등) 통합을 완료하여 플랫폼 호환성과 범용성을 크게 향상시켰습니다.
llama.cpp의 v0.2.0-b9049 버전 업데이트는 MiniCPM-V 4.6 모델 지원을 주요 기능으로 추가했습니다. 이 외에도 전반적인 코드 버그 수정, 최적화(예: flash attention 지원), 그리고 다양한 플랫폼 및 아키텍처에 대한 광범위한 빌드 호환성을 확보했습니다. 사용자는 macOS, Linux (CPU/GPU 가속 포함), Android, Windows 등 거의 모든 주요 환경에서 이 업데이트된 llama.cpp를 사용할 수 있습니다.
llama.cpp v0.0.52는 IBM Granite 모델군에 대한 지원을 대폭 확장하여, 특히 음성 인식(Speech) 기능을 갖춘 Granite-4.0-1B-Speech 모델의 GGUF 변환기 지원을 추가했습니다. 이 릴리스는 GraniteSpeechTextModel을 기존 GraniteModel로 통합하고, Conformer 인코더와 QFormer 프로젝터 등 복잡한 오디오 처리 아키텍처를 효율적으로 구현하는 구조 개선 사항들을 포함합니다. 다양한 플랫폼(macOS, Linux, Windows, Android 등)에 걸쳐 최적화된 지원을 제공하며, 여러 하드웨어 가속기 및 백엔드를 포괄하여 범용성과 성능을 크게 향상시켰습니다.