Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Apple의 MLX LM Server는 M5 칩의 신경 가속기를 활용해 프롬프트 처리 속도를 높인 새로운 ML 서버입니다. 연속 배칭을 통한 동시성 확보와 Thunderbolt RDMA를 이용한 분산 추론 기능을 지원합니다.
저예산 Dual RTX 3060 구성을 통해 Qwen 3.6-27B 모델을 구동한 성능 테스트 결과입니다. 7900 XTX 대비 안정적인 연산 성능과 30-50 t/s의 디코딩 속도를 확인했습니다.
Intel Arrow Lake NPU를 활용하여 스마트 홈용 ASR(자동 음성 인식) 작업을 수행한 성능 비교 결과입니다. CPU 대비 속도와 에너지 효율 면에서 압도적인 성능 향상을 확인했습니다.
Cohere의 218B MoE 모델인 Command A+를 Apple Silicon에서 실행할 수 있도록 mlx-lm용 구현을 개발했습니다. Sigmoid 라우팅과 슬라이딩 윈도우 등 모델의 독특한 아키텍처를 반영하며, MLX 프레임워크를 통한 로컬 실행 최적화를 목표로 합니다.
AMD MI60 GPU 환경에서 Frigate 및 HomeAssistant 활용을 위한 llama.cpp 최적화 설정을 탐구합니다. 다양한 양자화 방식, KV 캐시, 배치 크기 및 ROCm 환경 변수를 조합하여 성능을 벤치마킹한 과정을 다룹니다.
16GB AMD Radeon GPU 환경에서 llama.cpp와 ROCm/HIP를 활용한 로컬 LLM 실행 성능을 테스트하고 공유하는 리포지토리를 소개합니다. Qwen3.6 모델을 중심으로 컨텍스트 길이, KV 캐시, 전력 프로필 등 실용적인 벤치마크 데이터를 제공합니다.
Strix Halo 시스템의 성능을 극대화하기 위해 듀얼 RTX 3090 eGPU와 NVLink를 결합한 하드웨어 모딩 실험을 다룹니다. 27B~31B 밀집 모델 실행 시 대역폭 제한을 완화하여 성능을 향상시키는 방법과 전력 효율성을 분석합니다.
Gorgon Halo는 이전 모델인 Strix Halo보다 메모리 클럭이 6.7% 높아 AI 워크로드 성능이 향상될 전망입니다. 하지만 성능 향상 폭이 크지 않아, 내년 여름 출시될 Medusa Halo를 기다리는 것이 더 효율적인 선택일 수 있습니다.
사용자의 예산과 사용 사례에 맞는 최적의 LLM 하드웨어 구성을 제안하거나, 보유한 하드웨어에 적합한 모델을 추천해 주는 가이드 사이트입니다. 60개 이상의 빌드 구성과 모델별 양자화 성능, 전력 소모량 등 상세한 벤치마크 데이터를 제공합니다.
llama.cpp의 Build 9254에서 발생하던 토큰 생성(TG) 성능 저하 문제가 해결되었으며, NVIDIA GPU를 위한 PDL(Programmatic Dependent Launch) 기능이 추가되었습니다. PDL은 최신 NVIDIA GPU에서 커널 실행을 중첩시켜 오버헤드를 줄임으로써 토큰 생성 속도를 향상시키는 최적화 기술입니다.
저렴한 컴퓨팅 자원을 찾던 중 발견한 PS5 APU 기반의 BC-250 보드에서 비활성화된 CU(Compute Unit)를 해제하는 방법을 공유합니다. amdgpu 소스 코드 분석을 통해 특정 레지스터를 조작하여 24개의 CU를 활성화할 수 있으며, 이를 통해 가성비 높은 추론 환경을 구축할 수 있습니다.
RTX 5080 16GB 환경에서 Qwen3.6 35B MoE 모델을 테스트한 결과, 128k 컨텍스트에서 MTP(Multi-Token Prediction)를 사용하면 오히려 성능이 저하되는 현상이 발견되었습니다. MTP 연산 버퍼가 차지하는 VRAM으로 인해 일부 MoE 전문가 레이어가 CPU로 밀려나면서 병목 현상이 발생하기 때문입니다. 반면, GPU 메모리에 완전히 들어가는 27B 모델의 경우에는 MTP가 성능 향상에 도움이 됩니다.
저렴한 Raspberry Pi를 활용하여 분산 학습 및 추론을 위한 소규모 컴퓨팅 클러스터를 구축하는 가이드를 소개합니다. 이 시리즈는 주변의 다양한 하드웨어를 사용하여 AI 모델을 실행하는 실무적인 방법을 다루며, 분산 AI 시스템의 기초를 배우는 데 중점을 둡니다.
구형 RTX 2080 Ti 4개를 활용하여 2,500달러 미만의 예산으로 DeepSeek-V4-Flash 모델을 로컬에서 실행하는 가성비 시스템 구축 사례를 소개합니다. 커스텀 Turing CUDA 커널과 W8A8 양자화, 이종 추론 최적화를 통해 메모리 제약을 극복하고 높은 성능을 달성했습니다.
BlackBeard가 운영 중인 개인용 AI 홈랩(homelab)의 전체 하드웨어 구성과 사양을 소개합니다. 다양한 CPU와 GPU 조합을 통해 모델 아카이빙부터 고성능 모델 실행까지 목적별로 구축된 5대의 서버 시스템을 설명합니다.
AMD Radeon RX 7900 XTX 환경에서 Luce DFlash와 PFlash를 사용하여 Qwen3.6-27B 모델을 테스트한 결과, 기존 llama.cpp HIP 대비 약 2.24배의 디코딩 속도 향상을 확인했습니다. 하드웨어 대역폭 특성에 따라 최적의 Budget 설정이 달라지며, 짧은 생성 작업에서는 표준 체인 추측 방식이 더 효율적일 수 있음을 보여줍니다.
사용자가 RTX 5000 PRO (48GB) GPU를 구매하여 로컬 LLM 환경을 구축한 후기입니다. Mac Studio 대신 선택한 이 GPU는 뛰어난 프롬프트 처리(PP) 속도와 전력 효율성을 보여주며, Claude Code의 도움을 받아 Linux 및 vLLM 설정에 성공했습니다.
소형 TTS 모델인 OmniVoice를 활용하여 21종의 다양한 GPU 성능을 벤치마크한 결과입니다. 소비자용 GPU들이 기존 RTX 3090과 비교하여 실시간 대비 오디오 생성 속도(xRT)에서 어떠한 성능 차이를 보이는지 대략적인 추정치를 제공합니다.
MTP(Multi-Token Prediction) 기술을 활용하여 LLM 추론 속도를 최대 2배까지 가속화하는 방법을 소개합니다. 특히 AMD Strix Halo 및 Radeon 9700 환경에서 Qwen 3.6 모델을 사용할 때 코딩 에이전트의 성능이 어떻게 향상되는지 다룹니다.
AMD의 ROCm 7.13 나이틀리 버전이 공개되었으며, Ryzen AI Max 300 'Strix Halo' 프로세서에 대한 최적화가 포함되었습니다. 또한, 성능 분석을 위한 ROCprof Trace Decoder가 오픈 소스로 전환되어 공개되었습니다.