Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

LACT PR은 사용자에게 GPU의 기본 VBIOS 제한보다 낮은 전력 소비를 설정할 수 있는 기능을 제공합니다. 이를 통해 최대 30W까지 전력을 낮출 수 있으며, RTX 6000 PRO와 같은 카드에서는 최소 75W까지 조정이 가능하여 전력 효율성을 높입니다.
K2 Horizon 라인업이 공개되었으며, AA 플롯 분석 결과 3.7B와 7B 모델이 현재 SOTA로 주목받고 있습니다. 다만, 이들 모델의 KV 캐시 디자인 문제점과 특정 하드웨어 환경(Strix Halo 등)에서의 성능 적합성에 대한 논의가 주를 이루고 있습니다.

개인적인 열정과 데이터 프라이버시 보호를 목적으로 구축한 로컬 AI 클러스터의 다년간 발전 과정을 공유합니다. RTX 3090에서 시작하여 4x RTX 6000 Pro Max Q를 포함한 고성능 GPU 서버로 업그레이드하며 겪은 하드웨어 구성 및 트러블슈팅 경험을 담고 있습니다.

RTX 5090 사용자를 위해 12VHPWR 케이블의 과도한 전력 소모를 감지하여 PC를 강제 종료하는 오픈 소스 도구가 개발되었습니다. 다만, 이 도구는 모든 GPU가 아닌 특정 GPU 모델에서만 작동하는 한계가 있습니다.

2 x 5070ti 환경에서 Qwen 27B 모델을 최적화하여 실행하는 설정과 성능 통계를 공유합니다. vLLM의 KV 캐시 수정 사항을 통해 생성 속도 저하 없이 동시 스레드 실행과 대규모 컨텍스트 확보가 가능함을 보여줍니다.
MacBook M5 Pro 64GB 환경에서 SSD 스트리밍 기술을 활용하여 DeepSeek V4 Flash 0731 모델을 구동한 결과, 초당 10~17 토큰의 속도를 달성했습니다.
RTX 5090의 전력 제한을 480W로 설정할 경우, 소음과 발열을 크게 줄이면서도 추론 성능 저하는 미미함을 실험을 통해 확인했습니다. 450W 이하로 낮추면 성능 저하가 급격해지므로 480W가 효율적인 지점입니다.

Mac M3 Ultra 환경에서 DeepSeek-V4-Flash 모델을 최적화하여 실행하는 방법을 소개합니다. MXFP4 양자화 버전을 활용하여 MLX 프레임워크 기반으로 매우 빠른 토큰 생성 속도를 구현했습니다.

8개의 RTX 3090과 2개의 RTX 5090을 탑재한 256GB VRAM 규모의 고성능 AI 서버 구축 및 6~8개월 운영 리뷰입니다. IT 인프라 엔지니어의 관점에서 하드웨어 구성, 안정성, 그리고 대규모 MoE 모델 추론을 위한 최적의 시스템 사양을 공유합니다.

LM Studio 패치 이후 M1 Ultra 128GB 환경에서 DeepSeek V4 IQ3XXS 모델을 구동하여 초당 16토큰의 속도를 기록했습니다.

Deepseek v4 pro 등 대규모 오픈 모델을 로컬에서 실행하기 위해 16xGB10 클러스터를 구축하는 과정을 설명합니다. 고속 네트워크 연결을 통해 2T+ 규모의 모델 실행 가능성을 목표로 합니다.
RTX PRO 6000 Max-Q eGPU를 장착한 Bosgame M5 환경에서 DeepSeek-V4-Flash-0731 모델의 양자화별 성능을 측정한 결과입니다. llama.cpp와 DSpark drafter를 활용하여 다양한 양자화 설정(Q2, Q4, Q8)에 따른 디코딩 및 프리필 속도를 비교 분석했습니다.
AMD Radeon Pro V620 워크스테이션 카드를 ComfyUI 및 로컬 LLM 환경에서 사용한 성공 사례를 공유합니다. 속도는 빠르지 않지만 32GB의 VRAM을 활용해 이미지, 비디오 생성 및 LLM 구동에서 안정적인 성능을 보여줍니다.

Apple Silicon 환경에서 Gemma 4 26B 모델을 단 2GB의 RAM만으로 실행할 수 있는 오픈 소스 Swift/Metal 추론 엔진인 Turbo-fieldfare를 소개합니다. M2 및 M5 칩셋에서 효율적인 추론 속도를 보여주며 OpenAI 호환 로컬 서버 기능도 제공합니다.

CPU 환경에서 디코딩 속도는 전체 파라미터가 아닌 토큰당 활성 파라미터에 의해 결정된다는 이론을 제시합니다. MoE(Mixture of Experts)나 ternary weights를 활용해 모델 용량을 키워도 속도 저하 없이 확장 가능한 아키텍처 설계 가능성을 논합니다.
AMD RX 9070 XT 환경에서 PrismML의 Bonsai 27B ternary 양자화 모델을 실행한 후기입니다. 극도로 압축된 모델임에도 불구하고 도구 호출(tool calling)과 긴 컨텍스트 유지가 가능함을 확인했습니다.

LLM 추론 시 발생하는 메모리 대역폭 문제를 해결하기 위해 RAM 내부에서 직접 연산을 수행하는 CaSA 기술을 소개합니다. 1-bit 및 ternary 모델을 활용하여 가중치가 메모리 버스를 통과하지 않고 DIMM 내부에서 연산되도록 설계되었습니다.

AMD Ryzen AI MAX+ 395 하드웨어에서 DeepSeek V4 Flash 모델을 구동하여 최대 32 tok/s의 디코드 속도를 달성했습니다. ROCmFPX 기술을 활용한 혼합 정밀도 양자화 방식을 통해 128GB 통합 메모리 환경에서 효율적인 추론 성능을 구현했습니다.

Kimi K3 모델을 구동하기 위해 필요한 하드웨어 자재 명세서(BoM)와 기술적 고려사항을 다룹니다. 2304GB VRAM 확보를 위한 4대의 호스트 구성과 PCIe 5.0 병목 현상, 결함 허용(fault tolerance) 문제 등을 분석합니다.

AMD Ryzen 7 6800H APU 환경에서 Gemma 4 및 Qwen 3.6 MoE 모델의 추론 성능을 벤치마킹했습니다. Vulkan 백엔드를 통해 iGPU와 공유 메모리(UMA)를 활용한 다양한 양자화 방식의 성능을 분석했습니다.