Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
4x5060 Ti bifurcation 환경에서 PCIe 브리지가 P2P 통신의 병목 지점이 되어 성능 저하를 일으키는 문제를 분석합니다. 이를 해결하기 위한 하드웨어 교체, 병렬 처리 방식 변경 등 다양한 트러블슈팅 방안을 제시합니다.
M2 MacBook Pro(96GB 통합 메모리) 환경에서 Ollama를 통해 6개 로컬 모델의 추론 속도를 벤치마크한 결과입니다. Qwen2.5 3B 모델이 예상과 달리 Llama 3.2를 포함한 동급 모델들보다 빠른 성능을 보여주었습니다.
Unsloth 양자화 버전의 GLM 5.2 모델을 Threadripper Pro와 dual RTX 5090 기반의 컨슈머급 하드웨어에서 구동한 테스트 결과입니다. llama.cpp를 활용하여 최적화된 설정을 적용한 결과, 약 12t/s의 지속적인 추론 속도를 확인했습니다.
Mac Studio의 대용량 메모리를 활용하여 GLM 5.2 모델의 실행 속도를 대폭 향상시키는 PR이 공개되었습니다. 100k 이상의 긴 컨텍스트에서도 100 t/s 이상의 프리필 속도를 유지하며 효율적인 모델 실행이 가능합니다.
중국 내 AI 가속기 시장의 급격한 성장과 주요 기업들의 동향을 분석합니다. Huawei를 포함한 빅테크와 최근 IPO를 마친 전문 기업들이 H100/H200급 칩을 출하하며 NVIDIA의 점유율을 빠르게 대체하고 있습니다.
RTX 5090과 RTX 3090 Ti 조합에서 llama.cpp의 tensor split 모드를 활용해 Qwen3.6-27B 모델의 추론 속도를 100 t/s 이상으로 끌어올린 설정법을 공유합니다. 레이어 분할 방식 대신 텐서 분할을 사용하여 두 GPU의 연산 효율을 극대화했습니다.
6년 된 Xeon CPU 환경에서 llama.cpp 최적화를 통해 Gemma-4 모델을 초당 64토큰의 속도로 구동하는 데 성공했습니다. 이는 고가의 멀티 GPU 장비 없이도 에이전트 기반 코딩이 가능한 수준의 성능을 보여줍니다.
중국 해커들이 NVIDIA Tesla v100의 핀아웃을 역공학하여 하프 하이트 PCB에 구현한 'Tesla v100 v4'를 제작했습니다. 저렴한 가격으로 16G 및 32G 버전을 출시하여 주목받고 있습니다.
RTX 3090 4장과 192GB RAM을 활용하여 GLM5.2 등 대규모 모델을 구동할 수 있는 가성비 홈 랩 시스템 구축 사례를 소개합니다. 소비자용 하드웨어를 최적화하여 기업용 워크플로우 자동화를 위한 로컬 AI 환경을 구축하는 방법을 다룹니다.
멀티 GPU 환경을 구축하던 중 M.2 어댑터에 장착된 GPU가 vLLM에서 인식되지 않는 하드웨어 문제를 해결한 사례입니다. 원인은 ATX Y-splitter 케이블을 통한 전력 공유 문제였으며, 별도의 PSU를 추가하여 해결했습니다.
단순한 이론적 스펙(TFLOPS, 대역폭)이 실제 AI 모델 구동 성능을 보장하지 않음을 Radeon RX 7900 XTX와 NVIDIA GeForce RTX 5070 Ti의 비교를 통해 설명합니다. 실제 벤치마크 결과, 스펙상 우위에 있던 7900 XTX보다 5070 Ti가 더 나은 성능을 보여줍니다.
Apple Silicon Mac에서 EXL3 양자화 모델을 실행, 추론 및 변환할 수 있게 되었습니다. 기존 CUDA 환경의 고가 GPU가 필요했던 작업이 64GB 이상의 메모리를 갖춘 Mac에서도 가능해져 로컬 LLM 접근성이 높아졌습니다.
AMD Strix Halo(gfx1151) 환경에서 hipBLASLt의 NT 및 TT 레이아웃 GEMM 커널 성능을 최적화하기 위해 진화 알고리즘 기반의 EvoTensile을 개발했습니다. 이를 통해 100개의 입력 형태에 대해 성능을 20 TFLOPS에서 40 TFLOPS 수준으로 대폭 향상시켰습니다.
eBay에서 판매되는 개조된 AMD Radeon Pro W6800(V620 기반)의 성능을 벤치마크한 결과입니다. W6800 펌웨어 플래싱을 통해 디스플레이 출력을 지원하며, Vulkan 및 ROCm 백엔드를 이용한 Qwen 2.5 27B 모델의 추론 성능을 측정했습니다.
AI 서버 구축을 위해 NVIDIA RTX 5060 Ti와 AMD RX 9060 XT 16GB 모델의 성능을 비교 벤치마크한 결과입니다. 다양한 LLM 모델을 대상으로 응답 및 프롬프트 토큰 생성 속도를 측정한 데이터를 공유합니다.

CUDA 의존성이 높은 EXL3 코덱을 Apple Silicon의 Metal 환경에서 실행할 수 있도록 포팅한 PonyExl3 프로젝트를 소개합니다. M1/M5 Max 환경에서 높은 추론 속도와 효율적인 메모리 관리를 구현했습니다.
M3 Max(96GB) 환경에서 특정 엔진과 GGUF 파일을 사용하여 Deepseek 4 flash 모델을 실행하는 방법을 소개합니다. SSD 스트리밍과 Metal 할당량 조절을 통해 RAM 용량 한계를 극복하고 구동하는 기술적 팁을 다룹니다.

Jetson Orin NX를 활용하여 Hermes Agent 벤치마킹을 위한 소형 서버를 구축한 사례입니다. Gemma 4 26B 모델과 MTP(Multi-Token Prediction) 기술을 적용하여 긴 컨텍스트 환경에서의 성능과 속도를 최적화했습니다.
Apple이 CoreML의 차세대 대체제인 CoreAI를 발표했습니다. 이는 Apple Silicon에 최적화된 온디바이스 추론 엔진으로, 기존 CoreML의 한계를 넘어 대규모 파라미터 모델과 확장된 연산 지원을 목표로 합니다.

한국 스타트업 Furiosa AI의 추론 전용 칩 RNGD가 로컬 LLM 시장의 게임 체인저가 될 가능성을 분석합니다. 높은 메모리 대역폭과 VRAM을 갖춘 이 칩이 llama.cpp 등 오픈소스 생태계와 협력한다면 강력한 경쟁력을 가질 것으로 전망합니다.