Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

본 영상은 NVIDIA H200 NVL GPU를 분해하고 EK-Pro 워터 블록을 설치하는 상세 과정을 다룹니다. PCB의 서멀 패드와 페이스트 제거부터 새로운 서멀 컴파운드 도포, 그리고 워터 블록 재조립 및 누수/스트레스 테스트까지 전문적인 절차를 안내합니다. 이 커스텀 액체 냉각 시스템은 8개 H200 GPU로 구성되어 최대 7,000W의 전력을 소비하며 안정성을 입증했습니다.
Nvidia의 CMP 170HX가 Exploit을 통해 원래의 컴퓨팅 기능과 메모리(80GB)를 잠금 해제할 수 있다는 연구 결과가 공유되었습니다. 이 제품은 본래 암호화폐 채굴용으로 제한되었으나, 보안 프로세서의 취약점을 이용해 A100급 성능 복구가 가능할 것으로 예상됩니다.

Qwen3.5 모델을 AMD ROCm 환경에서 최적화한 iMatrix를 소개합니다. 이 기술은 122B 파라미터 중 활성 파라미터를 10B로 줄여 메모리 사용량을 크게 절감했습니다. 이를 통해 디코딩 속도를 높이고 효율성을 개선하는 데 초점을 맞추고 있습니다.

GLM-5.2-Int4-Int8 모델을 GB10 8개 GPU 환경에서 구동했을 때의 성능 지표를 공유합니다. 전처리(prefill) 속도는 약 1,200 t/s이며, 평균 디코딩(decode) 속도는 일반 작업 시 33–54 t/s로 측정되었습니다.
PrismML Bonsai 27B 모델을 Jetson Orin Nano 8GB 환경에서 구동하는 성능 지표를 공유합니다. 이 설정은 전력 소모가 약 25W로 효율적이며, 복잡한 작업을 수행하기에 충분히 유용함을 보여줍니다.

AMD의 새로운 Ryzen AI Halo (Strix Halo) 시스템을 활용하여 LLM 추론 성능을 개선하는 설정 방법을 공유합니다. 이 설정을 통해 로컬 환경에서 10~15%의 성능 향상을 얻을 수 있습니다.

작성자는 듀얼 RTX 6000 GPU 설정 및 VLLM을 이용한 deepseek v4 flash dspark 구동 경험을 공유하며, 이러한 하드웨어 인프라 구축의 가치를 강조했습니다. 이는 AI 모델 구동에 필요한 강력한 컴퓨팅 자원 확보가 중요함을 시사합니다.
제공된 입력은 벤치마크 결과 이미지와 제목만 포함하고 있어, 구체적인 내용을 요약하기 어렵습니다. 다만, Qwen3.6 27B 모델을 특정 하드웨어 환경(4x 5060 Ti, 64GB VRAM)에서 다양한 설정(INT8/bf16 KV 캐시, 8 동시성)으로 테스트한 성능 비교 자료임을 알 수 있습니다.
MI50 칩셋 기반의 다중 GPU 시스템 구성 시, 단순히 칩 개수보다 어떤 방식으로 연결하는지가 성능에 결정적인 영향을 미친다는 질문입니다. 특히 PCI Express(PCIE) 슬롯을 통한 직접 연결과 PEX8749 같은 고속 인터커넥트를 활용한 하이브리드 연결 방식의 성능 비교 및 최적화 방안을 문의하고 있습니다.

커스텀 CUDA 및 C++ 코드를 활용하여 VRAM 16GB의 RTX 5060 Ti에서 Qwen3-30B-A3B 모델을 초당 50~54 토큰 속도로 구동하는 방법을 제시합니다. 이는 기존 llama.cpp 방식 대비 약 50% 향상된 성능으로, 소비자 하드웨어에서의 로컬 추론 가능성을 높입니다.
본 PR은 AINekko와 AIFoundry 멤버들이 개발한 ET 백엔드를 llama.cpp에 추가합니다. 이는 Esperanto Technologies가 개발한 ET-SOC-1 프로세서를 지원하며, 오픈 소스 하드웨어를 추론 생태계에 통합하는 것을 목표로 합니다.
AMD Strix Halo 및 MLX를 위한 오픈 소스 이기종 AI 컴퓨팅 패브릭 솔루션인 Skulk를 소개합니다. 이는 AMD 샤딩을 지원하며, 사용자가 직접 확장 가능한 플러그인 API와 다중 노드 추론 기능을 제공하는 것이 특징입니다. 다양한 모델과 서비스를 통합하고, STT/TTS 같은 엔티티를 포함하여 개발자들이 새로운 노드를 구축할 수 있도록 설계되었습니다.
RISC-V 아키텍처 기반의 CSB1-N10SPK3 서버 에지 클러스터 제품 사양을 소개합니다. 10개 노드로 구성된 클러스터는 총 320GB RAM과 600TOPS의 높은 연산 성능을 제공합니다.
Ascent GX10 하드웨어에서 REAP-pruned NVFP4 기술을 적용한 DeepSeek-V4-Flash 모델의 성능을 테스트했습니다. 긴 컨텍스트 환경에서 처리량(throughput)의 안정성과 일관성을 검증하기 위해 VLLM과 Grafana를 활용한 모니터링을 수행했습니다.
Qualcomm이 Windows 노트북 환경에서 LLM을 효율적으로 실행할 수 있도록 돕는 GenieX를 출시했습니다. 이 SDK를 통해 Gemma 4 및 Qwen 모델 등을 GPU와 NPU에서 구동하여 최적화된 성능을 얻을 수 있습니다.
NVIDIA Blackwell GPU 환경에서 vLLM을 활용해 Qwen3.6-35B-A3B-NVFP4 모델의 대량 이미지 캡셔닝 성능을 테스트한 결과입니다. 30개의 동시 스트림 실행 시 약 2000 TPS를 기록하며, MoE 모델의 효율적인 전문가 선택과 NVFP4 양자화의 성능 이점을 분석합니다.
여름철 DGX-Spark 사용 중 발생하는 과열 및 락업 문제를 해결하기 위해 nvidia-smi를 이용한 언더클러킹 방법을 소개합니다. GPU 클럭을 제한함으로써 온도를 85°C에서 60°C로 낮출 수 있습니다.
RTX 3090, 5090, Dual RTX 6000 등 다양한 하드웨어 구성에 따른 로컬 LLM 추론 속도를 비교 분석합니다. 각 GPU 설정별 토큰 생성 속도와 프롬프트 처리 성능을 통해 하드웨어 계층별 실질적인 성능 차이를 보여줍니다.
NVIDIA RTX 5090 환경에서 DeepSeek V4 Flash MoE 모델을 최적화하여 실행한 벤치마크 결과입니다. llama.cpp 포크를 활용해 100만 컨텍스트를 처리하며 높은 토큰 생성 속도를 달성했습니다.
Intel Arc Pro B70(32GB) 환경에서 Dense 모델과 MoE 모델의 추론 성능 차이를 비교 분석했습니다. MoE 모델이 Dense 모델보다 훨씬 빠른 프롬프트 처리 및 생성 속도를 보여주었으며, Vulkan 백엔드가 SYCL보다 성능 면에서 우수함을 확인했습니다.