Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Debian Testing 환경에서 AMD MI50 GPU를 사용하여 llama.cpp의 성능을 벤치마크한 결과입니다. ROCm과 Vulkan 백엔드 간의 성능 차이를 분석하며, 특히 MTP(Multi-Token Prediction) 적용 시 토큰 생성 속도가 크게 향상됨을 확인했습니다.
NVIDIA RTX 5090 환경에서 Qwen3.6-27B 모델을 대상으로 DFlash Speculative Decoding과 KV Cache Compression을 결합한 벤치마크 결과입니다. q4_0/turbo4 전략 사용 시 성능 저하를 최소화하면서 최대 3.26배의 속도 향상을 달성했습니다.
NVLink 없이 2개의 RTX 3090을 사용했을 때 Qwen 2.5 모델의 추론 성능이 거의 선형적으로 향상되는 현상을 보고했습니다. P2P가 자동으로 활성화되어 텐서 병렬성(TP=2) 환경에서 높은 효율을 보였습니다.
RTX 5070 Ti 및 5080(16GB VRAM) 환경에서 멀티모달 추론을 실행하기 위한 설정과 벤치마크 정보를 공유합니다. 사용자가 자신의 GPU 사양으로 모델 실행 가능 여부를 판단하는 데 도움을 주기 위한 가이드입니다.
OpenAI가 SoftBank의 SB Energy와 협력하여 오하이오에 10GW 규모 데이터 센터 캠퍼스를 임차하는 방안을 검토하고 있습니다. 이 시설은 폐쇄된 DOE 부지에 건설되며, Nvidia는 컴퓨팅 하드웨어 공급과 OpenAI의 재정적 보증 역할을 맡아 프로젝트를 지원합니다.
Zai가 GLM-5.1 추론을 위해 자체 개발한 ZCube 네트워크 아키텍처를 도입하여 성능을 대폭 개선했습니다. 기존 ROFT 방식의 트래픽 불균형 문제를 해결하여 비용은 줄이고 처리량과 지연 시간 성능은 높였습니다.
5090, 6000 PRO MaxQ, 6000 PRO WS/SE 등 다양한 GPU 모델의 Diffusion 연산 성능을 비교 분석한 테스트 결과입니다. 각 그래픽 카드의 전력 제한 범위와 언더볼팅/오버클러킹 적용 여부에 따른 성능 차이를 다룹니다.