Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
T-Head Semiconductor가 개발한 PPU를 지원하기 위해 Triton 언어를 포크하여 최적화한 기술 문서입니다. PPU 백엔드를 통해 비동기 데이터 이동, 스위즐드 공유 메모리 레이아웃, Tensor Core 가속 기능을 제공합니다.

MAX 모델을 Apple silicon GPU에서 실행할 수 있는 기능이 26.4 릴리스를 통해 지원됩니다. M1부터 M5까지의 칩셋에서 LLM, 비전, 이미지 확산 모델을 구동할 수 있으며, 특히 M5 시스템의 Neural Accelerators를 활용해 최적의 성능을 제공합니다.

Princeton 연구진이 강화학습과 확산 모델을 활용해 복잡한 무선 주파수 집적 회로(RFIC)를 설계하는 기술을 개발했습니다. 이 방식은 기존의 수동 설계 방식보다 훨씬 빠르게 혁신적인 레이아웃을 생성하며 설계 시간을 획기적으로 단축합니다.
Apache TVM 기반의 오픈 소스 ML 커널용 DSL 및 컴파일러인 TIRx를 소개합니다. TIRx는 빠르게 변화하는 하드웨어와 커널 요구사항에 대응하기 위해 하드웨어 네이티브 제어를 지원하며, GPU 및 AI 가속기를 대상으로 설계되었습니다.

Qualcomm NPU의 성능을 극대화하기 위해 SDK를 역공학하여 VTCM 메모리 배치 및 최적화 알고리즘을 분석한 기술 보고서입니다. HTP의 MILP 기반 배치 방식과 숨겨진 시뮬레이터 Hextimate의 존재를 밝혀냈습니다.

Apple이 Siri의 AI 역량 강화를 위해 Google Gemini와 자체 Private Cloud Compute(PCC)를 결합하는 전략을 분석합니다. 개인 데이터 보호를 위한 하드웨어 보안 모듈과 상태 비저장 설계의 기술적 구현과 보안성에 대한 논쟁을 다룹니다.

OpenCL, SYCL 등 CUDA의 대안으로 등장했던 GPU 프로그래밍 모델들이 왜 AI 컴퓨팅 시장을 지배하지 못했는지 분석합니다. 기술적 이식성에도 불구하고 위원회 주도 개발의 느린 속도와 산업계의 협력적 경쟁 구조가 한계로 작용했음을 설명합니다.

Apple이 Private Cloud Compute(PCC)를 Google Cloud로 확장하며 Google 및 NVIDIA와 협력합니다. NVIDIA GPU와 Intel TDX, Google Titan 칩을 활용하여 온디바이스를 넘어선 강력한 보안 기반의 클라우드 AI 추론 인프라를 구축합니다.

저렴한 비용으로 데이터센터용 GPU인 Tesla V100 SXM2를 구매하여 일반 게이밍 PC에 장착하는 방법을 소개합니다. 어댑터를 통해 PCIe 슬롯이 없는 SXM2 폼 팩터를 연결함으로써, 고가의 소비자용 GPU보다 뛰어난 메모리 대역폭을 확보하고 LLM 추론 성능을 높였습니다.