Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
PCIe 엔드포인트를 위한 최초의 오픈소스 소프트 코어 프로젝트입니다. 벤더 종속적인 하드 매크로 없이 데이터 링크, 트랜잭션, 애플리케이션 계층을 지원하며 표준 PIPE 인터페이스를 제공합니다.
Intel의 Neural Speed는 Intel 플랫폼에서 LLM의 효율적인 추론을 지원하기 위해 설계된 저비트 양자화 라이브러리입니다. llama.cpp에서 영감을 받아 Intel CPU의 ISA(AMX, AVX512 등)에 최적화되었으며, 특정 모델에서 최대 40배의 성능 향상을 제공합니다.
RAD-Flow는 FPGA를 넘어선 재구성 가능한 가속 장치를 위한 아키텍처 및 애플리케이션 공동 설계 도구입니다. RAD-Sim 시뮬레이터를 기반으로 하며, Intel과 VMWare 등의 지원을 받는 연구 프로젝트입니다.
저지연 고빈도 매매(HFT)를 위한 프로덕션급 FPGA 트레이딩 시스템 오픈소스 프로젝트입니다. VHDL 기반의 10G PHY와 NASDAQ ITCH 5.0 오더북 구현, C++ DPDK/XDP 커널 바이패스 기술을 포함합니다.
JetStream은 대규모 언어 모델(LLM)의 추론 과정에 특화된 고성능 최적화 엔진입니다. 이 엔진은 XLA 디바이스, 특히 TPU 환경에서 LLM을 구동할 때 처리량과 메모리 사용량을 극대화하도록 설계되었습니다. 향후 GPU 지원도 계획되어 있어 다양한 하드웨어 환경에서의 효율적인 모델 서빙이 가능합니다.
이 프로젝트는 CUDA를 활용하여 고성능 컴퓨팅(HPC)에 필요한 다양한 핵심 알고리즘과 기술들을 연습하고 구현하는 것을 목표로 합니다. GEMM, FlashAttention, Tensor Cores와 같은 주요 연산부터 양자화 및 KV 캐시 관리까지 포함하며, CUTLASS 라이브러리와 NCCL을 사용하여 최적의 성능을 달성할 수 있는 손실 없는 CUDA 커널과 성능 최적화 기법들을 다룹니다.
deep-recall은 LLM(대규모 언어 모델)을 위한 엔터프라이즈급 메모리 프레임워크입니다. 이 프레임워크는 GPU 최적화 추론, 벡터 저장소, 자동 확장을 특징으로 하며, 효율적인 컨텍스트 검색 기능을 제공합니다. 이를 통해 사용자 개개인에게 초개인화된 고품질의 응답을 생성할 수 있도록 돕습니다.
ByteDance에서 개발한 ByteTransformer는 BERT 트랜스포머 모델의 추론(inference) 속도를 최적화하는 라이브러리입니다. 이 도구는 NVIDIA GPU 환경에 특화되어 있어, 대규모 언어 모델을 실제 서비스 환경에서 효율적으로 구동할 수 있도록 설계되었습니다. 관련 연구 논문(arXiv:2210.03052)의 내용을 기반으로 성능 향상을 목표로 합니다.
FastFold는 GPU 클러스터 환경에서 AlphaFold의 학습 및 추론 과정을 최적화하는 프로젝트입니다. 이 도구는 특히 CUDA와 같은 병렬 컴퓨팅 기술을 활용하여 대규모 단백질 구조 예측 모델인 AlphaFold의 성능을 극대화합니다. 이를 통해 연구자들이 효율적으로 단백질 접힘 문제를 해결하고 관련 생명과학 연구를 진행할 수 있도록 지원합니다.
Triton Model Navigator는 NVIDIA GPU 환경에서 딥러닝 모델을 효율적으로 최적화하고 배포하기 위해 설계된 전문적인 추론(Inference) 툴킷입니다. 이 도구는 복잡한 딥러닝 모델의 성능 향상과 실제 서비스 환경에서의 안정적인 운영에 초점을 맞추고 있습니다.
NVIDIA/DALI는 심층 학습 훈련 및 추론 애플리케이션의 성능을 극대화하기 위해 설계된 GPU 가속 데이터 처리 라이브러리입니다. 이 라이브러리는 고도로 최적화된 빌딩 블록과 실행 엔진을 제공하여, 이미지 증강(data-augmentation)부터 오디오/데이터 전처리 파이프라인까지 전체 데이터 처리를 가속합니다. 이를 통해 개발자는 GPU의 잠재력을 최대한 활용하여 빠르고 효율적인 머신러닝 워크플로우를 구축할 수 있습니다.
exllamav3는 현대 소비자급 GPU 환경에서 대규모 언어 모델(LLM)을 효율적으로 로컬 구동할 수 있도록 설계된 최적화된 양자화 및 추론 라이브러리입니다. 이 라이브러리는 LLM의 실행 성능을 극대화하는 데 초점을 맞추고 있으며, 사용자가 고성능 하드웨어 없이도 강력한 AI 기능을 경험할 수 있게 돕습니다.
MSLK(Meta Superintelligence Labs Kernels)는 생성형 AI 학습 및 추론에 특화되어 설계된 PyTorch GPU 오퍼레이터 라이브러리 모음입니다. 이 라이브러리는 FP8 행렬별 양자화, 집합 통신 등 최첨단 기술을 지원하며, 고성능 컴퓨팅 환경에서 대규모 언어 모델(LLM)의 효율적인 구동을 목표로 합니다.
이 프로젝트는 ROS2 환경에서 사용 가능한 C++ 기반의 범용 추론 엔진을 제공합니다. YOLO 모델(v5부터 v12까지, YOLO26 포함)에 대한 통합 API를 통해 객체 탐지, 분할, 자세 추정 등 다양한 기능을 지원하며, ONNX Runtime과 OpenCV를 기반으로 구축되었습니다.
YOLO 모델(v5-v12, YOLO26)을 활용할 수 있도록 설계된 크로스 플랫폼 C++ 추론 엔진입니다. 이 엔진은 검출, 분할, 포즈 추정, OBB, 분류 등 다양한 컴퓨터 비전 작업을 위한 통합 API를 제공하며, ONNX Runtime과 OpenCV를 기반으로 합니다. CPU/GPU 최적화 및 양자화 지원을 통해 프로덕션 환경에 적합한 고성능 추론이 가능합니다.
이 기술 기사는 고정밀도 저비트 LLM 추론을 위한 최첨단(SOTA) 양자화 알고리즘에 관한 것입니다. 이 알고리즘은 CPU, XPU, CUDA 등 다양한 하드웨어 환경에서 원활하게 최적화될 수 있으며, 다중 데이터 타입을 지원합니다. 특히 vLLM, SGLang, Transformers와 같은 주요 LLM 추론 프레임워크와의 완벽한 호환성을 제공하여 효율적인 저비트 LLM 배포를 가능하게 합니다.
본 프로젝트는 분석 기반 최적화(Analysis-Driven Optimization) 기법을 활용하여 처음부터 CUDA 소프트웨어 레이 트레이싱 렌더러를 구현한 것입니다. 이 렌더러는 파이썬 환경에서 쉽게 가져와 사용할 수 있도록 설계된 분산 병렬 렌더링 솔루션입니다.
SOBER은 GPU 병렬 가속을 활용하여 임의의 도메인에 대한 베이즈 최적화(Bayesian Optimization), 적분(Quadrature), 추론(Inference)을 빠르게 수행할 수 있도록 설계된 라이브러리입니다. 이 도구는 특히 복잡한 블랙박스 함수를 다루거나, 신약 개발 및 전역 최적화가 필요한 분야에서 강력한 성능을 발휘합니다. 사용자가 정의하는 임의의 도메인 위에서 효율적인 샘플링과 추론이 가능하며, 이는 기존 방법으로는 어려웠던 복잡하고 고차원적인 문제 해결에 도움을 줍니다.
LLM 및 CUDA 기반 애플리케이션의 성능을 높이기 위한 핵심 알고리즘 최적화 기법을 정리한 오픈소스 레포지토리입니다. 메모리 최적화, 커널 튜닝, 병렬 처리 전략 등 실제 개발자가 적용할 수 있는 구체적인 방법론과 코드를 제공합니다.
GPU 병렬 프로그래밍과 메모리 관리, 성능 최적화를 위한 120 일 CUDA 학습 계획입니다. 매일의 개념 설명, 연습 문제, 주의점 및 참고 문헌을 포함하며, 'Programming Massively Parallel Processors' 같은 핵심 교재를 활용합니다. 총 6 개의 캡스톤 프로젝트를 통해 실력을 다지고자 합니다.