Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
하드웨어 설계 경험이 없는 개발자들이 TPU의 작동 원리를 직접 이해하기 위해 추론과 학습이 모두 가능한 장난감 TPU를 재발명한 프로젝트입니다. 외부 자료에 의존하기보다 스스로 메커니즘을 도출하는 '재발명' 철학을 바탕으로 딥러닝 기초와 하드웨어 설계를 학습하는 과정을 담고 있습니다.
Cerebrium은 ML/AI 애플리케이션의 구축, 배포 및 확장을 지원하는 서버리스 인프라스트럭처 플랫폼입니다. 초기 추론(Inference) 중심에서 학습(Training) 및 데이터 처리로 기능을 확장하며, AI 개발 라이프사이클 전체를 아우르는 것을 목표로 합니다.
Tavus는 인간과 자연스러운 대화가 가능한 1초 미만의 지연 시간을 가진 실시간 AI 비디오 에이전트를 개발했습니다. 이를 위해 NeRF에서 Gaussian Splatting으로 백본을 전환하고, GPU 메모리 및 프로세스 최적화를 통해 확장성과 비용 효율성을 동시에 확보했습니다.
ZSE(Z Server Engine)는 네이티브 INT4 CUDA 커널을 사용하는 초고효율 오픈 소스 LLM 추론 엔진입니다. 3.9초의 빠른 콜드 스타트를 지원하며, 낮은 GPU 메모리 환경에서도 대규모 모델을 효율적으로 실행하고 학습할 수 있도록 설계되었습니다.

NVIDIA가 Ampere, Lovelace, Hopper GPU 아키텍처에서 LLM 추론 성능을 최적화하기 위한 오픈 소스 소프트웨어인 TensorRT-LLM을 도입했습니다. 이 도구는 최적화된 커널과 멀티 GPU 통신 기능을 제공하며, 인플라이트 배칭 및 양자화 등의 기술을 통해 H100 GPU 사용 시 A100 대비 최대 8배의 성능 향상을 구현합니다.
Zipslicer는 대규모 PyTorch 체크포인트를 소비자용 하드웨어에서도 효율적으로 사용할 수 있도록 점진적 로딩(incremental loading)을 지원하는 Python 라이브러리입니다. 이를 통해 메모리 제한이 있는 환경에서도 BLOOM-176B와 같은 거대 언어 모델(LLM)을 실행하거나 대규모 배치 처리를 수행할 수 있습니다.
KVSplit은 Apple Silicon 환경에서 KV 캐시의 Key와 Value에 서로 다른 양자화 정밀도를 적용하여 메모리 효율을 극대화하는 기술입니다. 이를 통해 품질 저하를 최소화하면서 메모리 사용량을 최대 72% 절감하고, 동일 메모리 내에서 2~3배 더 긴 컨텍스트를 실행할 수 있습니다.