Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Any-precision LLM은 다양한 비트 너비로 양자화된 여러 LLM을 단일 모델의 메모리 공간에 중첩하여 배포하는 효율적인 솔루션입니다. incremental upscaling 기술과 비트플레인 기반의 커스텀 CUDA 커널을 통해 메모리 점유 공간과 비용을 획기적으로 절감합니다.
가산 양자화(AQLM)를 통해 LLM을 극한으로 압축하는 공식 PyTorch 구현체와 PV-tuning 알고리즘을 소개합니다. 1비트 수준의 초저비트 양자화에서도 높은 정확도를 유지하며, Llama 및 Mistral 모델군에 적용 가능합니다.
MoE 모델의 효율적인 확장을 방해하는 메모리 오버헤드를 해결하기 위해 구조 인식 양자화(Structure-aware quantization)를 연구합니다. MoE의 고유한 희소성을 고려하여 블록, 전문가, 선형 레이어별로 최적의 비트 할당 방식을 제안합니다.
evogp 는 PyTorch 와 커스텀 CUDA 커널을 활용하여 고성능 트리 기반 진화계산 (Evolutionary Computation) 을 제공하는 GPU 가속 라이브러리입니다. 기호 회귀, 분류, 정책 최적화 등 다양한 작업을 지원하며, 다중 출력 트리 및 벤치마크 도구 같은 고급 기능을 갖추고 있어 대규모 데이터셋과 복잡한 모델 구조를 다루는 연구자와 개발자들에게 유용합니다.
sahibzada-allahyar/Obsidian-Memory-Transformer 레포지토리는 대규모 컨텍스트 윈도우를 위한 혁신적인 장기 기억 (LTM) 메커니즘을 갖춘 새로운 LLM 아키텍처입니다. 고성능 저수준 C++ 및 CUDA 로 작성되어 최적화된 성능을 제공합니다.