Show HN: KTransformers – 로컬 머신에서 236B 모델 및 1M 컨텍스트 LLM 추론 가능
요약
KTransformers는 CPU와 GPU의 이기종 컴퓨팅을 활용하여 로컬 환경에서 236B 규모의 대형 언어 모델과 1M 컨텍스트를 효율적으로 추론 및 미세 조정할 수 있게 해주는 연구 프로젝트입니다. 다양한 하드웨어 가속(Intel Arc, AMD ROCm, Ascend NPU 등)과 최신 모델(DeepSeek, Kimi, Qwen 등)에 대한 폭넓은 지원을 제공합니다.
핵심 포인트
- CPU-GPU 이기종 컴퓨팅을 통한 대규모 모델(236B) 및 긴 컨텍스트(1M) 추론 최적화
- Inference(추론)와 SFT(지도 미세 조정) 기능을 모두 제공하며 LLaMA-Factory와 통합 가능
- Intel, AMD, Ascend NPU 등 다양한 하드웨어 백엔드 및 정밀도(BF16, FP8) 지원
- DeepSeek-V3/R1, Kimi, Qwen 등 최신 오픈 소스 모델에 대한 신속한 지원
KTransformers는 CPU-GPU 이기종 컴퓨팅 (heterogeneous computing)을 통해 대규모 언어 모델 (LLM)의 효율적인 추론 (inference) 및 미세 조정 (fine-tuning)에 집중하는 연구 프로젝트입니다. 이 프로젝트는 현재 kt-kernel 소스 트리로부터 사용자 대상의 두 가지 기능인 추론 (Inference) 및 SFT (Supervised Fine-Tuning)를 제공합니다.
2026년 5월 6일: GOSIM Paris 2026의 KTransformers — "Edge에서의 Agentic AI" 트랙. 소비자용 하드웨어에서 KT의 추론 성능을 발표할 예정입니다.
2026년 5월 2일: DeepSeek-V4-Flash 지원! (튜토리얼)
2026년 4월 30일: KTransformers v0.6.1에서 추론 (Inference) 및 SFT 퀵 스타트 진입점을 분리하여 kt-kernel 추론 및 SFT 문서를 갱신했습니다.
2026년 3월 26일: KT-Kernel 추론을 위한 AVX2 전용 CPU 백엔드 지원. (튜토리얼)
2026년 2월 13일: MiniMax-M2.5 Day0 지원! (튜토리얼)
2026년 2월 12일: GLM-5 Day0 지원! (튜토리얼)
2026년 1월 27일: Kimi-K2.5 Day0 지원! (튜토리얼) (SFT 튜토리얼)
2026년 1월 22일: CPU-GPU 전문가 스케줄링 (Expert Scheduling), 채널당 네이티브 BF16 및 FP8 정밀도 (Precision), 그리고 AutoDL 통합 미세 조정 (fine-tuning) 및 추론 지원
2025년 12월 24일: 네이티브 MiniMax-M2.1 추론 지원. (튜토리얼)
2025년 12월 22일: LLaMA-Factory를 이용한 RL-DPO 미세 조정 지원. (튜토리얼)
2025년 12월 5일: 네이티브 Kimi-K2-Thinking 추론 지원 (튜토리얼)
2025년 11월 6일: Kimi-K2-Thinking 추론 (튜토리얼) 및 미세 조정 (튜토리얼) 지원
2025년 11월 4일: KTransformers 미세 조정 (Fine-Tuning) × LLaMA-Factory 통합. (튜토리얼)
2025년 10월 27일: Ascend NPU 지원. (튜토리얼)
2025년 10월 10일: SGLang 통합. (로드맵, 블로그)
2025년 9월 11일: Qwen3-Next 지원. (튜토리얼)
2025년 9월 5일: Kimi-K2-0905 지원. (튜토리얼)
2025년 7월 26일: SmallThinker 및 GLM4-MoE 지원. (튜토리얼)
2025년 7월 11일: Kimi-K2 지원. (튜토리얼)
2025년 6월 30일: 3계층 (GPU-CPU-Disk) 접두사 캐시 재사용 (prefix cache reuse) 지원.
2025년 5월 14일: Intel Arc GPU 지원 (튜토리얼).
2025년 4월 29일: AMX-Int8, AMX-BF16 및 Qwen3MoE 지원 (튜토리얼)
2025년 4월 9일: LLaMA 4 모델에 대한 실험적 지원 (튜토리얼).
2025년 4월 2일: 다중 동시성 (Multi-concurrency) 지원.
(튜토리얼).2025년 3월 15일: AMD GPU에서 ROCm 지원 (튜토리얼).2025년 3월 5일: unsloth 1.58/2.51 bits 가중치 및 IQ1_S/FP8 하이브리드 가중치 지원. 24GB VRAM에서 DeepSeek-V3 및 R1을 위한 139K 긴 컨텍스트 (Longer Context) 지원.2025년 2월 25일: DeepSeek-V3 및 R1을 위한 FP8 GPU 커널 지원; 긴 컨텍스트 (Longer Context) 지원.2025년 2월 15일: 긴 컨텍스트 (Longer Context) 지원 (24GB VRAM 기준 4K에서 8K로 확장) 및 약간 더 빠른 속도 (15% 향상, 최대 16 Tokens/s), 문서 및 온라인 서적 업데이트.2025년 2월 10일: 단일 (24GB VRAM)/다중 GPU 및 382G DRAM에서 Deepseek-R1 및 V3 지원, 최대 3~28배 속도 향상. 상세한 쇼케이스 및 재현 튜토리얼은 여기를 참조하세요.2024년 8월 28일: DeepseekV2의 필요 VRAM을 21G에서 11G로 감소.2024년 8월 15일: 인젝션 (injection) 및 다중 GPU (multi-GPU)를 위한 상세 튜토리얼 업데이트.2024년 8월 14일: 선형 백엔드 (linear backend)로서 llamfile 지원.2024년 8월 12일: 다중 GPU 지원; 새로운 모델 지원: mixtral 87B 및 822B; GPU에서의 q2k, q3k, q5k 양자화 해제 (dequant) 지원.2024년 8월 9일: Windows 네이티브 지원.
이종 (heterogeneous) LLM 추론을 위한 CPU 최적화 커널 연산.
주요 특징 (Key Features):
AMX/AVX 가속: INT4/INT8 양자화 추론 (quantized inference)을 위한 Intel AMX 및 AVX512/AVX2 최적화 커널
MoE 최적화: NUMA 인식 메모리 관리 (NUMA-aware memory management)를 통한 효율적인 전문가 혼합 (Mixture-of-Experts) 추론
양자화 지원: CPU 측 INT4/INT8 양자화 가중치, GPU 측 GPTQ 지원
쉬운 통합: SGLang 및 기타 프레임워크를 위한 깔끔한 Python API
빠른 시작 (Quick Start):
cd kt-kernel
pip install .
사용 사례 (Use Cases):
- 대규모 MoE 모델을 위한 CPU-GPU 하이브리드 추론
- 프로덕션 서빙을 위한 SGLang과의 통합
- 이종 전문가 배치 (hot experts는 GPU에, cold experts는 CPU에 배치)
성능 예시 (Performance Examples):
| 모델 | 하드웨어 구성 | 총 처리량 (Total Throughput) | 출력 처리량 (Output Throughput) |
|---|---|---|---|
| DeepSeek-R1-0528 (FP8) | 8×L20 GPU + Xeon Gold 6454S | 227.85 tokens/s | 87.58 tokens/s (8-way concurrency) |
초대형 MoE 모델 미세 조정 (fine-tuning)을 위한 KTransformers × LLaMA-Factory 통합.
주요 특징 (Key Features):
멀티 백엔드 지원 (Multi-Backend Support): INT8/INT4 양자화 (quantization)를 이용한 CPU/GPU 하이브리드 미세 조정 (fine-tuning)
초대형 MoE 지원 (Ultra-Large MoE Support): 제한된 GPU 메모리에서 DeepSeek-V3/R1과 같은 모델 미세 조정 가능
ZeRO-Offload보다 빠른 속도 (Faster than ZeRO-Offload): 벤치마크된 MoE SFT 워크로드에서 6~12배 빠른 학습 속도
낮은 CPU 메모리 사용량 (Lower CPU Memory): 벤치마크 설정에서 이전 KT SFT 경로 대비 약 절반의 CPU 메모리 사용
LLaMA-Factory 통합 (LLaMA-Factory Integration): 인기 있는 미세 조정 프레임워크와의 원활한 통합
| 모델 (Model) | GPU 메모리 (GPU Memory) | 학습 속도 (Training Speed) | 하드웨어 (Hardware) |
|---|---|---|---|
| DeepSeek-V3 | 총 ~80GB | 3.7 it/s | 4x RTX 4090 |
| ... |
빠른 시작 (Quick Start):
cd /path/to/LLaMA-Factory
pip install -e .
pip install -r requirements/ktransformers.txt
...
👉 빠른 시작 (Quick Start) →
👉 전체 문서 (Full Documentation) →
연구에 KTransformers를 사용하신다면, 저희 논문을 인용해 주세요:
@inproceedings{10.1145/3731569.3764843,
title = {KTransformers: Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models},
author = {Chen, Hongtao and Xie, Weiyu and Zhang, Boxin and Tang, Jingqi and Wang, Jiahao and Dong, Jianwei and Chen, Shaoyuan and Yuan, Ziwei and Lin, Chen and Qiu, Chengyu and Zhu, Yuening and Ou, Qingliang and Liao, Jiaqi and Chen, Xianglin and Ai, Zhiyuan and Wu, Yongwei and Zhang, Mingxing},
...
개발 및 유지 관리:
- MADSys Lab @ Tsinghua University
- Approaching.AI
- 9#AISoft
- 커뮤니티 기여자 (Community contributors)
여러분의 기여를 환영합니다! 이슈(issues)와 풀 리퀘스트(pull requests)를 자유롭게 제출해 주세요.
GitHub 이슈 (GitHub Issues): 버그 보고 또는 기능 요청
WeChat 그룹 (WeChat Group): archive/WeChatGroup.png 참조
기존의 통합된 KTransformers 프레임워크는 참조를 위해 archive/ 디렉토리에 아카이브되었습니다. 현재 프로젝트는 더 명확한 문서화와 유지 관리를 위해 위 두 가지 기능을 kt-kernel 소스 트리에서 관리합니다.
전체 빠른 시작 가이드와 예제가 포함된 기존 문서는 다음을 참조하세요:
- archive/README.md (영어)
- archive/README_ZH.md (중국어)
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기