intel/ipex-llm
요약
IPEX-LLM은 Intel GPU, NPU 및 CPU를 활용하여 LLM 가속 라이브러리를 제공합니다. Llama, Mistral 등 70개 이상의 모델에 대한 최적화와 XPU 가속, 저비트(FP8/FP6/FP4/INT4) 지원을 통해 다양한 환경에서 대규모 언어 모델 구동이 가능해졌습니다. 최근 업데이트로는 FlashMoE를 이용한 초대형 모델 실행 및 Ollama, llama.cpp 등 주요 프레임워크와의 통합 지원 등이 포함되었습니다.
핵심 포인트
- Intel GPU/NPU/CPU 기반 LLM 가속 라이브러리 제공
- 70개 이상 모델 최적화 및 XPU 가속, 저비트 지원
- Ollama, vLLM, llama.cpp 등 주요 프레임워크와 통합 용이
- 최신 업데이트로 초대형 MoE 모델 구동 가능성 확보
Intel은 이 프로젝트의 개발 또는 지원을 제공하거나 보장하지 않으며, 유지보수, 버그 수정, 새 릴리스 또는 업데이트를 포함하되 이에 국한되지 않습니다.
이 프로젝트에 대한 패치는 더 이상 Intel에서 받아들이지 않습니다.
이 프로젝트는 알려진 보안 문제가 있는 것으로 식별되었습니다.
< English | 中文 >
IPEX-LLM은 Intel GPU (예: iGPU가 탑재된 로컬 PC, Arc와 같은 전용 GPU, Flex 및 Max) , NPU 및 CPU를 위한 LLM 가속 라이브러리입니다.
참고
IPEX-LLM은 llama.cpp, Ollama, vLLM, HuggingFace transformers, LangChain, LlamaIndex, Text-Generation-WebUI, DeepSpeed-AutoTP, FastChat, Axolotl, HuggingFace PEFT, HuggingFace TRL, AutoGen, ModeScope 등과 원활하게 통합됩니다. 70개 이상의 모델이 ipex-llm에서 최적화/검증되었습니다.
(예: Llama, Phi, Mistral, Mixtral, DeepSeek, Qwen, ChatGLM, MiniCPM, Qwen-VL, MiniCPM-V 등) 아티팩트와 함께 최첨단 LLM 최적화, XPU 가속 및 저비트(FP8/FP6/FP4/INT4) 지원을 제공합니다. 전체 목록은 여기를 참조하십시오.
-
[2025/05] FlashMoE를 사용하여 단 1~2개의 Intel Arc GPU (예: A770 또는 B580)만으로 Qwen3MoE 235B의 DeepSeek V3/R1 671B 모델을 실행할 수 있게 되었습니다.
-
[2025/04] Ollama Portable Zip과 llama.cpp Portable Zip이 포함된
ipex-llm 2.2.0을 출시했습니다.⚠️ 경고 (llama.cpp Portable Zip용)
llama.cpp의 mmap 기반 모델 로딩은 다중 테넌트 또는 공유 호스트 환경에서 사이드 채널을 통해 데이터를 유출할 수 있습니다.
mmap을 비활성화하려면 다음을 추가하십시오: --no-mmap
- [2025/04] Intel GPU용 PyTorch 2.6 지원을 추가했습니다.
- [2025/03] 최신 llama.cpp Portable Zip에 Gemma3 모델 지원을 추가했습니다. - [2025/03] 최신 llama.cpp Portable Zip을 사용하여 Xeon의 Arc A770 1개 또는 2개로 DeepSeek-R1-671B-Q4_K_M을 실행할 수 있습니다. - [2025/02] Intel GPU(Windows 및 Linux 모두)와 NPU(Windows 전용)를 위한 llama.cpp Portable Zip 지원을 추가했습니다. - [2025/02] 수동 설치가 필요 없이 Windows 및 Linux 모두에서 Intel GPU에 Ollama를 직접 실행할 수 있도록 Ollama Portable Zip 지원을 추가했습니다. - [2025/02] Intel Arc GPU에서 vLLM 0.6.6 실행 지원을 추가했습니다.
- [2025/01] Intel Arc B580 GPU에서
ipex-llm실행 가이드를 추가했습니다. - [2025/01] Intel GPU에서 Ollama 0.5.4 실행 지원을 추가했습니다. - [2024/12] Intel Core Ultra NPU(100H, 200V, 200K 및 200H 시리즈 포함)에 대한 Python 및 C++ 지원을 모두 추가했습니다.
더 많은 업데이트
- [2024/11] Intel Arc GPU에서 vLLM 0.6.2 실행 지원을 추가했습니다.
- [2024/07] Intel GPU에서 로컬 LLM을 사용하여 Microsoft의 GraphRAG를 실행하는 지원을 추가했습니다. 자세한 내용은 여기 빠른 시작 가이드를 참조하십시오. - [2024/07] StableDiffusion, Phi-3-Vision, Qwen-VL 등 대규모 멀티모달 모델에 대한 광범위한 지원을 추가했습니다.
- [2024/07] Intel GPU에서 FP6 지원을 추가했습니다. - [2024/06] Intel Core Ultra 프로세서용 실험적인 NPU 지원을 추가했습니다. 예시는 여기를 참조하십시오. - [2024/06] 2개 이상의 Intel GPU(Arc와 같은)를 사용하여 대규모 LLM을 쉽게 실행할 수 있도록 pipeline parallel 추론에 대한 광범위한 지원을 추가했습니다. - [2024/06] Intel GPU에서
ipex-llm과 함께 RAGFlow 실행 지원을 추가했습니다. - [2024/05]ipex-llm이 Intel GPU용 LLM 파인튜닝에 Axolotl을 지원하게 되었습니다. 빠른 시작 가이드는 여기를 참조하십시오. - [2024/05] 이제 Docker 이미지를 사용하여ipex-llm추론, 서빙 및 파인튜닝을 쉽게 실행할 수 있습니다. - [2024/05] 이제ipex-llm을 설치할 수 있습니다.
Windows에서 단 하나의 명령어만으로 실행할 수 있습니다. - [2024/04] 이제 Open WebUI를 ipex-llm을 사용하여 Intel GPU에서 실행할 수 있습니다.
; 빠른 시작 가이드는 여기서 확인하세요. - [2024/04] 이제 llama.cpp와 ollama를 ipex-llm과 함께 다음에서 실행할 수 있습니다.
; 빠른 시작 가이드는 여기서 확인하세요. - [2024/04] ipex-llm은 이제 Intel GPU와 CPU 모두에서 Llama 3를 지원합니다. - [2024/04] ipex-llm은 C++ 인터페이스를 제공하여 Intel GPU에서 llama.cpp 및 ollama 실행을 위한 가속 백엔드로 사용될 수 있습니다. - [2024/03] bigdl-llm은 이제 ipex-llm이 되었습니다 (마이그레이션 가이드는 여기서 확인하세요); 원래의 BigDL 프로젝트는 여기서 찾을 수 있습니다. - [2024/02] ipex-llm은 이제 ModelScope(魔搭)에서 모델을 직접 로드하는 것을 지원합니다. - [2024/02] 초기 INT2 지원 (llama.cpp IQ2 메커니즘 기반)이 추가되어 16GB VRAM으로 Intel GPU에서 대규모 LLM(예: Mixtral-8x7B)을 실행할 수 있게 되었습니다. - [2024/02] 사용자는 이제 Text-Generation-WebUI GUI를 통해 ipex-llm을 사용할 수 있습니다. - [2024/02] ipex-llm은 이제 Self-Speculative Decoding을 지원하며, 이는 Intel GPU와 CPU에서 각각 FP16 및 BF16 추론 지연 시간에 약 30%의 속도 향상을 가져옵니다. - [2024/02] ipex-llm은 이제 Intel GPU에서의 포괄적인 LLM 파인튜닝 목록(LoRA, QLoRA, DPO, QA-LoRA 및 ReLoRA 포함)을 지원합니다. - [2024/01] ipex-llm의 QLoRA를 사용하여 Standford-Alpaca에서 LLaMA2-7B를 8개의 Intel Max 1550 GPU로 21분 만에, 그리고 LLaMA2-70B를 3.14시간 만에 파인튜닝하는 데 성공했습니다 (블로그는 여기서 확인하세요). - [2023/12] ipex-llm은 ReLoRA(*
이제 Intel GPU와 CPU 모두에서 vLLM의 연속 배치 처리(continuous batching)를 지원합니다. - [2023/10]
ipex-llm
이제 Intel GPU와 CPU 모두에서 QLoRA 파인튜닝을 지원합니다. - [2023/10]
ipex-llm
이제 Intel CPU와 GPU 모두에서 FastChat 서빙(serving)을 지원합니다. - [2023/09]
ipex-llm
이제 Intel GPU (iGPU, Arc, Flex 및 MAX 포함)를 지원합니다. - [2023/09]
ipex-llm
튜토리얼이 공개되었습니다.
ipex-llm을 사용하여 Intel Core Ultra iGPU, Intel Core Ultra NPU, 단일 카드 Arc GPU 또는 다중 카드 Arc GPU에서 로컬 LLM을 실행하는 데 대한 데모를 아래에서 확인하세요.
Intel Core Ultra iGPU |
Intel Core Ultra NPU |
2-Card Intel Arc dGPUs |
Intel Xeon + Arc dGPU |
|
|
|
|
|
Ollama (Mistral-7B, Q4_K) | HuggingFace (Llama3.2-3B, SYM_INT4) | llama.cpp (DeepSeek-R1-Distill-Qwen-32B, Q4_K) | FlashMoE (Qwen3MoE-235B, Q4_K) |
Intel Core Ultra 및 Intel Arc GPU에서의 **토큰 생성 속도(Token Generation Speed)**는 아래1에서 확인하고(더 자세한 내용은 [2][3][4] 참조),
| | | |
|---|---|---||
ipex-llm을 사용하여 성능 벤치마크를 직접 실행할 수 있는 벤치마킹 가이드(Benchmarking Guide)를 따르세요.
아래의 퍼플렉서티(Perplexity) 결과를 확인하세요 (여기 있는 스크립트를 사용한 Wikitext 데이터셋 테스트 기준).
| Perplexity | sym_int4 | q4_k | fp6 | fp8_e5m2 | fp8_e4m3 | fp16 |
|---|---|---|---|---|---|
| Llama-2-7B-chat-hf | 6.364 | 6.218 | 6.092 | 6.180 | 6.098 | 6.096 |
| ... |
Ollama: 수동 설치가 필요 없는 Intel GPU에서 Ollama 실행 - llama.cpp: 수동 설치가 필요 없는 Intel GPU에서 llama.cpp 실행 - Arc B580: Ollama, llama.cpp, PyTorch, HuggingFace 등에서 Intel Arc B580 GPU 사용 - NPU: Python/C++ 또는 llama.cpp API에서 Intel NPU 사용 - PyTorch/HuggingFace/LangChain/LlamaIndex 등에서 Windows 및 Linux용 Intel GPU에서 ipex-llm 사용
- vLLM: Intel GPU와 CPU 모두에서 vLLM 내에서
ipex-llm실행 - FastChat: Intel GPU와 CPU 모두에서 FastChat 서빙 내에서ipex-llm실행 - 여러 Intel GPU에서 서빙:ipex-llm사용
여러 Intel GPU에서 서빙하는 방법: DeepSpeed AutoTP와 FastAPI를 활용하여 Text-Generation-WebUI에서 ipex-llm 실행 - oobabooga에서 ipex-llm 사용
WebUI - Axolotl: Axolotl에서 ipex-llm을 사용하여 LLM 파인튜닝 - 벤치마킹: Intel CPU와 GPU에서 ipex-llm에 대한 (지연 시간 및 처리량) 벤치마크 실행
-
C++에서의 GPU 추론:
llama.cpp,ollama등에서ipex-llm을 사용하여 Intel GPU에서 실행 - Python에서의 GPU 추론: HuggingFace의transformers,LangChain,LlamaIndex,ModelScope등에서ipex-llm을 사용하여 Intel GPU에서 실행 - vLLM on GPU:vLLM이ipex-llm과 함께 Intel GPU에서 서빙하는 방법 - vLLM on CPU:vLLM이ipex-llm과 함께 Intel CPU에서 서빙하는 방법 - FastChat on GPU:FastChat이ipex-llm과 함께 Intel GPU에서 서빙하는 방법 - VSCode on GPU: VSCode를 사용하여 Intel GPU에서 Python으로ipex-llm애플리케이션을 실행하고 개발 -
GraphRAG: 로컬 LLM을
ipex-llm을 사용하여 Microsoft의GraphRAG을 실행 -
RAGFlow:
ipex-llm과 함께RAGFlow(오픈 소스 RAG 엔진)를 실행 -
LangChain-Chatchat:
ipex-llm과 함께LangChain-Chatchat(RAG 파이프라인을 사용한 지식 기반 QA)을 실행 -
코딩 코파일럿:
Continue(VSCode의 코딩 코파일럿)을ipex-llm과 함께 실행 -
Open WebUI:
Open WebUI를ipex-llm과 함께 실행 -
PrivateGPT:
PrivateGPT를 사용하여ipex-llm으로 문서와 상호 작용 -
Dify 플랫폼:
Dify에서ipex-llm을 사용 (프로덕션 준비가 된 LLM 앱 개발 플랫폼) -
Windows GPU: Intel GPU를 사용하는 Windows에
ipex-llm설치 - Linux GPU: Intel GPU를 사용하는 Linux에ipex-llm설치 더 자세한 내용은 전체 설치 가이드를 참조하십시오 -
INT4 추론: Intel GPU와 CPU에서의 INT4 LLM 추론 - FP8/FP6/FP4 추론: Intel GPU에서의 FP8, FP6, 및 FP4 LLM 추론 - INT8 추론: Intel GPU와 CPU에서의 INT8 LLM 추론 - INT2 추론: Intel GPU에서의 INT2 LLM 추론 (llama.cpp IQ2 메커니즘 기반)
-
INT4 추론:
FP16 LLM 추론: Intel GPU에서 가능하며, 자체 예측 디코딩(self-speculative decoding) 최적화가 적용될 수 있습니다.
BF16 LLM 추론: Intel CPU에서 가능하며, 자체 예측 디코딩(self-speculative decoding) 최적화가 적용될 수 있습니다.
- 저비트 모델: 저장 및 로드
ipex-llm
저비트 모델 (INT4/FP4/FP6/INT8/FP8/FP16/등) - GGUF: GGUF 모델을 ipex-llm에 직접 로드합니다.
-
AWQ: AWQ 모델을
ipex-llm에 직접 로드합니다. -
GPTQ: GPTQ 모델을
ipex-llm에 직접 로드합니다. -
저비트 모델: 저장 및 로드
-
튜토리얼
ipex-llm에서 LLaMA/LLaMA2, Mistral, Mixtral, Gemma, LLaVA, Whisper, ChatGLM2/ChatGLM3, Baichuan/Baichuan2, Qwen/Qwen-1.5, InternLM 등 70개 이상의 모델이 최적화/검증되었습니다. 자세한 목록은 아래를 참조하십시오.
| Model | CPU Example | GPU Example | NPU Example |
|---|---|---|---|
| LLaMA | link1, link2 | link | |
| ... |
- 버그가 있거나 기능 요청 사항이 있다면 GitHub Issue를 열어 보고해 주십시오.
- 취약점이 발견되었다면 초안 GitHub Security Advisory를 열어 보고해 주십시오.
각주
- 성능은 사용, 구성 및 기타 요인에 따라 다릅니다.
ipex-llm
은 비(非)Intel 제품의 경우 동일한 수준으로 최적화되지 않을 수 있습니다. 자세한 내용은 www.Intel.com/PerformanceIndex를 참조하십시오. ↩ ↩2
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기