
XeBoostLM: Intel NPU 및 iGPU용 네이티브 C++ 로컬 LLM
요약
XeBoostLM은 Intel NPU 및 iGPU를 활용하여 로컬 LLM을 구동하기 위해 C++로 구축된 초경량 CLI 도구입니다. Python 백엔드 의존성을 제거하고, 네이티브 C++와 OpenVINO GenAI 라이브러리를 사용하여 메모리 효율성과 성능을 극대화했습니다. NPU, GPU, CPU를 스마트하게 라우팅하는 기능과 OpenAI 호환 서버 기능을 제공하여 다양한 환경에서 쉽게 LLM을 테스트할 수 있습니다.
핵심 포인트
- Intel Core Ultra NPU 및 Arc iGPU에 최적화된 로컬 LLM 도구입니다.
- Python 오버헤드가 없는 네이티브 C++로 구현되어 메모리 효율성이 높습니다.
- NPU, GPU, CPU를 자동으로 라우팅하는 하이브리드 모드를 지원합니다.
- OpenAI 호환 서버와 CLI 인터페이스를 제공하여 즉시 사용 가능합니다.
안녕하세요, 인텔 하드웨어에서 로컬 LLM을 실험해 왔는데, 무거운 Python 백엔드에 의존하지 않는 초최적화된 독립형 CLI 도구가 필요했습니다. 그래서 OpenVINO GenAI 라이브러리를 사용하여 XeBoostLM을 전적으로 C++로 구축했습니다. 이 도구는 특히 Intel Core Ultra NPU (AI Boost), Arc iGPU, 그리고 생성 과정에서 Python 오버헤드가 없는 CPU를 목표로 합니다. [GitHub 링크: github.com/balaragavan2007/XeBoostLM] 현재 기능은 다음과 같습니다:
- 네이티브 C++ 실행: MSVC를 통해 컴파일되었습니다. 매우 가벼운 메모리 사용량을 자랑합니다.
- 스마트 하드웨어 라우팅: NPU, GPU 또는 CPU를 수동으로 지정하거나, 처리량과 호스트 응답성을 균형 있게 맞추기 위해 HYBRID 모드로 실행할 수 있습니다.
- OpenAI 호환 서버:
xeboost serve를 실행하여 Server-Sent Events (SSE) 스트리밍을 지원하는 HTTP 서버를 즉시 구동합니다. Open WebUI와 LibreChat에 별도의 설정 없이 바로 연결됩니다. - 다이내믹 카탈로그:
xeboost pull은 캐시된 원격 카탈로그를 사용하여 최적화된 INT4/INT8 모델(Qwen 2.5, Phi-3.5, Llama 3.2, DeepSeek R1)을 자동으로 가져오고 검증합니다. - 터미널 REPL:
xeboost chat <model>을 실행하여 CLI에서 바로 다중 턴 대화를 나눌 수 있습니다.
이것은 v0.1.2 버전입니다. 방금 자동화된 GitHub 카탈로그와 REST API를 안정화했습니다. 인텔 칩을 가진 분이라면 누구나 테스트해 보거나, CLI를 사용하거나, 프론트엔드에 연결하여 성능을 알려주시면 감사하겠습니다! 피드백, 기능 요청 또는 PR은 언제나 환영합니다.
/u/Spiritual-Ad-5916 작성
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기