FedericoTs/quantprobe
요약
quantprobe는 사용자의 실제 하드웨어 환경에서 다양한 GGUF 기반 LLM의 속도와 메모리 적합성을 예측하는 도구입니다. 이를 통해 모델 다운로드 전, 예상 성능(tok/s)과 필요한 배치 정보를 정확히 파악할 수 있습니다.
핵심 포인트
- 사용자 하드웨어에 최적화된 GGUF LLM 속도 및 메모리 적합성 예측 가능
- llama.cpp 명령어 자동 생성 기능 제공으로 사용 편의성 극대화
- 모델 다운로드 전 성능 테스트를 통해 자원 낭비 방지
Repository: FedericoTs/quantprobe
Language: Python
Stars: 91
Forks: 10
Topics: benchmark, gguf, hardware-detection, inference, llama-cpp, llm, local-llm, moe, performance, quantization, speculative-decoding
Description:
2016년 PC의 16GB RAM으로 110B 모델을 구동해보고 싶으신가요? 다운로드하기 전에 토큰/초(tok/s) 속도를 아세요. 예산보다 배치(Placement)가 중요합니다: 사용자의 정확한 하드웨어에서 모든 GGUF에 대한 속도 및 메모리 적합성을 예측하고, 자체적으로 보정하며, 정확한 llama.cpp 명령어를 출력해줍니다 — 또는 'quantprobe auto'를 실행하면 모든 것이 해결됩니다. 반증 테스트를 거친 법칙들; 전체 크기로 게시된 모델들을 놓치지 마세요. pip install quantprobe
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub ML Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기