
llama.cpp를 위한 제어판을 만들었습니다 (이제 vLLM도 구동 가능), 순수 표준 라이브러리 백엔드, 오프라인 실행, 사용자가 소유합니다
요약
llama.cpp와 vLLM을 로컬 환경에서 쉽게 관리할 수 있는 웹 기반 제어판인 LlamaForge를 소개합니다. 복잡한 터미널 명령어나 플래그 설정 없이 브라우저를 통해 모델 빌드, 다운로드, 서버 설정을 직관적으로 제어할 수 있습니다.
핵심 포인트
- llama.cpp 및 vLLM을 위한 가벼운 웹 GUI 제공
- 하드웨어(CUDA, Metal 등)에 맞춘 CMake 플래그 자동 감지 및 빌드
- HuggingFace 모델 검색 및 VRAM 용량 기반 양자화 적합도 평가
- 실시간 GPU 메트릭 및 모델별 서버 설정 핫 리로드 지원
- 순수 Python 표준 라이브러리 기반의 가벼운 백엔드
https://i.redd.it/ycnzi4ho6hdh1.gif 저는 모델들을 제 컴퓨터에서 로컬로 돌리는 것을 좋아하고 llama-server도 마음에 들지만, 약 220개의 플래그를 외우거나 빌드를 관리하는 것은 좋아하지 않습니다. LM Studio / Ollama / Jan은 설정이 필요 없는 환경에서는 훌륭하지만, 실제 llama.cpp 서버를 숨깁니다. 저는 그 반대를 원했습니다 — 터미널 조작 없이 브라우저에서 모델별 전체 제어권을 갖는 것입니다. 그래서 LlamaForge를 만들었습니다. 이는 llama.cpp 자체 서버 위에 구축된 얇은 제어판입니다. 자체 추론 코드는 없으며, 원격 측정(telemetry)도 없습니다. 백엔드는 순수 Python 표준 라이브러리(pip 설치할 것이 없음)로 되어 있습니다. 이 도구가 하는 일: 대시보드에서 CMake 플래그를 CPU/GPU에 맞춰 자동 감지하여 llama.cpp를 빌드/업데이트합니다 (CUDA 아키텍처, AVX-512, Metal). 업스트림 대비 얼마나 뒤처져 있는지 알려줍니다. HuggingFace에서 모델을 검색하고 실제 VRAM과 비교하여 모든 양자화(quant)에 대해 평점(FITS / TIGHT / CPU-OFFLOAD)을 매긴 후 다운로드합니다. Multi-shard + vision mmproj도 처리합니다. 그룹화되고 검색 가능한 방식으로 모델별 모든 서버 노브(컨텍스트, KV-캐시 유형, 스펙 디코딩, 텐서 분할, rope, 샘플링 등)를 조정합니다. 재시작 없이 핫 리로드됩니다. 라우터 자체 메트릭에서 스크래핑한 실시간 GPU 미터(사용 및 여유 VRAM, 활용률, 온도)와 모델별 사용 통계를 제공합니다. https://preview.redd.it/8s0hlq5y6hdh1.png?width=1249&format=png&auto=webp&s=ad075a04145b542c9e9fdeb8507c76c0c2727a0f 출시 이후 추가된 기능: vLLM을 두 번째 엔진으로 지원합니다 (Windows의 WSL2를 통해 safetensors / AWQ / GPTQ / FP8 / NVFP4 사용) — 동일한 모델 목록입니다. 크로스 플랫폼: Windows (CUDA), Linux (CUDA/CPU), macOS (Apple Silicon/Metal). 행에서 빠른 로드, 이름 지정된 프리셋(
이것은 독립적인 래퍼 (wrapper)입니다 — llama.cpp/ggml과 관련이 없습니다; 실제 모든 속도와 모델 지원은 그들의 것입니다. 업스트림 (upstream)을 지원해 주세요. 네, 이 프로젝트는 AI의 도움을 많이 받았습니다 (테스트와 함께 공개적으로 구축되었습니다). 저는 모든 것을 검토하지만, 그렇지 않은 척하지는 않겠습니다. 저장소(Repo) + 스크린샷: github.com/dadwritestech/LlamaForge 진심으로 피드백을 기다립니다. 특히 현재 사용 중인 llama.cpp 워크플로우와 비교했을 때 무엇이 부족한지, 그리고 귀하의 하드웨어에서 작동하지 않는 모든 것에 대해 알려주세요. 마음껏 비판해 주세요. https://preview.redd.it/lmfyfnup6hdh1.png?width=1280&format=png&auto=webp&s=22834c623bb168bc34941ab46142c91bee6cb50e /u/Sleepybear2611에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기