Prism Bonsai 27B 실행 방법
요약
Prism Bonsai 27B 모델을 실행하기 위한 llama.cpp 컴파일 및 설정 방법을 설명합니다. Mac의 Metal 환경과 CUDA 환경에 맞춘 빌드 명령어와 huggingface-cli를 활용한 모델 다운로드 과정을 다룹니다.
핵심 포인트
- llama.cpp를 활용한 Prism Bonsai 27B 실행 가이드
- Mac(Metal) 및 NVIDIA(CUDA) 환경별 컴파일 방법 제공
- huggingface-cli를 이용한 GGUF 파일 다운로드 팁
- llama-server 실행을 위한 권장 파라미터 설정 안내
그들의 GitHub에 따르면, 필요한 파일은 -Q2_0.gguf 버전이며, 이를 위해서는 그들이 제공하는 버전의 llama.cpp를 컴파일해야 합니다. 가장 쉬운 다운로드 방법은 사용 가능한 경우 huggingface-cli를 사용하는 것입니다: hf download prism-ml/Ternary-Bonsai-27B-gguf --include "-Q2_0.gguf" 만약 그렇지 않다면, https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf/tree/main 에서 파일을 다운로드하여 적절한 곳에 저장하세요. 이제, llama.cpp를 컴파일해야 합니다:
git clone https://github.com/PrismML-Eng/llama.cpp prism-llama.cpp
cd prism-llama.cpp
For Mac:
cmake -B build -DGGML_METAL=ON
cmake --build build --config Release -j$(sysctl -n hw.logicalcpu)
저는 Mac을 사용 중이므로 -DGGML_METAL=ON을 사용하고 있습니다. 만약 다른 플랫폼을 사용 중이고 CUDA가 필요하다면 다음과 같이 사용할 수 있습니다:
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
또한 -j 형식이 다양하게 나타나는데, 이는 컴파일에 사용하려는 코어의 수입니다. 이제, 다음과 같이 llama-server를 실행할 수 있습니다:
build/bin/llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf:Ternary-Bonsai-27B-Q2_0 --port 8080 --host 0.0.0.0 --temp 0.7 --top-p 0.95 --top-k 20 -n 256
파일을 수동으로 다운로드했다면, -hf 스위치 대신 gguf 파일 경로를 -m과 함께 전달하세요. 필요한 경우 추가 파라미터를 추가하십시오. --temp 0.7 --top-p 0.95 --top-k 20는 그들의 페이지에 명시된 권장 기본값입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기