
1-bit LLM「Bonsai」 활용 가이드 — 1.15GB로 구동되는 8B 모델을 로컬에서 활용하기
요약
PrismML이 발표한 1-bit LLM 'Bonsai'는 8B 모델을 1.15GB의 초소형 용량으로 구현하여 GPU 없는 환경에서도 구동 가능합니다. 처음부터 1-bit로 학습된 이 모델은 기존 양자화 방식과 달리 높은 효율성과 성능을 동시에 제공합니다.
핵심 포인트
- 8B 모델을 1.15GB 용량으로 구현하여 극도의 저용량 실현
- 양자화가 아닌 스크래치부터 1-bit로 학습된 진정한 1-bit 모델
- GPU 없는 일반 PC 및 모바일 디바이스에서도 실용적 추론 가능
- Apache 2.0 라이선스로 상업적 이용에 제한 없음
- 전용 추론 커널이 필요하여 기존 llama.cpp 등과는 별도 사용 필요
서론
2026년 3월 31일, Caltech 출신의 스타트업 PrismML이 1-bit LLM 패밀리인 Bonsai를 발표했습니다. 8B 클래스의 모델이 불과 1.15GB, 필요 메모리는 약 1.5GB로 동작하며, GPU가 없는 일반 PC에서도 실용적인 속도로 추론할 수 있다는 점이 큰 화제가 되고 있습니다.
Bonsai의 주목할 만한 포인트는 다음 세 가지입니다.
진정한 1-bit 모델— 양자화(Quantization)가 아니라, 처음부터 1-bit(+1 / -1만 사용)로 학습 -
압도적인 저용량(Footprint)— 8B 모델이 1.15GB. 동일 클래스의 16-bit 모델의 약 1/14 -
Apache 2.0 라이선스— 상업적 이용을 포함하여 제한 없음
이 기사에서는 Bonsai의 개요와 설정 절차를 파악한 후, 로컬 채팅 · OpenAI 호환 API를 통한 앱 통합 · 도구 호출(Tool Calling) · 코딩 에이전트 연동과 같은 활용법을 현시점에서의 "적합성 및 부적합성"을 포함하여 정리합니다.
Bonsai 개요
"진정한 1-bit"란 무엇이 새로운가
기존의 경량화는 16-bit 또는 32-bit로 학습한 모델의 가중치(Weights)를 나중에 4-bit 등으로 반올림하는 **학습 후 양자화 (Post-Training Quantization)**가 주류였습니다. 이에 반해 Bonsai는 임베딩 층(Embedding Layer) · 어텐션 층(Attention Layer) · MLP 층 · LM 헤드까지 네트워크 전체를 1-bit 상태로 스크래치(Scratch)부터 학습했습니다. 고정밀도를 유지하기 위한 "도피처" 역할을 하는 레이어가 존재하지 않는 것이 특징입니다.
그 결과, 8B 클래스이면서 파일 크기 1.15GB라는 극소형 사이즈를 실현하면서도, 표준 벤치마크에서는 동일 클래스의 풀 정밀도(Full Precision) 모델과 경쟁하는 성능을 보여주고 있습니다.
모델 라인업
| 모델 | 파라미터 | 파일 크기 | 특징 |
|---|---|---|---|
| Bonsai 1.7B | 1.7B | 수백 MB | 최경량. 임베디드 · 실험용 |
| Bonsai 4B | 4B | ~600MB | 경량과 균형의 중간 |
| Bonsai 8B | 8.2B | 1.15GB | 일상 용도의 메인 모델 |
| Bonsai 27B | 27B | — | 이미지 입력 · 도구 호출 대응, 최대 262K 컨텍스트 |
나아가 2026년 4월 16일에는, 사이즈를 조금 희생하는 대신 품질을 높인 1.58-bit 버전의 "Ternary Bonsai"(가중치가 -1 / 0 / +1인 3값) 패밀리도 발표되었습니다. 공식 데모에서는 이것이 기본값으로 설정되어 있으며, iPhone 급의 디바이스에서도 동작한다는 보고가 있습니다.
벤치마크
Bonsai 8B는 MMLU-R에서 65.7, 주요 벤치마크 평균에서 70.5를 기록하며, 16GB 급의 Mistral 8B나 Olmo 7B와 거의 동등한 위치에 있습니다. "14배 작으면서도 동등한 정밀도"가 PrismML의 주장입니다.
설정 — 우선 구동하기
주의: 일반적인 llama.cpp / Ollama / LM Studio에서는 동작하지 않음
Bonsai는 특수한 1-bit 포맷을 사용하기 때문에, 전용 추론 커널(Inference Kernel)이 필요합니다. 2026년 7월 시점에서는 일반적인 llama.cpp · Ollama · LM Studio는 아직 대응하지 않으므로, PrismML의 llama.cpp 포크(Fork) 버전이나 공식 데모 리포지토리를 사용해야 합니다. 이 부분이 첫 번째 난관이 될 수 있습니다.
공식 데모 리포지토리 (Bonsai-demo) 사용하기
가장 간단한 방법은 공식 Bonsai-demo 리포지토리를 사용하는 것입니다. setup.sh가 의존성 설치 · 모델 다운로드 · 바이너리 취득까지 한꺼번에 수행해 줍니다.
# macOS / Linux
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
...
# Windows (PowerShell)
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
...
모델 패밀리와 사이즈는 환경 변수로 전환합니다.
| 환경 변수 | 값 | 의미 |
|---|---|---|
BONSAI_FAMILY | ternary (기본값) / bonsai | 1.58-bit 버전인지 1-bit 버전인지 |
BONSAI_MODEL | 27B (기본값) / 8B / 4B / 1.7B | 모델 사이즈 |
BONSAI_TOKEN | Hugging Face 리드 토큰 | 27B (비공개 리포지토리) 접속에 필요 |
프롬프트 입력해 보기
# llama.cpp를 통해 1회 추론 (Mac / Linux)
./scripts/run_llama.sh -p "日本の首都はどこですか?" (일본의 수도는 어디입니까?)
# 사이즈를 변경하여 실행
...
Apple Silicon Mac이라면 MLX 버전도 사용할 수 있습니다.
source .venv/bin/activate
./scripts/run_mlx.sh -p "こんにちは" (안녕하세요)
지원되는 백엔드는 Mac (Metal), Linux / Windows (CUDA, Vulkan, ROCm), 그리고 CPU입니다. 실측 데이터에 따르면 GPU가 없는 Windows PC (CPU 전용)에서 약 11~12 토큰/초, Vulkan을 통한 내장 GPU에서 14~15 토큰/초라는 보고가 있어, 채팅 용도로는 충분한 속도가 나옵니다.
활용법 1 — 로컬 채팅 · 요약 · 문서 처리
Bonsai 8B의 핵심 용도는 "빠른 로컬 응답이 느린 API 호출을 이기는" 타입의 일상적인 태스크입니다. PrismML 스스로도 채팅, 요약, 문서 검색이라면 8B가 "데일리 드라이버(Daily Driver)로서 실용적"이라고 정의하고 있습니다.
채팅 서버를 실행하면 브라우저의 Web UI를 통해 사용할 수 있습니다.
# http://localhost:8080 에서 Web 채팅 UI가 실행됨
./scripts/start_llama_server.sh
# 가볍게 구동하고 싶다면 4B로 전환
...
일본어도 상당히 자연스러우며, "저는 PrismML이 개발한 AI 어시스턴트 Bonsai입니다"라고 자기 인식을 할 정도로 인스트럭션 튜닝 (Instruction Tuning)이 잘 적용되어 있습니다. 다음과 같은 용도는 8B로도 실용적인 수준입니다.
- 회의록 · 기사 요약
- 이메일이나 문장의 초안 작성 · 리라이팅 (Rewriting)
- 기밀 문서를 클라우드에 보내지 않고 다루는 로컬 RAG (Retrieval-Augmented Generation)의 생성부
- 네트워크를 사용할 수 없는 오프라인 환경에서의 파트너
활용법 2 — OpenAI 호환 API로 앱에 통합
start_llama_server.sh가 실행하는 서버는 OpenAI 호환 API를 제공합니다. 즉, 기존 OpenAI SDK 코드의 목적지(Endpoint)를 바꾸는 것만으로 자작 앱의 추론 엔진을 Bonsai로 교체할 수 있습니다.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8080/v1",
...
)
API 비용 제로, 낮은 레이턴시 (Latency), 데이터 유출 방지라는 세 가지 장점이 모두 갖춰져 있어 다음과 같은 통합에 적합합니다.
- 사내 도구의 요약 · 분류 · 태그 지정 등의 고빈도 · 저단가 태스크
- 클라우드 LLM의 전단에 배치하는 라우터 / 전처리 (간단한 질문은 로컬에서 완결)
- SaaS 비용 절감을 위한 폴백 (Fallback) 대상
활용법 3 — 툴 호출 (Tool Calling) · MCP 연동
27B 모델 (및 Ternary-Bonsai 27B)은 OpenAI 스타일의 Function Calling을 네이티브로 지원하며, MCP 서버와의 연동이나 Open WebUI + 코드 인터프리터 (Code Interpreter)를 조합한 에이전트 데모도 공식적으로 제공됩니다.
- 이미지 입력: 27B는 채팅 UI 및 API를 통해 이미지를 수용
- 툴 호출 (Tool Calling): OpenAI 형식의 툴 정의를 그대로 사용 가능
- 추론 모드: 대화마다 reasoning effort를 조정 가능
- 최대 262,144 토큰의 롱 컨텍스트 (Long Context, 27B 기준)
27B 모델에서도 추정 피크 메모리는 **약 5.2GiB (10K 컨텍스트 시) ~ 14.4GiB (Ternary 27B · 100K 컨텍스트 시)**로, 일반적인 노트북 PC의 메모리 범위 내에 들어옵니다. "로컬에서 완결되는 작은 에이전트"를 구축하기 위한 토대로서 현실적인 선에 진입했습니다.
활용법 4 — 코딩 에이전트의 백엔드 (현재는 어려움)
OpenAI 호환 API가 있으므로, Claude Code나 Aider의 백엔드로 Bonsai를 지정하는 것 자체는 가능합니다. 다만, 실제로 테스트한 검증 기사에서는 현시점에서는 실용적이라고 말하기 어렵다는 결과가 나왔습니다.
- Claude Code는 토큰 소비량이 방대하여, Bonsai 8B의 생성 속도로는 에이전트 루프(Agent Loop)를 다 돌리지 못함
- Aider는 비교적 가벼워 "그나마 낫지만", 직접 API를 호출하는 경우와 비교해 명확한 우위는 없음
검증자의 결론은 "Bonsai는 에이전트의 두뇌가 아니라, API를 직접 호출하는 용도의 경량 엔진으로 사용하는 것이 정답"이라는 것입니다. 에이전트 용도는 27B + 도구 호출(Tool Calling)의 성숙이나, 향후 모델 강화를 기다려야 하는 단계라고 할 수 있습니다.
현시점의 제약 및 주의사항
- 에코시스템 미지원: LM Studio나 일반적인 Ollama는 아직 1-bit 포맷을 지원하지 않음. PrismML 포크(Fork) 빌드가 필요함 (Ollama에서 모델을 pull 하는 것 자체는 가능해도 실행은 불가능)
- 벤치마크는 자사 발표 중심: 독립적인 검증은 앞으로 진행될 예정. 특히 일본어와 같이 복잡한 태스크는 사전 확인이 필요함
- 작은 사이즈 주의: 1.7B는 품질 면에서 용도를 가린다는 보고가 많으므로, 우선 8B부터 시도하는 것이 무난함
- 파인튜닝 (Fine-tuning): 1-bit 형식 특성상 기존의 튜닝 툴체인(Toolchain)을 그대로 사용할 수 없으며, 커뮤니티에서 검증이 진행 중인 단계
Ternary Bonsai — 1.58-bit라는 현실적인 해답
4월 16일에 추가된 Ternary Bonsai는 가중치를 -1 / 0 / +1의 3값(1.58-bit)으로 설정함으로써, 약간의 사이즈 증가와 맞바꾸어 1-bit 버전보다 품질을 높인 패밀리입니다. 공식 데모의 기본값이 이미 Ternary로 설정되어 있어, "품질의 Ternary, 극소형의 1-bit"라는 역할 분담이 이루어질 것으로 보입니다. 메모리 8GB급 머신이나 iPhone에서의 동작 보고도 있어, 에지 디바이스(Edge Device)로의 본격적인 전개는 이쪽이 본령이 될 것으로 보입니다.
요약
- Bonsai는 PrismML이 2026년 3월 말에 공개한, 스크래치(Scratch)부터 1-bit로 학습된 최초의 상용 실용 LLM 패밀리 (1.7B / 4B / 8B / 27B, Apache 2.0)
- 8B는 1.15GB · 필요 메모리 약 1.5GB. GPU 없는 CPU 환경에서도 11~12 토큰/초로 구동 가능
- 현시점의 최적의 용도는 로컬 채팅 · 요약 · 문서 처리 및 OpenAI 호환 API를 통한 앱 임베딩
- 27B는 이미지 입력 · 함수 호출 (Function Calling) · MCP 연동 · 262K 컨텍스트를 지원하며, 로컬 에이전트의 토대로 쓰일 수 있음
- Claude Code / Aider 등 코딩 에이전트의 두뇌로서는 현시점에서는 역부족. "API를 직접 호출하는 경량 엔진"으로 사용하는 것이 정답
- 일반적인 llama.cpp / Ollama / LM Studio는 미지원하므로, 공식 Bonsai-demo 또는 PrismML 포크를 사용할 것
"추론에 GPU는 거의 필요 없게 될 것"이라는 평가까지 나오고 있는 Bonsai. 우선 가지고 계신 노트북 PC에서 setup.sh를 실행하여 1-bit LLM의 속도를 체감해 보시기 바랍니다.
참고
- PrismML — Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs
- PrismML-Eng/Bonsai-demo — GitHub
- prism-ml/Bonsai-8B-gguf — Hugging Face
- 「스마트폰에서 구동되는」 80억 파라미터 LLM――1.15GB로 실운용 수준을 주장하는 「1-bit Bonsai」가 화제 — ITmedia
- 갑자기 실용화된 1비트 LLM Bonsai-8B, 이제 추론에 GPU는 거의 불필요해진다 — WirelessWire News
- Claude Code를 로컬 LLM(Gemma 4, Qwen 3.6, Bonsai 8B)으로 구동해 보았다 — GMO 인터넷 그룹
- Bonsai-8B 철저 해설: 1-bit LLM이 개척하는 로컬 AI의 새로운 시대 — Qiita
- Bonsai 8B(1bit LLM)를 GPU 없는 Windows PC에서 구동하기 — uepon의 일상 메모
- 1비트 모델 「Bonsai」를 시도해 보다 — Zenn
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기