
1-bit LLM「Bonsai」활용 가이드 — 1.15GB로 구동되는 8B 모델을 로컬에서 완벽하게 활용하기
요약
PrismML이 발표한 1-bit LLM 'Bonsai'는 8B 모델을 1.15GB의 초경량 사이즈로 구현하여 GPU 없는 환경에서도 구동 가능합니다. 스크래치부터 1-bit로 학습된 이 모델은 기존 양자화 모델과 달리 높은 효율성을 자랑하며 로컬 환경 활용 가이드를 제공합니다.
핵심 포인트
- 8B 모델을 1.15GB 크기로 구현하여 메모리 효율 극대화
- 양자화가 아닌 처음부터 1-bit로 학습된 진정한 1-bit 모델
- Apache 2.0 라이선스로 상업적 이용 가능
- 전용 추론 커널이 필요하며 공식 데모 리포지토리 활용 권장
- MMLU-R 등 주요 벤치마크에서 기존 모델과 대등한 성능 입증
2026년 3월 31일, Caltech 출신의 스타트업 PrismML이 1-bit LLM 패밀리 Bonsai를 발표했습니다. 8B 클래스의 모델이 불과 1.15GB, 필요 메모리 약 1.5GB로 동작하며, GPU 없는 일반 PC에서도 실용적인 속도로 추론할 수 있다는 점이 큰 화제가 되고 있습니다.
Bonsai의 주목할 포인트는 다음 3가지입니다.
진정한 1-bit 모델— 양자화(Quantization)가 아니라, 처음부터 1-bit(+1 / -1만 사용)로 학습 -
압도적인 저용량(Small Footprint)— 8B 모델이 1.15GB. 동일 클래스 16-bit 모델의 약 1/14 -
Apache 2.0 라이선스— 상업적 이용을 포함하여 제한 없음
이 기사에서는 Bonsai의 개요와 설정 절차를 파악한 후, 로컬 채팅·OpenAI 호환 API를 통한 앱 통합·도구 호출(Tool Calling)·코딩 에이전트 연동과 같은 활용법을 현시점에서의 "적합성 및 부적합성"을 포함하여 정리합니다.
기존의 경량화는 16-bit 또는 32-bit로 학습한 모델의 가중치를 나중에 4-bit 등으로 반올림하는 **학습 후 양자화 (Post-Training Quantization)**가 주류였습니다. 이에 반해 Bonsai는 임베딩 층(Embedding Layer)·어텐션 층(Attention Layer)·MLP 층·LM 헤드(LM Head)까지 네트워크 전체를 1-bit 상태로 스크래치(Scratch)부터 학습했습니다. 고정밀도를 유지하기 위한 "도피처" 역할을 하는 레이어가 존재하지 않는 것이 특징입니다.
그 결과, 8B 클래스임에도 불구하고 파일 크기 1.15GB라는 극소형 사이즈를 실현하면서도, 표준 벤치마크에서는 동일 클래스의 풀 정밀도(Full Precision) 모델과 경쟁하는 성능을 보여주고 있습니다.
| 모델 | 파라미터 | 파일 크기 | 특징 |
|---|---|---|---|
| Bonsai 1.7B | 1.7B | 수백 MB | 가장 가벼움. 임베딩 및 실험용 |
| Bonsai 4B | 4B | ~600MB | 경량과 균형의 중간 |
| Bonsai 8B | 8.2B | 1.15GB | 일상 용도의 메인 모델 |
| Bonsai 27B | 27B | — | 이미지 입력·도구 호출 대응, 최대 262K 컨텍스트 |
나아가 2026년 4월 16일에는, 사이즈를 조금 희생하는 대신 품질을 높인 1.58-bit 버전의 「Ternary Bonsai」(가중치가 -1 / 0 / +1인 3진수) 패밀리도 발표되었습니다. 공식 데모에서는 이것이 기본값으로 설정되어 있으며, iPhone 급의 디바이스에서도 동작한다는 보고가 있습니다.
Bonsai 8B는 MMLU-R에서 65.7, 주요 벤치마크 평균에서 70.5를 기록하며, 16GB 급의 Mistral 8B나 Olmo 7B와 거의 동등한 위치에 있습니다. "14배 작으면서도 동등한 정밀도"가 PrismML의 주장입니다.
현시점의 벤치마크는 PrismML 스스로가 공표한 수치가 중심이며, 독립적인 평가 플랫폼에서의 검증은 아직 제한적입니다. 도입 전에 자신의 유스케이스에서 품질을 확인하는 것을 권장합니다.
Bonsai는 특수한 1-bit 포맷을 사용하기 때문에 전용 추론 커널(Inference Kernel)이 필요합니다. 2026년 7월 시점에서는 일반적인 llama.cpp·Ollama·LM Studio는 아직 대응하지 않으므로, PrismML의 llama.cpp 포크(Fork) 또는 공식 데모 리포지토리를 사용해야 합니다. 이 부분이 첫 번째 걸림돌이 될 수 있습니다.
가장 간단한 방법은 공식 Bonsai-demo 리포지토리를 사용하는 것입니다. setup.sh가 의존성 설치, 모델 다운로드, 바이너리 취득까지 한꺼번에 수행해 줍니다.
# macOS / Linux
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
...
# Windows (PowerShell)
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
...
모델 패밀리와 사이즈는 환경 변수로 전환합니다.
| 환경 변수 | 값 | 의미 |
|---|---|---|
BONSAI_FAMILY | ternary (기본값) / bonsai | 1.58-bit 버전인지 1-bit 버전인지 |
BONSAI_MODEL | 27B (기본값) / 8B / 4B / 1.7B | 모델 사이즈 |
BONSAI_TOKEN | Hugging Face 리드 토큰 | 27B (비공개 리포지토리) 사용 시 필요 |
# llama.cpp를 통해 1회 추론 (Mac / Linux)
./scripts/run_llama.sh -p "日本の首都はどこですか?"
# 사이즈를 변경하여 실행
...
Apple Silicon Mac이라면 MLX 버전도 사용할 수 있습니다.
source .venv/bin/activate
./scripts/run_mlx.sh -p "こんにちは"
지원되는 백엔드는 Mac (Metal), Linux / Windows (CUDA・Vulkan・ROCm), 그리고 CPU입니다. 실측 결과로는 GPU가 없는 Windows PC (CPU 전용)에서 약 11~12 토큰/초, Vulkan을 통한 내장 GPU에서 14~15 토큰/초라는 보고가 있어, 채팅 용도로는 충분한 속도가 나옵니다.
Bonsai 8B의 핵심 용도는 "빠른 로컬 응답이 느린 API 호출을 이기는" 타입의 일상적인 태스크입니다. PrismML 스스로도 채팅, 요약, 문서 검색이라면 8B가 "데일리 드라이버(Daily Driver)로서 실용적"이라고 위치를 정하고 있습니다.
채팅 서버를 실행하면 브라우저의 Web UI를 통해 사용할 수 있습니다.
# http://localhost:8080 에서 Web 채팅 UI가 기동됨
./scripts/start_llama_server.sh
# 가볍게 구동하고 싶다면 4B로 전환
...
일본어도 상당히 자연스러우며, "저는 PrismML이 개발한 AI 어시스턴트 Bonsai입니다"라고 자기 인식을 할 정도로 인스트럭션 튜닝 (Instruction Tuning)이 잘 적용되어 있습니다. 다음과 같은 용도는 8B로 실용적인 라인에 들어옵니다.
- 회의록 · 기사 요약
- 이메일이나 문장의 초안 작성 · 리라이팅 (Rewriting)
- 기밀 문서를 클라우드로 보내지 않고 다루는 로컬 RAG (Retrieval-Augmented Generation)의 생성부
- 네트워크를 사용할 수 없는 오프라인 환경에서의 파트너
start_llama_server.sh가 실행하는 서버는 OpenAI 호환 API를 제공합니다. 즉, 기존 OpenAI SDK 코드의 엔드포인트(Endpoint)를 바꾸는 것만으로, 직접 만든 앱의 추론 엔진을 Bonsai로 교체할 수 있습니다.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8080/v1",
...
)
API 비용이 제로, 레이턴시 (Latency)가 낮음, 데이터가 외부로 나가지 않음이라는 세 가지 장점이 갖춰져 있으므로, 다음과 같은 임베딩 (Embedding)에 적합합니다.
- 사내 도구의 요약 · 분류 · 태그 지정 등의 고빈도 · 저단가 태스크
- 클라우드 LLM의 전단에 배치하는 라우터 (Router) / 전처리 (간단한 질문은 로컬에서 완결)
- SaaS 비용 절감을 위한 폴백 (Fallback) 대상
27B 모델 (및 Ternary-Bonsai 27B)은 OpenAI 스타일의 Function Calling을 네이티브로 지원하며, MCP 서버와의 연동이나 Open WebUI + 코드 인터프리터 (Code Interpreter)를 조합한 에이전트 (Agent) 데모도 공식적으로 준비되어 있습니다.
- 이미지 입력: 27B는 채팅 UI · API를 통해 이미지를 수용
- 도구 호출 (Tool Calling): OpenAI 형식의 도구 정의를 그대로 사용 가능
- 추론 모드: 대화마다 reasoning effort를 조정 가능
- 최대 262,144 토큰의 롱 컨텍스트 (Long Context) (27B)
27B에서도 추정 피크 메모리는 **약 5.2GiB (10K 컨텍스트 시) ~ 14.4GiB (Ternary 27B · 100K 컨텍스트 시)**로, 일반적인 노트북 PC의 메모리 범위 내에 들어옵니다. "로컬에서 완결되는 작은 에이전트"를 구축하기 위한 현실적인 토대가 마련되었습니다.
OpenAI 호환 API가 있으므로, Claude Code나 Aider의 백엔드로 Bonsai를 지정하는 것 자체는 가능합니다. 다만, 실제로 테스트한 검증 기사에서는 현시점에서는 실용적이라고 말하기 어렵다는 결과가 나왔습니다.
- Claude Code는 토큰 소비량이 방대하여, Bonsai 8B의 생성 속도로는 에이전트 루프(Agent Loop)를 다 돌리지 못함
- Aider는 비교적 가벼워 "그나마 나은" 수준이지만, 직접 API를 호출하는 경우와 비교해 명확한 우위는 없음
검증자의 결론은 "Bonsai는 에이전트의 두뇌가 아니라, API를 직접 호출하는 용도의 경량 엔진으로 사용하는 것이 정답"이라는 것입니다. 에이전트 용도는 27B + 도구 호출(Tool Calling)의 성숙이나, 향후 모델 강화가 이루어질 때까지 기다려야 하는 단계라고 할 수 있습니다.
에코시스템 미지원: LM Studio나 일반적인 Ollama는 아직 1-bit 포맷을 지원하지 않음. PrismML 포크(Fork) 빌드가 필요함 (Ollama로 모델을 pull 하는 것 자체는 가능해도 실행은 불가능)
벤치마크는 자사 발표 중심: 독립적인 검증은 이제 시작 단계. 특히 일본어와 같이 복잡한 태스크는 사전 확인이 필요
작은 사이즈 주의: 1.7B는 품질 면에서 용도를 가린다는 보고가 많으므로, 우선 8B부터 시도하는 것이 무난함
파인튜닝 (Fine-tuning): 1-bit 형식 특성상 기존의 튜닝 툴체인(Toolchain)을 그대로 사용할 수 없으며, 커뮤니티에서 검증이 진행 중인 단계
4월 16일에 추가된 Ternary Bonsai는 가중치를 -1 / 0 / +1의 3값(1.58-bit)으로 설정함으로써, 약간의 사이즈 증가와 맞바꾸어 1-bit 버전보다 품질을 높인 제품군입니다. 공식 데모의 기본 설정이 이미 Ternary로 되어 있어, "품질의 Ternary, 극소형의 1-bit"라는 역할 분담이 이루어질 것으로 보입니다. 메모리 8GB급 머신이나 iPhone에서의 동작 보고도 있어, 에지 디바이스(Edge Device)로의 본격적인 전개는 이쪽이 본령이 될 것으로 보입니다.
Bonsai는 PrismML이 2026년 3월 말에 공개한, 스크래치(Scratch)부터 1-bit로 학습된 최초의 상용 실용 LLM 제품군 (1.7B / 4B / 8B / 27B, Apache 2.0)
8B 모델은 1.15GB이며 필요 메모리는 약 1.5GB. GPU 없는 CPU 환경에서도 11~12 토큰/초(Tokens/sec)로 동작
현시점의 최적의 활용처는 로컬 채팅, 요약, 문서 처리 및 OpenAI 호환 API를 통한 앱 임베딩(Embedding)
27B는 이미지 입력, 함수 호출 (Function Calling), MCP 연동, 262K 컨텍스트를 지원하여 로컬 에이전트의 토대가 될 수 있음
Claude Code / Aider 등 코딩 에이전트의 두뇌로서는 현재로서는 역부족. "API를 직접 호출하는 경량 엔진"으로 사용하는 것이 정답
일반적인 llama.cpp / Ollama / LM Studio는 미지원하므로, 공식 Bonsai-demo 또는 PrismML 포크를 사용할 것
"추론에 GPU는 거의 필요하지 않게 된다"라는 평가까지 나오고 있는 Bonsai. 우선 가지고 계신 노트북 PC에서 setup.sh를 실행하여 1-bit LLM의 속도를 체감해 보시기 바랍니다.
- PrismML — Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs
- PrismML-Eng/Bonsai-demo — GitHub
- prism-ml/Bonsai-8B-gguf — Hugging Face
- 「스마트폰에서 구동되는」 80억 파라미터 LLM――1.15GB로 실운용 수준을 주장하는 「1-bit Bonsai」가 화제 — ITmedia
- 돌연 실용화된 1비트 LLM Bonsai-8B, 이제 추론에 GPU는 거의 필요하지 않게 된다 — WirelessWire News
- Claude Code를 로컬 LLM(Gemma 4, Qwen 3.6, Bonsai 8B)으로 돌려보았다 — GMO 인터넷 그룹
- Bonsai-8B 철저 해설: 1-bit LLM이 개척하는 로컬 AI의 신시대 — Qiita
- Bonsai 8B(1bit LLM)를 GPU 없는 Windows PC에서 구동하기 — uepon의 일상 메모
- 1비트 모델 「Bonsai」를 시도하기 — Zenn
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기