Bonsai 27B 발표: 스마트폰에서 실행 가능한 최초의 27B급 모델
요약
Qwen3.6 27B를 기반으로 한 Bonsai 27B 모델이 발표되었습니다. 1비트 및 삼진 가중치 기술을 통해 모델 크기를 획기적으로 줄여 스마트폰과 노트북에서 실행 가능한 온디바이스 멀티모달 모델을 구현했습니다.
핵심 포인트
- 1-bit 및 Ternary 가중치 적용으로 모델 크기를 3.9GB~5.9GB로 축소
- 스마트폰(iPhone 17 Pro 등)에서 실행 가능한 최초의 27B급 모델
- 전체 정밀도 대비 최대 95%의 성능(추론, 수학, 코딩 등) 유지
- 멀티모달 기능 및 262K 컨텍스트 창 지원
- Apache 2.0 라이선스로 공개
Bonsai 27B 발표: 스마트폰에서 실행 가능한 최초의 27B급 모델
오늘 우리는 Qwen3.6 27B를 기반으로 한 Bonsai 제품군의 새로운 멀티모달 (multimodal) 플래그십이자, 해당 성능 등급의 모델 중 최초로 스마트폰에서 실행 가능한 Bonsai 27B를 발표합니다.
우리의 이전 릴리스들은 1비트 (1-bit) 및 삼진 (ternary) 가중치를 가진 모델들이 상업적으로 유용한 언어 모델을 생성할 수 있음을 증명했습니다. Bonsai 27B는 그 경계를 새로운 성능 계층으로 확장합니다: 다단계 추론 (multi-step reasoning), 구조화된 도구 호출 (structured tool calls), 시각 작업 (vision tasks), 그리고 여러 단계에 걸쳐 일관성을 유지하는 컴퓨터 사용 에이전트 루프 (computer-use agentic loops)가 이에 해당합니다. 오늘 전까지 이러한 계층을 로컬에서 배포하는 것은 구체적인 이유로 인해 비현실적이었습니다. 27B 모델은 16비트 정밀도 (16-bit precision)에서 약 54GB를 차지하며, 18GB인 우수한 4비트 (4-bit) 빌드조차 스마트폰과 대부분의 노트북에는 너무 크기 때문입니다.
Bonsai 27B는 이를 변화시킵니다. 이 모델은 두 가지 변형으로 제공됩니다:
Ternary Bonsai 27B는 FP16 그룹별 스케일링 (group-wise scaling)을 적용한 삼진 {−1, 0, +1} 가중치를 사용하여, 가중치당 실제 1.71 유효 비트 (effective bits)를 제공합니다. 5.9 GB 크기인 이 모델은 품질 지향적 변형으로, 완전한 추론, 도구 호출 및 에이전트 능력을 갖추고 일반적인 노트북에서 실행됩니다.
1-bit Bonsai 27B는 동일한 그룹별 스케일링을 적용한 이진 {−1, +1} 가중치를 사용하여, 가중치당 1.125 유효 비트를 제공합니다. 3.9 GB 크기인 이 모델은 점유 공간 지향적 변형으로, iPhone 17 Pro의 메모리 예산 내에 들어오며 27B급 모델을 최초로 스마트폰으로 가져옵니다.
모든 Bonsai 릴리스와 마찬가지로, 저비트 표현 (low-bit representation)은 언어 네트워크, 임베딩 (embeddings), 어텐션 (attention), MLP, 그리고 LM 헤드 (LM head) 전체에 걸쳐 엔드 투 엔드 (end to end)로 실행되며, 더 높은 정밀도로 빠져나가는 탈출구 (escape hatches)는 없습니다. 두 변형 모두 멀티모달 (multimodal)이며, 비전 타워 (vision tower)는 컴팩트한 4비트 형태로 제공되어 온디바이스 (on-device) 워크플로가 텍스트뿐만 아니라 스크린샷, 문서, 카메라 입력을 볼 수 있습니다. Bonsai 27B는 전체 262K 토큰 컨텍스트 (context)를 보유하며, 투기적 디코딩 (speculative-decoding)을 지원하여 손실 없는 초안 작성 및 검증 가속 (draft-and-verify acceleration)을 통해 속도를 배가시킵니다. 모든 기능은 오늘 Apache 2.0 라이선스 하에 사용할 수 있습니다.
지능 유지하기
지식, 추론 (reasoning), 수학 (math), 코딩 (coding), 지시 이행 (instruction following), 도구 호출 (tool calling), 그리고 비전 (vision)을 아우르는 15개의 벤치마크 제품군(모델의 전체 추론 능력을 발휘하는 사고 모드 (thinking mode)에서 평가됨)에 걸쳐, Ternary Bonsai 27B는 전체 정밀도 (full-precision) 베이스라인의 **95%**를 유지하며, 1-bit Bonsai 27B는 **90%**를 유지합니다.
Fig I: 전체 정밀도 베이스라인 대비 Bonsai 27B의 벤치마크 점수 (사고 모드). 각 벤치마크별 전체 결과는 백서 (whitepaper)에 수록되어 있습니다.
능력별로 표를 읽어보면 평균치보다 더 선명한 흐름이 보입니다. 수학과 코딩은 거의 영향을 받지 않았으며, 도구 호출 (tool calling)은 전체 정밀도와 불과 몇 포인트 차이 내에 머물러 있습니다. 이는 정확히 에이전트 중심 워크로드 (agentic workloads)가 의존하는 핵심 능력들입니다. 비교를 위해, 동일한 베이스 모델을 사용한 가장 공격적인 기존의 저비트 (low-bit) 빌드는 1-bit Bonsai 27B보다 훨씬 낮은 점수를 기록하면서도 메모리는 2.5배 더 많이 점유합니다.
이는 우리가 이전의 언어 및 이미지 모델에서 입증했던 것과 동일한 파레토 이동 (Pareto shift)을 이제 27B 규모에서 보여주는 것입니다. 즉, 전체 정밀도 2B 모델보다 작은 점유 공간(footprint)으로 27B급의 능력을 구현한 것입니다. 우리가 1-bit Bonsai 8B와 함께 도입한 측정 지표인 지능 밀도 (intelligence density) 측면에서, 1-bit Bonsai 27B는 GB당 0.53을 전달합니다. 이는 전체 정밀도 베이스라인보다 10배 이상 높으며, 사용 가능한 최고의 저비트 대안보다 약 2.7배 높은 수치입니다.

이것이 중요한 패러다임 전환인 이유
가장 가치 있는 AI 워크로드는 단일 응답에서 지속적인 작업으로 이동하고 있습니다. 실제 도구를 작동시키는 어시스턴트, 결과를 반환하기 전까지 자율적으로 실행되는 워크플로 (workflows), 그리고 수십 개의 문서를 합성하는 연구 등이 이에 해당합니다. 이러한 변화는 워크로드의 형태를 바꿉니다. 에이전트는 단 한 번의 모델 호출을 하는 것이 아니라, 컨텍스트 (context)를 담고 구조화된 출력 (structured output)을 생성하며 다음 단계로 전달하는 수백 번의 호출을 수행합니다.
Cloud API는 여전히 많은 제품에 있어 올바른 선택일 것입니다. 하지만 에이전트 중심 워크로드 (agentic workloads)의 경우, 클라우드 전용 실행은 구조적인 제약을 가합니다. 모든 단계가 원격 요청이 되고, 반복될 때마다 토큰당 비용이 누적되며, 사용자의 개인 파일, 화면, 데이터를 포함한 모든 계획, 도구 호출 (tool call), 중간 결과가 네트워크를 통과해야 합니다.
로컬 실행 (Local execution)은 이 방정식을 바꿉니다. 지속적인 에이전트 작업을 수행할 수 있는 모델이 기기에 탑재되면, 에이전트는 제품 내부에 상주할 수 있습니다. 즉, 100단계 루프의 한계 비용 (marginal cost)은 0이 되며, 사용자의 데이터는 기기를 절대 떠나지 않습니다. 이를 통해 완전히 새로운 카테고리들이 열립니다. 지속 가능한 온디바이스 에이전트 (on-device agents), 오프라인에서 작동하는 어시스턴트, 구조적으로 개인 로컬 데이터를 기반으로 추론하는 어시스턴트 등이 그 예입니다. 그동안 부족했던 것은 이런 방식으로 배포할 수 있을 만큼 충분히 작으면서도, 작업을 신뢰하고 맡길 수 있을 만큼 충분히 유능한 모델이었습니다. Bonsai 27B가 바로 그 모델입니다.
또한 이는 새로운 시스템 아키텍처를 가능하게 합니다. 비-프런티어 (non-frontier) 및 개인정보에 민감한 작업은 유능한 로컬 모델로 라우팅하고, 가장 어려운 단계에는 프런티어 클라우드 모델을 예약하는 하이브리드 배포 (hybrid deployments)를 통해 에이전트 시스템의 작업당 비용 (cost-per-task)을 획기적으로 낮출 수 있습니다.
Bonsai 27B는 NVIDIA GeForce RTX 5090에서 1-bit 양자화 시 최대 163 tok/s, Ternary 양자화 시 최대 134 tok/s에 도달합니다. M5 Max에서는 1-bit에서 최대 87 tok/s, Ternary에서 최대 58 tok/s에 도달합니다.
스마트폰에 탑재하는 것은 저장 용량 수치보다 훨씬 더 엄격한 관문입니다. 스마트폰은 앱에 전체 메모리를 노출하지 않습니다. 예를 들어 12 GB iPhone은 모델이 온디바이스에서 사용할 수 있는 용량으로 약 6 GB만을 제공하며, 모델은 이 예산을 KV 캐시 (KV cache) 및 활성화 값 (activations)과 공유해야 합니다. 기존의 어떤 27B 모델 빌드도 이 기준을 통과하기 어렵습니다. 약 4 GB 크기인 1-bit Bonsai 27B는 작동 여유 공간을 확보한 채 이를 통과한 최초의 모델입니다.
그러한 제약 때문에 이 모델 제품군은 이를 특별히 염두에 두고 두 가지 의도적인 동작 지점 (operating points)을 제공합니다. 노트북급 품질을 위한 Ternary, 그리고 스마트폰급 점유율 (footprint)을 위한 1-bit입니다.
프런티어는 계속해서 움직입니다
모든 Bonsai 릴리스는 기가바이트당 지능(intelligence-per-gigabyte)의 프런티어를 왼쪽으로 이동시켜 왔으며, Bonsai 27B는 이를 실질적인 임계값 너머로 이동시킵니다. 즉, 사고(thinking), 멀티모달 이해(multimodal understanding), 비전(vision), 신뢰할 수 있는 도구 사용(tool use)을 포함한 현대적 모델의 전체 기능 세트가 이제 사람들이 이미 소유하고 있는 기기에 들어갑니다.
우리는 지능 밀도(intelligence density)가 AI 발전의 다음 단계를 정의하는 축 중 하나가 될 것이라고 믿습니다. 원시 능력(Raw capability)은 모델이 무엇을 할 수 있는지를 결정하며, 밀도(density)는 모델이 어디에서 그 일을 할 수 있는지를 결정합니다. 프런티어가 왼쪽으로 이동할 때마다 고급 AI가 작동할 수 있는 기기, 제품 및 환경의 범위가 확장되며, 휴대폰에서 단일 GPU 서빙(single-GPU serving)에 이르기까지 접촉하는 모든 배포 표면의 경제성을 변화시킵니다. Bonsai의 배후에 있는 방법론은 아키텍처에 구애받지 않으며(architecture-agnostic), 프런티어는 계속해서 이동할 것입니다. 더 큰 모델과 새로운 아키텍처가 이미 진행 중입니다.
초기 컴퓨터는 방 하나를 가득 채웠지만, 오늘날 컴퓨터는 우리 주머니 속에 들어와 있습니다. 지능 또한 동일한 여정을 거치고 있으며, Bonsai 27B는 그 여정에서 지금까지 가장 큰 발걸음입니다.
플랫폼 커버리지 (Platform Coverage)
Bonsai 27B는 하이브리드 어텐션 아키텍처(hybrid-attention architecture)를 위해 구축된 맞춤형 저비트 커널(low-bit kernels)을 통해 MLX를 이용한 Apple 기기(Mac, iPhone, iPad) 및 CUDA를 이용한 NVIDIA GPU에서 네이티브로 실행됩니다. 모델 가중치(weights)는 현재 Apache 2.0 라이선스 하에 사용할 수 있습니다. 이번 릴리스와 함께, 개발자들이 우리의 모델을 쉽게 시도해 볼 수 있도록 한시적 무료 개발자 프리뷰 API를 제공합니다.
우리의 압축(compression), 평가(evaluation) 및 벤치마킹(benchmarking) 프로세스에 대한 전체 기술적 세부 사항은 백서(whitepaper)에서 확인할 수 있습니다.
함께하세요 (Join Us)
PrismML은 Caltech 연구진 팀에서 시작되었으며, Khosla Ventures, Cerberus, Google의 지원을 받아 설립되었고 Samsung의 지속적인 지원을 받고 있습니다. 우리는 추론 능력(reasoning ability)을 희생하지 않으면서 신경망(neural networks)을 압축하는 이 분야의 가장 어려운 문제 중 하나를 해결하기 위해 수년을 보냈습니다.
차세대 최첨단(state-of-the-art) AI를 구축하는 데 도움을 주고 싶다면, 여러분의 연락을 기다립니다. 채용 페이지를 확인해 주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기