Bonsai 27B: 온디바이스(On-Device) AI의 시대가 도래했다 — 그리고 이는 에이전트(Agents)를 위한 모든 것을 변화시킨다
요약
PrismML이 iPhone 17 Pro 등 모바일 기기에서 실행 가능한 초경량 모델 Bonsai 27B를 출시했습니다. 이 모델은 극단적인 압축을 통해 성능 저하를 최소화하면서도 온디바이스 AI 에이전트 구현을 위한 경제적 토대를 마련했습니다.
핵심 포인트
- Bonsai 27B는 1-bit/ternary 압축을 통해 3.9GB 수준의 초경량 모델 구현
- iPhone 17 Pro에서 초당 11토큰의 속도로 로컬 실행 가능
- FP16 대비 성능 유지율이 매우 높아 온디바이스 에이전트 활용 기대
- 클라우드 중심에서 로컬/프라이빗 AI로의 구조적 변화 가속화
요약 (TL;DR) — PrismML은 7월 14일에 Bonsai 27B를 출시했습니다. 이는 iPhone 17 Pro에서 로컬로 실행되는 3.9 GB로 압축된 270억 파라미터(27-billion-parameter) 모델입니다. Ternary(삼진) 변형 모델은 수학, 코딩 및 에이전트(agentic) 벤치마크에서 FP16 성능의 94.6%를 유지합니다. Alibaba의 Qwen을 통해 중국 시장을 공략하는 Apple Intelligence, 소형 모델의 실패율을 22.9%에서 1%로 낮춘 Liquid AI의 Antidoom, 그리고 OpenAI의 230달러 Codex Micro 키패드가 결합되어 메시지는 명확합니다: AI 산업은 클라우드(cloud)와 나란히 로컬(local), 프라이빗(private), 그리고 한계 비용이 거의 없는(free-at-the-margin) 두 번째 경로를 개척하고 있습니다. AI 에이전트(AI agents)에게 있어, 이는 배포의 단위 경제성(unit economics)을 하룻밤 사이에 변화시킵니다.
서론: 두 가지 혁명, 하나의 주간
이번 주에 무언가 변화했습니다. 평소와 같은 방식은 아니었습니다. 아무도 1조 파라미터 규모의 괴물 모델을 출시하거나 기록적인 벤치마크를 발표하지 않았습니다. 대신, 업계는 유능한 270억 파라미터 모델이 휴대폰에서 실행될 수 있다는 것, 소형 모델이 프로덕션(production)에 사용할 수 있을 만큼 신뢰할 수 있게 될 수 있다는 것, 그리고 세계에서 가장 가치 있는 기업이 두 번째로 큰 시장에서 운영하기 위해 자사 AI 기능의 내부(under the hood)에 중국 LLM을 탑재하고 있다는 것을 조용히 입증했습니다.
이것들은 별개의 이야기가 아닙니다. 이들은 동일한 구조적 변화의 측면들입니다: AI는 클라우드(cloud)와 디바이스(device)라는 두 개의 스택으로 분리되고 있으며, 디바이스 스택이 이제 현실이 되었습니다.
7월 14일, PrismML은 Qwen3.6-27B의 압축 버전인 Bonsai 27B를 출시했습니다. 이 모델은 두 가지 변형으로 제공됩니다: FP16 성능의 94.6%를 유지하는 5.9 GB의 ternary 빌드({-1, 0, +1} 가중치), 그리고 89.5%를 유지하는 3.9 GB의 1-bit binary 빌드입니다. 1-bit 변형 모델은 iPhone 17 Pro에서 초당 11개 토큰(11 tokens per second)으로 실행됩니다. M5 Max가 탑재된 MacBook에서는 ternary 빌드가 58 tok/s에 도달하고, binary 빌드는 66 tok/s에 도달합니다. 이 모든 것은 Apache 2.0 라이선스로 제공됩니다.
(출처: MarkTechPost — PrismML Releases Bonsai 27B)
같은 날, Liquid AI는 특정 대상 작업(target task)에서 Qwen3.5-4B의 실패율을 22.9%에서 1%로 낮춘 기술인 Antidoom을 선보였습니다. 같은 주에 Apple Intelligence는 중국 내 마지막 규제 장벽을 통과했습니다. 다만 Apple 자체 모델이 아닌 Alibaba의 Qwen 모델을 기반으로 구동됩니다. 그리고 OpenAI는 Codex 에이전트(agent)를 위한 230달러 상당의 물리적 코딩 키패드를 출시했습니다.
이러한 사건들을 관통하는 핵심은 이 중 어느 하나에 관한 것이 아닙니다. AI 에이전트(agents)의 기저에 깔린 경제적, 구조적 토대가 실시간으로 변화하고 있다는 점입니다.
수치 데이터: Bonsai 27B가 실제로 제공하는 것
데이터를 살펴보겠습니다. PrismML은 사고 모드(thinking mode) 전반에 걸쳐 15개의 벤치마크를 평가했으며, 그 결과는 단순히 무엇이 유지되었는가뿐만 아니라, 가장 중요한 부분에서 무엇이 _손실되지 않았는가_라는 측면에서 매우 놀랍습니다.
| 변형(Variant) | 실제 bpw | 점유 용량(Footprint) | 사고 평균(Thinking Avg) | FP16 대비 유지율(Retention vs FP16) |
|---|---|---|---|---|
| Qwen3.6-27B FP16 | 16.0 | 54 GB | 85.07 | 기준점(Baseline) |
| ... | ||||
| (출처: PrismML — Bonsai 27B Technical Report) |
핵심 통찰은 손실의 _형태(shape)_에 있습니다. 기존의 4비트 미만 빌드(예: IQ2_XXS)는 선택적으로 붕괴합니다. MMLU-Redux와 같은 단문 벤치마크에서는 여전히 88.93을 보여주지만, AIME26에서는 57.5, LiveCodeBench에서는 56.4로 떨어집니다. 반면 Bonsai의 손실은 더 고르게 분산되어 있으며, 결정적으로 에이전트(agents)에게 중요한 벤치마크에서 성능을 유지합니다.
| 카테고리 | FP16 | Ternary (3비트) | 1-bit |
|---|---|---|---|
| 수학(Math) | 95.33 | 93.40 | 91.66 |
| ... |
Ternary 빌드의 에이전트 및 도구 호출(tool-calling) 점수인 74.01은 대화의 흐름을 바꾸는 숫자입니다. 노트북에서 완전히 로컬로 구동되면서 FP16 성능의 74% 수준으로 도구를 추론하고, API를 호출하며, 에이전트 워크플로우(agent workflows)를 실행할 수 있는 모델은 장난감이 아닙니다. 그것은 실제 배포 대상(deployment target)입니다.
처리량(throughput)에 관해서는, binary 빌드가 iPhone 17 Pro에서 11 tok/s, M5 Max에서 66.4 tok/s, H100에서 104.8 tok/s를 생성합니다. 배터리 소모량은 iPhone 배터리 1%당 672 토큰입니다. 이는 일시적인 폭발적 속도가 아니라, 지속 가능한 워크플로우를 위한 읽기 속도입니다.
왜 이것이 에이전트 경제학을 변화시키는가
클라우드 AI의 단위 경제학은 간단합니다. 모든 쿼리는 한계 비용(marginal cost)을 가집니다. OpenAI의 플래그십 추론 모델인 GPT-5.6 Sol은 출력 토큰 백만 개당 $30의 비용이 발생합니다. 단일의 복잡한 에이전트 작업—다중 턴, 도구 호출(tool-calling), 긴 컨텍스트 창을 포함하는 경우—은 쉽게 50,000~100,000 토큰을 소비할 수 있습니다. 최고치로 계산하면 에이전트 실행당 $3에 달합니다. 루프를 돌고, 재시도하며, 탐색하는 에이전트를 구축하는 개발자에게는 청구서가 빠르게 쌓입니다.
온디바이스 AI는 이러한 계량 시스템을 완전히 무너뜨립니다. 모델이 다운로드되면 쿼리당 한계 비용은 0이 됩니다. API 키가 필요 없고, 속도 제한(rate limit)이 없으며, 데이터가 장치를 벗어나지 않습니다. 에이전트 개발자에게 수학은 간단합니다. 로컬에서 실행되는 테르너리 Bonsai 27B가 에이전트 작업 부하의 74%를 처리할 수 있다면, 나머지 26%는 클라우드로 라우팅하여 추론 비용을 약 4분의 3만큼 절감할 수 있습니다.
이는 가설이 아닙니다. PrismML CEO인 Babak Hassibi는 CNBC와의 인터뷰에서 Apple과 다른 회사들이
소형 로컬 모델(Small local models)은 항상 신뢰성 문제를 겪어왔습니다. 이들은 빠르고 저렴하지만, 프런티어 클라우드 모델(frontier cloud models)과는 다른 방식으로 엣지 케이스(edge cases)에서 무너집니다. 네 번 시도 중 한 번 실패하는 모델은 데모(demo)에 불과합니다. 백 번 시도 중 한 번 실패하는 모델이 제품(product)입니다. Antidoom이 모든 분야의 신뢰성을 해결하는 것은 아닙니다. 이는 하나의 벤치마크에서 보여준 하나의 방법론일 뿐이지만, 이 방향이 실행 가능하다는 것을 증명합니다. Bonsai가 FP16 품질의 94.6%를 유지한다는 점과 결합하면, 로컬과 클라우드 사이의 격차는 능력(capability)과 신뢰성(trustworthiness)이라는 두 축 모두에서 좁혀지고 있습니다.
Apple-Qwen 신호: 모델 품질 < 시장 접근성
7월 15일, Apple Intelligence가 중국 사이버 공간 관리국(Cyberspace Administration of China)에 등록되었습니다. 이는 생성형 AI 기능을 중국 본토에 도입하는 데 필요한 마지막 규제 승인입니다. 결정적인 세부 사항은 다음과 같습니다: 이 모델은 Alibaba의 Qwen 모델과 Baidu의 추가 기능을 기반으로 작동합니다. Apple은 중국에서 자체 모델을 실행할 수 없습니다. 모든 거대언어모델(LLM)은 베이징의 등록 및 승인을 받아야 하며, 외국 모델은 그 기준을 통과하지 못하기 때문입니다.
(출처: TechCrunch — Apple Intelligence approved for China with Alibaba's Qwen)
전략적 함의는 명확합니다. 가장 폐쇄적인 하드웨어 생태계를 가진 세계에서 가장 가치 있는 기업이, 자신의 두 번째로 큰 시장에서 운영하기 위해 타사의 모델을 사용하고 있다는 점입니다. 모델의 품질이 아니라 시장 접근성이 어느 국가에서 승리할지를 결정하는 결정적인 요소가 되고 있습니다. AI 세계는 서구권과 중국권이라는 두 개의 스택으로 분절(balkanizing)되고 있으며, Apple조차 자신의 기술만으로는 그 격차를 메울 수 없습니다.
온디바이스(on-device) 내러티브 측면에서 이는 순풍(tailwind)입니다. 로컬에서 실행되는 모델은 데이터의 국외 유출을 우려하는 규제 기관의 요구를 충족하는 모델입니다. 지정학적 경계에 따라 AI 거버넌스가 파편화될수록, 온디바이스 역량의 가치는 더욱 높아집니다.
Codex Micro: 하드웨어 신호
이러한 배경 속에서, 하드웨어 제조사 Work Louder와 협력하여 구축된 OpenAI의 230달러 상당의 Codex Micro 키패드 — Codex 코딩 에이전트(coding agent)를 위한 물리적 제어 인터페이스 — 는 거의 고전적으로 보이기까지 합니다. 하지만 이는 다른 각도에서 바라본 동일한 신호입니다. 즉, AI가 촉각적이고, 내장되며, 로컬화(local)되고 있다는 것입니다. 전용 키패드의 존재는 AI 에이전트와 함께 코딩하는 것이 이제 그 자체로 하나의 워크플로(workflow)가 되었으며, 전용 하드웨어를 갖출 가치가 있다는 것을 의미합니다. 또한 이는 OpenAI가 단순히 토큰(tokens)뿐만 아니라 물리적 객체를 판매하는 방식도 연습하고 있음을 시사합니다.
(출처: BuildFastWithAI — Codex Micro coverage)
온디바이스(on-device) AI로의 전환과 하드웨어의 전환은 동전의 양면과 같습니다. AI는 브라우저 탭을 벗어나 스마트폰, 노트북, 책상, 공장 등 물리적 세계를 식민화하고 있습니다. 데이터 센터가 있는 곳이 아니라, 당신이 있는 곳에서 실행되는 에이전트(Agents)의 시대입니다.
FAQ
Q: Bonsai 27B가 정말 온디바이스 AI의 "DeepSeek 모먼트"인가요?
네, 한 가지 구체적인 의미에서 그렇습니다. Bonsai 27B는 에이전트 벤치마크(agentic benchmarks)에서 80점 이상을 기록하는 27B급 모델이 스마트폰에 탑재되어 실행될 수 있음을 증명합니다. DeepSeek가 최첨단 성능(frontier performance)을 위해 최첨단 예산이 필요하지 않다는 것을 증명했다면, Bonsai는 유능한 AI를 위해 데이터 센터가 필요하지 않다는 것을 증명합니다. 두 사례 모두 비용 구조의 파괴적 혁신(disruptions)입니다.
Q: 94.6%의 유지율(retention)은 실제로 무엇을 의미하나요?
이는 삼진법(ternary) 방식의 Bonsai 27B가 15개 벤치마크 전반에서 FP16 Qwen3.6-27B와 5점 이내의 차이로 성능을 기록한다는 것을 의미합니다. 수학(93.40 대 95.33), 코딩(85.96 대 88.74), 그리고 에이전트 작업(74.01 대 80.00)에서 격차가 존재하지만, 많은 워크플로에서 사용자가 눈치채지 못할 정도로 충분히 작습니다. 89.5% 유지율을 가진 1비트(1-bit) 빌드는 3.9GB 용량에 맞추기 위한 트레이드오프(tradeoff)입니다.
Q: 지금 당장 이것으로 에이전트를 구축할 수 있나요?
네. Bonsai 27B는 llama.cpp를 통해 OpenAI와 호환되는 도구 호출(tool calling) 기능을 제공합니다. 로컬에서 실행하면서 tools 배열을 보내고 tool_calls를 돌려받을 수 있습니다. 이는 GPT-4나 Claude와 동일한 API 규약(API contract)입니다. M5 Max에서 실행되는 삼진법 빌드는 대화형 에이전트 워크플로를 수행하기에 충분히 빠릅니다.
Q: 주의할 점(catch)은 무엇인가요?
세 가지 주의할 점(catches)이 있습니다. 첫째, iPhone에서의 11 tok/s 속도는 읽기에는 느립니다. 사용은 가능하지만 즐거운 수준은 아닙니다. 둘째, 1-bit 빌드는 에이전트 능력(agentic capability)을 크게 상실합니다 (66.03 대 80.00). 따라서 복잡한 도구 사용(tool-use) 워크플로에는 여전히 삼진법(ternary) 빌드나 클라우드가 필요합니다. 셋째, 4-bit KV 캐시(KV cache)를 사용하는 모델의 262K 컨텍스트 윈도우(context window)는 여전히 약 4.3 GB를 필요로 하며, 이는 휴대폰의 메모리 예산을 잠식합니다. 간신히 들어가긴 하지만, 매우 빠듯합니다.
Q: 이것이 클라우드 AI 비즈니스 모델을 위협할까요?
즉각적이지는 않지만, 구성(mix)을 변화시킵니다. 프런티어 추론(Frontier reasoning) — 복잡한 다단계 문제 해결, 새로운 코드 생성, 장기 계획(long-horizon planning) — 은 수년간 클라우드에 머물 것입니다. 하지만 요약, 초안 작성, 분류, 간단한 질의응답(Q&A), 기본적인 도구 호출(tool calls)과 같은 방대한 양의 일상적인 AI 작업은 더 저렴하고, 더 프라이빗하며, 언제든 사용 가능한 온디바이스(on-device)로 이동하고 있습니다. 모든 토큰을 측정하여 과금하는 연구소들은 이러한 물량을 잃게 될 것입니다. 각 작업을 적절한 컴퓨팅 계층(compute tier)으로 보내는 하이브리드 라우팅(hybrid routing)을 구축하는 연구소들이 이를 차지하게 될 것입니다.
추가 읽을거리
-
TAR — GPT-5.6 Sol, Terra, Luna: 벤치마크 및 가격 분석 분석 (클라우드 비용 비교용)
-
TAR — AI 에이전트 프레임워크 (AI Agent Frameworks) 벤치마크 2026 (에이전트 오케스트레이션 (Agent Orchestration) 맥락용)
이 기사는 처음에 The Agent Report에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기