
Bonsai 27B를 사용하여 모바일에서 27B 파라미터 LLM을 로컬로 실행하기
요약
PrismML이 모바일 기기에서 로컬로 실행 가능한 27B 파라미터 모델인 Bonsai 27B를 출시했습니다. 1비트 제약 학습 방식을 통해 3.9GB의 낮은 메모리 점유율로도 높은 추론 성능을 유지하는 것이 특징입니다.
핵심 포인트
- 1비트 제약 학습을 통해 양자화 오류 없이 높은 충실도 유지
- 하이브리드 어텐션 구조로 효율적인 연산 수행
- 3.9GB(1-bit) 및 5.9GB(Ternary) 두 가지 빌드 제공
- DSpark 추측적 디코딩을 통한 생성 속도 향상
하드웨어 제약으로 인해 대규모 언어 모델 (Large Language Models, LLM)을 모바일 기기에서 직접 실행하는 것은 오랫동안 꿈같은 일이었습니다. PrismML이 Bonsai 27B를 출시하면서 그 꿈은 구체적인 현실이 되었습니다. 단 3.9GB의 점유 공간 (footprint)을 달성한 이 270억 파라미터 (27-billion-parameter) 모델은 iPhone 17 Pro Max와 같은 하드웨어에서 상당한 추론 능력을 유지하면서 완전히 오프라인으로 작동할 수 있습니다.
크기 뒤에 숨겨진 아키텍처 (Architecture)
사전 학습된 고정밀 가중치 (high-precision weights)를 압축하는 전통적인 양자화 (quantization) 방식과 달리, PrismML은 1비트 제약 (1-bit constraints)을 사용하여 Bonsai 27B를 처음부터 학습시켰습니다. 이러한 접근 방식은 추론 (inference) 중에 오류를 유발할 수 있는 전체 정밀도 폴백 (full-precision fallback)에 의존하지 않기 때문에 모델이 더 높은 충실도 (fidelity)를 유지하도록 보장합니다. 이 아키텍처는 약 75%의 선형 어텐션 (linear attention) 레이어와 25%의 풀 어텐션 (full attention) 레이어로 구성된 하이브리드 어텐션 (hybrid-attention) 설정을 활용합니다.
PrismML은 두 가지 주요 빌드를 제공합니다:
- 1-bit 빌드 (3.9GB): 스마트폰과 같이 메모리가 제한된 장치에 최적화되어 있으며, 가중치당 1.125 유효 비트 (effective bits)를 제공합니다.
- Ternary 빌드 (5.9GB): 더 많은 RAM과 연산 능력을 갖춘 노트북급 하드웨어를 위해 설계되었으며, 가중치당 1.71 유효 비트를 제공합니다.
성능 및 기술적 트레이드오프 (Technical Trade-offs)
이번 릴리스에서 가장 주목할 만한 측면 중 하나는 추측적 디코딩 (Speculative-decoding) 드래프터인 DSpark의 포함입니다. 이 레이어를 통해 모델은 여러 토큰을 동시에 예측할 수 있으며, 출력 품질을 희생하지 않으면서 생성 속도를 크게 높일 수 있습니다. 사용자는 iPhone 17 Pro Max에서 초당 약 11토큰, Apple M5 Max에서 최대 초당 87토큰을 기대할 수 있습니다.
하지만 한계점을 이해하는 것도 매우 중요합니다. 수학 및 코드 생성 (Code-generation) 벤치마크는 풀 프리시전 (Full-precision) 베이스라인에 가깝게 유지되지만, 도구 호출 (Tool-calling) 및 비전 (Vision)과 같은 에이전트적 작업 (Agentic tasks)에서는 눈에 띄는 성능 저하가 나타납니다. 정밀하고 다단계적인 구조화된 출력 (Structured output)이 필요한 시나리오에서, 압축된 모델은 더 큰 모델들에 비해 어려움을 겪을 수 있습니다.
개발자 구현 (Developer Implementation)
복잡한 로컬 환경을 설치하지 않고 모델을 실험해보고 싶은 개발자들을 위해, PrismML은 WebGPU를 활용하여 웹 브라우저에서 직접 모델을 실행할 수 있도록 합니다. 이 구현 방식은 다양한 기기에서 성능을 감사 (Audit)할 수 있는 훌륭한 방법을 제공합니다.
만약 이 모델을 로컬 워크스테이션에 호스팅할 계획이며, 복잡한 방화벽 설정 없이 개발 또는 테스트를 위해 안전하게 노출하고 싶다면 다음 명령어를 사용할 수 있습니다:
ssh -p 443 -R0:localhost:8000 free.pinggy.io
이 명령어는 8000과 같은 로컬 포트를 공용 HTTPS URL로 포워딩하여, 모든 OpenAI 호환 클라이언트와의 원활한 통합을 가능하게 합니다. 이 접근 방식은 모델을 애플리케이션의 백엔드 서비스로 테스트하는 과정을 단순화합니다.
이것이 중요한 이유
업계는 개인정보 보호에 민감한 AI 애플리케이션의 표준으로서 온디바이스 추론 (on-device inference)으로 이동하고 있습니다. 보고서에 따르면 Apple과 같은 기업들이 이 압축 기술을 적극적으로 벤치마킹하고 있으며, 이는 모바일 AI의 미래가 클라우드 인프라에 대한 의존도를 줄이기 위해 이러한 유형의 네이티브 압축 아키텍처 (natively compressed architectures)에 크게 의존하게 될 것임을 시사합니다.
참고 문헌
Bonsai 27B: iPhone에 들어가는 27B 파라미터 LLM
Bonsai 27B는 네이티브 1비트 가중치 (native 1-bit weights)를 사용하여 27B 파라미터의 Qwen3.6 모델을 3.9GB로 압축하며, iPhone에서 11 tok/s의 속도로 실행됩니다. 다음은 이를 위해 포기해야 하는 부분들입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

