Prism ML이 어떻게 27B 모델을 3.9 GB로 압축했는가
요약
Prism ML은 Bonsai 27B를 통해 27B 파라미터 모델을 1-bit 및 삼진(ternary) 가중치로 압축하는 기술을 선보였습니다. 기존 양자화와 달리 저비트 상태에서 직접 학습하는 방식을 사용하여, 모델 크기를 3.9GB까지 줄이면서도 높은 추론 성능을 유지합니다.
핵심 포인트
- 1-bit 가중치 방식을 통해 27B 모델을 3.9GB로 압축
- 양자화된 상태에서 학생 모델을 학습시켜 성능 저하 최소화
- 전체 정밀도 대비 수학 능력 91.66% 유지
- 노트북 및 스마트폰 등 로컬 환경에서의 AI 실행 가능성 확대
Prism ML이 어떻게 27B 모델을 3.9 GB로 압축했는가
우리 대부분은 유용한 AI를 사용하려면 데이터 센터가 필요하다고 가정합니다. 모델이 커질수록 추론 (reasoning) 능력은 좋아지지만, 비용 또한 커집니다. Prism ML의 Bonsai 27B는 조용한 반례입니다. 27B급 모델을 이진 (binary) 및 삼진 (ternary) 가중치로 증류 (distilled) 하여, 전체 정밀도 (full-precision) 추론 능력의 89.5%를 유지하면서도 노트북이나 심지어 휴대폰에서도 실행할 수 있을 만큼 작게 만들었습니다.
제 블로그에 전체 기술 워크스루 (technical walkthrough)를 작성했지만, 여기에는 압축 파이프라인 (compression pipeline)이 어떻게 작동하는지, 그리고 이것이 개발자들에게 왜 중요한지에 대한 요약 버전이 있습니다.
이 포스트는 요약본입니다. 전체 기사는 https://fernando-nog.netlify.app/bonsai-distillation-explained-from-qwen36-27b-to-a-phone-friendly-39-gb-model/에서 확인하실 수 있습니다.
동일한 아키텍처로 시작하되, 가중치를 다르게 표현하기
Bonsai 27B는 27.3B 파라미터 하이브리드 어텐션 (hybrid-attention) 모델인 Qwen3.6-27B로 시작합니다. Prism ML은 트랜스포머 (transformer)를 재설계하지 않았습니다. 대신, 가중치 (weights)를 저장하는 방식을 변경했습니다.
현재 두 가지 형식이 제공됩니다:
- 1-bit: 각 가중치는
-1또는+1이며, 128개의 가중치당 하나의 공유 스케일 (shared scale)이 추가됩니다. 유효 비트 너비 (Effective bit width): ~1.125. 파일 크기: ~3.9 GB. - Ternary (삼진): 각 가중치는
-1,0, 또는+1이며, 동일한 공유 스케일 기법을 사용합니다. 유효 비트 너비 (Effective bit width): ~1.71. 파일 크기: ~7.2 GB.
삼진 (ternary) 변형은 노트북에 최적화된 지점이며, 1-bit 변형은 휴대폰에 적합한 방식입니다.
핵심 기술: 이미 양자화 (quantized)된 상태에서 학생 모델을 학습시키기
전통적인 양자화 (quantization)는 학습된 모델을 가져와 나중에 가중치를 반올림합니다. 이는 4비트 (4 bits)에서는 작동합니다. 하지만 4비트 미만으로 내려가면 추론 능력이 조용히 붕괴됩니다.
Bonsai는 그 반대로 동작합니다. 학생 모델 (student model)은 가중치가 이미 이진 (binary) 또는 삼진 (ternary) 알파벳으로 제한된 상태에서 학습됩니다. 손실 함수 (loss function)가 처음부터 반올림 오차 (rounding error)를 인지하기 때문에, 모델은 극단적인 압축 후에도 유용하게 유지되는 가중치 패턴을 학습합니다. 그 결과 1비트 (1-bit) 변형 모델에서 수학 능력은 전체 정밀도 (full precision)의 91.66%를 유지하고 코딩은 81.88%를 유지하며, 삼진 (ternary) 버전은 이보다 훨씬 더 높은 수치를 보여줍니다.
이것이 개발자에게 중요한 이유
3.9 GB 크기의 27B급 모델은 역량 있는 AI가 실행될 수 있는 위치를 변화시킵니다:
- 로컬 (Locally): 코드를 제3자 API로 전송하지 않고도 실행 가능
- 노트북 (On a laptop): 외장 GPU가 없는 환경에서도 실행 가능
- 스마트폰 (On a phone): Apple Silicon 기반의 MLX Swift를 통해 실행 가능
- 단일 24 GB GPU (On a single 24 GB GPU): 컨텍스트 (context)와 배치 (batches)를 위한 여유 공간을 확보하며 실행 가능
이것이 모든 작업에서 프런티어 클라우드 모델 (frontier cloud models)을 대체하는 것은 아닙니다. 장기적 관점의 에이전트 기반 코딩 (agentic coding)이나 가장 난도가 높은 추론 카테고리는 여전히 전체 정밀도 (full precision)를 선호합니다. 하지만 일상적인 코딩, 리팩터링 (refactoring), 설명, 그리고 긴 문서 분석에 있어서 로컬 모델은 이제 훨씬 더 신뢰할 만한 수준이 되었습니다.
다음으로 주목하고 있는 것
가장 흥미로운 지점은 **에이전트 기반 코딩 (agentic coding)**입니다. Prism ML은 다중 파일, 실행-테스트-수정 (run-test-and-repair) 워크플로우에 최적화된 Bonsai 변형 모델이 다음 단계라고 밝혔습니다. 만약 로컬 모델이 이러한 수준의 작업을 처리할 수 있게 된다면, "클라우드 전용"과 "로컬 우선" 코딩 어시스턴트 사이의 경계는 다시 한번 이동하게 될 것입니다.
아키텍처 (architecture), 커널 (kernels), DSpark 추측적 디코딩 (speculative decoding), 그리고 벤치마크 세부 분석을 포함한 전체 파이프라인을 확인하고 싶다면, 전체 포스트는 이곳에 있습니다:
Bonsai Distillation Explained: From Qwen3.6-27B to a Phone-Friendly 3.9 GB Model
저는 제 기술 블로그에서 AI, 백엔드 개발, 그리고 실무 엔지니어링에 대해 글을 씁니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기