Bonsai 2 27B, 메모리 사용량을 9분의 1 미만으로 줄인 거의 무손실 압축
요약
Bonsai 2 27B 모델은 메모리 사용량을 크게 줄인 거의 무손실 압축 기술을 적용하여 효율성을 높였습니다. 이 모델은 M5 Pro 등 다양한 환경에서 구동 가능하며, 특히 작은 크기에도 불구하고 준수한 성능을 보여주어 주목받고 있습니다. 다만, 긴 작업 처리 시 불안정성이 관찰되기도 했습니다.
핵심 포인트
- Bonsai 2 27B는 메모리 사용량을 획기적으로 줄인 고효율 모델입니다.
- M5 Pro 등 저사양 환경에서도 구동 가능하여 접근성이 높습니다.
- 모델의 효율성 개선 표현('9배 작다')에 대한 언어적 논쟁이 있었습니다.
- 16GB VRAM 사용자에게 적합한 크기로, 휴대용 기기 활용도가 기대됩니다.
내 M5 Pro에서는 초당 약 20토큰이 나왔고, 서버를 재시작하니 이유는 모르겠지만 44토큰까지 올라감. 다만 시작할 때 ggml_metal_device_init: - the tensor API is not supported in this environment - disabling이 출력돼 뭔가 제대로 작동하지 않는 듯함.
/tmp 대신 기존 Hugging Face 캐시 디렉터리에 GGUF를 저장하려면 다운로드와 서버 실행을 한 번에 처리할 수 있음. HF_TOKEN 설정은 선택 사항이며 다운로드 속도를 높여줌.
Ternary Bonsai 2 27B는 삼진 가중치 {−1, 0, +1}에 그룹별 FP16 스케일링을 적용해 가중치당 실효 1.76비트를 사용한다고 함. 그런데 기억이 맞다면 최근 글에서 같은 Qwen 기반 모델의 Q2 양자화는 약 2.6비트에서도 ‘눈에 띄게 나빠짐’과 Q1의 ‘쓸모없음’ 사이에 걸쳐 있었음.
Bonsai 블로그를 훑어봤지만, 일반적인 양자화와의 비교나 무엇 덕분에 더 나은지에 대한 설명은 잘 보이지 않음.
아주 대략적으로 이해하기로는 Unsloth는 파일 크기가 더 큰 대신 정밀도가 조금 더 높고, PrismML은 다른 접근법으로 크기를 줄인 듯함. 아마 정밀도도 더 낮을 것으로 추측함.
충분히 작아서 브라우저 안에서 전부 실행할 수 있음. 브라우저 데모를 써본 뒤에는 내려받은 가중치를 지우는 것도 잊지 말길 바람.
지난 모델처럼 이 정도로 작동한다는 사실 자체는 놀랍지만, 긴 작업을 시키면 특이한 방식으로 처참하게 무너짐.
재미있는 예시가 있는지?
Apple과의 협의가 어떻게 됐는지 궁금함. 내가 정말 관심 있는 건 GPU만 쓰는 대신 TPU에서 실행하는 것임. GPU는 그에 비해 배터리를 상당히 많이 소모함.
GPT Astra로 DGX Spark에서 벤치마크를 돌렸고, 생성 속도는 초당 34.38토큰이었음.
아직 초안 모델이 없는 듯해 추측 디코딩을 켠 테스트는 하지 못함. n-gram 기반 추측 디코딩도 채택되는 토큰이 부족해 별 도움이 되지 않았음.
이번에는 크기가 작다고 성능까지 더 좋아지지는 않는 듯하며, Spark의 낮은 메모리 대역폭이 병목일 수 있음.
프리필 속도는 얼마나 나오는지?
비교할 때 ‘9배 작다’ 대신 ‘크기가 1/9, 즉 11.11%다’라고 했으면 좋겠음. 1보다 큰 수를 곱해서 더 작은 양이 나올 수는 없으니, 비교 대상을 뒤집어 ‘원래 모델이 이 새롭고 효율적인 모델보다 9배 크다’고 하면 말이 됨.
효율이나 성능 개선을 다룰 때 이런 표현이 자꾸 보이는데, 매우 직관적이지 않은 표현임.
수학적으로 곧이곧대로 해석하면 어색하지만, ‘9배 작다’는 표현의 언어적 이점이 너무 커서 바뀌기를 기대하기는 어려움. 분수를 쓰지 않아도 되고, 주목하는 대상을 주어로 유지하며, 반대 표현과 형식도 같고 짧기까지 하니 그런 뜻으로 받아들이게 됨.
‘9배’를 두 대상 사이의 배율 차이로 보고, ‘작다/크다’는 주어가 그 차이의 어느 쪽에 있는지 알려준다고 해석하면 두 표현을 수학적으로 일관되게 이해할 수도 있음.
크기가 아니라 속도라면 ‘9배 빠르다’는 충분히 합리적인 표현이라고 봄. ‘9배 작다’도 내게는 뜻이 잘 통하므로, 직관적이지 않다는 데는 동의하기 어려움.
Mac Mini M2 16GB에서 생성은 초당 약 7~8토큰, 프리필은 약 60토큰으로 실행됨. 지금까지는 Bonsai 1 27B보다 똑똑하게 느껴지며, 크기는 Q1_0 양자화 버전보다 조금 큼. 꽤 기대됨!
조심스럽게 낙관함. V1은 일반 지식이 눈에 띄게 약했지만, 이번 3.8 기반 모델은 애초에 일반 지식보다 추론에 더 초점을 맞춰서 그 약점이 덜 중요할 수도 있음.
16GB 그래픽카드 사용자에게 반가운 소식임. 3.8 27B는 정말 훌륭했지만 32GB 미만에서는 제대로 돌리기 어려웠으니, 내 16GB Intel B50에 올려볼 예정임. 이 양자화 형식을 XPU 코어로 가속할 수 있는지는 아직 모르겠지만, 시간이 지나면 가능해질 수도 있겠음!
문맥 길이에 너무 까다롭지만 않으면 약 4비트 양자화는 24GB에서도 실행 가능함.
이번 모델이 더 좋기를 바라지만, 제시한 크기에서 그 정도 성능 향상이 나왔다면 매우 놀라울 것 같음. 벤치마크 결과를 더 자세히 보고 싶음.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기