Kolibri-1 (Aleph Alpha)을 20.9 GiB / 2.30 bpw로 압축한 결과: 표준 IQ2_XS 대비 KL 발산량 59% 감소
요약
Aleph Alpha의 Kolibri-1 모델에 대한 저비트 양자화 및 전문가 가지치기(pruning) 실험 결과를 공개했습니다. 새로운 Sakura-MicroQuality 버전은 표준 대비 KL 발산량이 59% 낮고, 상위 토큰 일치율이 90.5%로 높은 성능을 보입니다. 또한, 사용 빈도가 낮은 전문가를 제거하여 모델 크기를 줄이는 방법도 제시했습니다.
핵심 포인트
- Kolibri-1의 저비트 양자화 버전 공개 (IQ2_XS)
- KL 발산량 59% 감소 및 상위 토큰 일치율 90.5% 달성
- 사용 빈도가 낮은 전문가를 제거하여 모델 크기 최적화 가능
- 양자화와 가지치기를 결합한 새로운 압축 기법 제시
저는 Aleph Alpha의 새로운 Kolibri-1, 즉 토큰당 약 3.5B개의 활성 파라미터를 가진 ~78B MoE 모델에 대해 공격적인 저비트 양자화(low-bit quantization) 실험을 진행해 왔습니다. 첫 번째 결과가 공개되었습니다: Sakura-MicroQuality Kolibri-1 — IQ2_XS 20.94 GiB 2.30 bpw의 전체 384개 전문가(expert) Kolibri-1 GGUF / llama.cpp 버전입니다. 이는 표준 IQ2_XS 기준선 대비 KL 발산량(KL divergence)이 약 59% 낮으며, 상위 토큰 일치율(top-token agreement)은 90.5%를 기록했습니다. 이는 표준 IQ2_XS 비교치인 84.6%보다 높은 수치이며, 크기 면에서도 표준 IQ2_XS보다 약간 더 작습니다. 목표는 단순히 가장 작은 양자화 모델을 만드는 것이 아니었습니다. 저는 모든 부분을 동등하게 취급하기보다는, 텐서/레이어 민감도(tensor/layer sensitivity)를 사용하여 중요해 보이는 부분에 비트(bits)를 할당하고 있습니다. 모든 품질 측정은 거의 손실이 없는 Q8_0 참조(reference)를 기준으로 이루어졌습니다. 또한 모델 자체는 ~156 GB BF16 가중치에서 직접 변환된 것이 아니라 Q8_0으로 재양자화되었기 때문에, BF16 대비 매우 작은 추가 소스 오류가 존재합니다. 메인 리포지토리: https://huggingface.co/webmp3/Sakura-MicroQuality-Kolibri-1-GGUF 현재 제가 알기로는 이것이 Kolibri-1의 첫 공개 ~2비트 GGUF 버전입니다. 이미 2비트 MLX 버전은 존재하지만, 다른 공개 Q2/IQ2 GGUF는 찾지 못했습니다. 또한 전문가 풀(expert pool) 가지치기(pruning)도 시도해 보았습니다. 전체 384개 전문가 버전에 더하여, 별도의 365E 변형을 출시했습니다. 각 MoE 레이어에 대해 다음을 포함하는 혼합 교정 세트(mixed calibration set): 독일어 및 영어 텍스트 코드 채팅 스타일 프롬프트, 모델 자체의 사고/생성 응답에서 실제 라우팅 통계(routing statistics)를 수집했습니다. 그 후 레이어당 사용되지 않은 전문가 중 가장 적게 사용된 19개를 제거했습니다. 이로 인해 다음이 감소합니다: 384 → 레이어당 365개 라우팅 전문가, 그리고 모델 전체에서 950개의 전문가가 제거됩니다. 결과 모델은 약 ~78B 대신 약 74.4B의 파라미터를 갖게 됩니다. 흥미로운 점은 이 제거된 전문가들이 교정 작업 부하(calibration workload)에서 실제로 얼마나 적게 사용되었는지입니다. 제거된 전문가들은 모든 전문가 선택 중 단지 약 0.07%만을 차지했으며, 개별 레이어도 대략 0.23%를 초과하지 않았습니다.
또한 제거된 950개의 전문가 중 375개는 라우팅 분석 과정에서 전혀 선택되지 않은 전문가였습니다. 생존하는 가중치에 대해서는 재훈련(retraining), 미세 조정(finetuning), 양자화(requantization)를 수행하지 않습니다. 이미 양자화된 전문가 텐서들은 해당되는 라우터 가중치 및 편향과 함께 직접 슬라이스됩니다. Top-6 라우팅은 변경되지 않았습니다. 365E IQ2 변형의 결과는 다음과 같습니다: 19.99 GiB, 2.31 bpw, 74.4B 파라미터, 레이어당 365개 라우팅된 전문가, 보유 측정치에서 90.5%의 top-token 일치율입니다. 365E 저장소: https://huggingface.co/webmp3/Sakura-MicroQuality-Kolibri-1-365E-GGUF 저는 이것을 그 전문가들이 보편적으로 쓸모없다고 주장하기보다는 실험으로 간주하고 있습니다 — 전문가 사용은 명백히 워크로드와 교정 데이터(calibration data)에 따라 달라집니다. 하지만 이는 우리에게 두 번째 압축 레버를 제공합니다: 낮은 정밀도만으로 모든 바이트의 압축을 얻으려고 시도하는 대신, 전문가 가지치기(expert pruning) + 저비트 양자화입니다. Q3와 Q4가 곧 나올 예정입니다. Sakura-MicroQuality 시리즈의 나머지 부분은 현재 업로드 중입니다. Q3 및 Q4 변형은 몇 시간 내에 이용 가능할 것입니다. 온라인이 되는 대로 동일한 비교 데이터를 추가하여, IQ2 → Q3 → Q4 사이에서 실제 품질/크기 최적점(sweet spot)이 어디에 위치하는지, 그리고 365E 가지치기가 더 높은 품질의 양자화 레벨에서도 유지되는지 확인할 수 있을 것입니다. 저는 독립적인 테스트에 매우 관심이 있습니다. 특히 다음 환경에서의 테스트입니다: Strix Halo / AMD UMA, Apple Silicon, 24–32 GB GPU 및 기타 메모리 제약형 로컬 시스템. 만약 누군가 두 버전 중 어느 것을 테스트하고, 특히 긴 컨텍스트(long-context), 독일어, 코딩 또는 에이전트 워크로드(agentic workloads)를 사용한다면 결과를 보고해 주시면 감사하겠습니다. /u/Psychological_Lab955에 의해 제출됨 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기