추측 대신 양자화 전 어떤 가중치가 중요한지 실제로 테스트할 수 있는 도구 제작 (Qwen3.6-27B, 3개 빌드:
요약
양자화 과정에서 가중치 그룹별 중요도를 KL 발산(KL divergence)을 통해 수치로 측정하는 자동화 도구를 개발했습니다. 이를 통해 Qwen3.6-27B 모델을 성능과 압축률의 균형에 따라 세 가지 버전(Bedrock, Tightrope, Gambit)으로 제작했습니다.
핵심 포인트
- 가중치 그룹의 크기나 역할이 압축 성능을 보장하지 않음을 확인
- 3.5~3.9 비트 구간이 모델 성능 유지의 임계점으로 나타남
- 도구 호출(Tool calling) 능력이 양자화 시 가장 먼저 저하됨
- 데이터 기반의 가중치별 테스트를 통해 최적의 양자화 전략 수립 가능
대부분의 양자화 (Quantization)는 다음과 같이 진행됩니다: 비트 깊이 (bit depth)를 선택하고, 모든 곳에 적용하며, 아마도 imatrix가 무엇이 중요한지 대략적으로 추측하게 한 뒤 배포합니다. 대부분은 어떤 특정 가중치 그룹 (weight groups)이 손상을 입어도 되는지, 어떤 그룹이 안 되는지를 확인하지 않습니다. 그저 관습과 느낌 (vibes)에 의존할 뿐입니다. 그래서 저는 한 번에 하나의 가중치 그룹을 양자화하고, 일반, 코드, 수학, 그리고 도구 호출 (tool calling) 프롬프트 전반에 걸쳐 KL 발산 (KL divergence)을 사용하여 전체 정밀도 (full precision) 모델로부터 정확히 얼마나 벗어나는지를 측정하는 하네스 (harness)를 구축했습니다. 추측이 아닙니다. 가중치 그룹당 실제 수치입니다. 다른 누군가가 지적하기 전에 한 가지 솔직하게 말씀드리고 싶은 것이 있습니다. 이러한 종류의 가중치 그룹별 테스트는 숙련된 양자화 작업자들이 이미 직관과 수년간의 반복을 통해 비공식적으로 수행하고 있는 일입니다. 제가 새로운 기술을 발명했다고 주장하는 것이 아닙니다. 저는 그것을 자동화했고, 느낌에 의존하는 대신 실제 수치를 얻어냈을 뿐입니다. 저는 테스트 하네스를 가진 개인일 뿐 연구실이 아니며, 이것이 bartowski, Unsloth, 또는 ik가 내놓는 결과물보다 뛰어나다고 주장하는 것도 아닙니다. 그들은 저보다 훨씬 더 많은 경험을 가지고 있습니다. 테스트 결과는 다음과 같습니다: 크기가 가중치 그룹의 압축 성능을 예측하지 못합니다. 저는 크기와 역할이 거의 동일하지만 압축에 대한 허용 오차가 판이하게 다른 가중치 그룹들을 발견했습니다. 어떤 그룹은 공격적인 설정에서도 잘 버티지만, 구조적 쌍둥이인 다른 그룹은 두 단계 더 일찍 무너집니다. 모델을 보는 것만으로는 이를 알 수 없습니다. 오직 테스트만이 이를 밝혀냅니다. 실제 절벽 (cliff)이 존재하며, 그 폭은 좁습니다. 제가 테스트한 모든 항목에서, 측정 가능한 발산은 가중치당 대략 3.5에서 3.9 비트 사이의 좁은 구간에서 일관되게 시작되었습니다. 이 수치보다 높게 유지하면 상태가 깨끗하게 유지됩니다. 이보다 낮아지면 균열이 생기기 시작합니다. 도구 호출 (tool calling)이 항상 가장 먼저 무너집니다. 제가 테스트한 대부분의 가중치 그룹에서, 도구 호출은 일반 채팅, 코드, 수학보다 먼저 발산이 나타나는 첫 번째 능력이었습니다. 만약 양자화된 모델에서 에이전트 (agentic) 또는 도구 사용 성능이 중요하다면, 누구의 양자화 모델을 실행하든 상관없이 이 부분을 주의 깊게 살펴봐야 합니다.
이 모든 과정을 통해 세 가지 크기의 모델을 제작했습니다: Bedrock (13.26GB) - 테스트를 통해 깨끗하다고 증명된 것 이상으로는 아무것도 압축하지 않았습니다. 원본 모델(source model)에 가장 가깝습니다. Tightrope (12.53GB) - 균형 잡힌 모델입니다. 대부분의 가중치 그룹 (weight groups)을 안전한 지점에 두었으며, 데이터가 실제로 뒷받침되는 일부 그룹은 더 밀어붙였습니다. Gambit (10.94GB) - 공격적인 모델입니다. 테스트된 모든 가중치 그룹을 측정된 안전 지점보다 의도적으로 한 단계 더 밀어붙였습니다. 가장 작은 점유율 (footprint)을 가지면서도 코딩 작업, 논리 퍼즐, 다단계 추론 (multi-step reasoning) 등 제가 던진 모든 테스트를 여전히 견뎌냈습니다. 여유 공간은 가장 적지만, VRAM이 부족한 상황이라면 가장 큰 보상을 줄 것입니다. 또한 저는 원본 모델에 포함된 것을 재사용하는 대신, 이를 위해 저만의 imatrix를 직접 제작했습니다. 이것은 공식적인 벤치마크 제품군 (benchmark suite)이 아닌, 수동적인 직접 테스트 결과입니다. 점수를 보고하는 것이 아닙니다. 하지만 단순한 평면 양자화 (flat quant) 방식도 아니었기에, 일반적으로 동일한 크기의 다른 모델보다 더 잘 버텨줄 것입니다. 제가 이것을 공개하는 이유는 단순히 다운로드 수만을 원하는 것이 아니라 실제 피드백을 원하기 때문입니다. 만약 이 모델 중 하나를 실행하신다면, 실제로 작동하는 모습을 정말 보고 싶습니다. 모델이 잘 수행한 작업이나 망친 작업의 스크린샷을 남겨주세요. 어느 쪽이든 저에게는 유용합니다. 만약 무언가 고장 나거나 이상하게 느껴진다면, 정확히 어느 부분인지 말씀해 주세요. 그것은 그 어떤 찬사보다 저에게 더 가치 있습니다. 이것은 개인 프로젝트이며, 제가 아직 발견하지 못한 부분들이 있다는 것을 알고 있습니다. 그것을 찾아낼 수 있도록 도와주세요. 링크: https://huggingface.co/enginetown/Qwen3.6-27B-Calibrated 제출자 /u/enginetown [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기