지난 양자화 (Quantization) 프로젝트의 가장 큰 격차를 해소함: 이번에는 전체 결합 모델 테스트 실시
요약
Qwen3.6-27B 기반 미세 조정 모델을 대상으로 가중치 그룹별 KLD 양자화 성능을 결합 모델 단위로 테스트한 결과입니다. 개별 텐서 테스트와 달리 실제 결합 모델에서는 예상치 못한 성능 저하가 발생했으며, FFN 정밀도가 모델 품질 유지의 핵심임을 확인했습니다.
핵심 포인트
- 결합 모델 테스트를 통해 개별 텐서 테스트에서 예측하지 못한 실제 성능 저하 발견
- FFN(Feed-Forward Network) 정밀도가 어텐션보다 모델 품질 유지에 더 결정적인 역할 수행
- 특정 카테고리(attn_q, attn_v 등)는 공격적인 양자화 설정에서도 성능 저하 없이 견딤
- 양자화 설정에 따라 도구 호출(Tool calling)과 범용 출력의 성능 저하 순서가 달라짐
지난번에 이곳에 Qwen3.6-27B의 가중치 그룹별 KLD 양자화 (Quantization)에 대해 게시했는데, 그때 받은 가장 유익한 피드백(그 점에 대해서는 정말 감사드립니다)은 제가 모든 가중치 그룹을 개별적으로만 테스트했을 뿐, 모든 레이어가 함께 적용된 결합 모델 (Combined model)이 실제로 잘 작동하는지는 확인하지 않았다는 것이었습니다. 타당한 지적이었습니다. 그 말이 계속 머릿속에 남았습니다. 이번 프로젝트는 동일한 기본 아키텍처를 사용하는 DavidAU의 Fable-Fusion-711 미세 조정 (Fine-tune) 모델을 대상으로 한 동반 프로젝트이며, 지난번과 동일한 하네스 (Harness)를 사용합니다. 하지만 이번 라운드에서는 실제로 결합 모델을 구축하고 테스트하여, 개별 테스트에서는 전혀 예측하지 못했던 실제 성능 저하를 발견했으며, 원인이 되는 특정 텐서 (Tensors)를 추적하여 문제가 해결될 때까지 재테스트를 반복했습니다. 아래 수치들은 지난번처럼 별도의 구성 요소 실행 결과를 짜깁기한 것이 아니라, 실제 결합된 파일에서 추출한 것입니다. 이 모델의 차이점은 동일한 테스트에서 기본 Qwen3.6-27B보다 훨씬 더 깊은 압축을 견뎌낸다는 것이며, 그 정도가 구성 요소별로 매우 불균등하게 나타납니다. 몇몇 카테고리(attn_q, attn_output, attn_k, attn_v, attn_gate, ssm_beta, ssm_alpha)는 측정 가능한 파손 없이 가장 공격적인 설정까지 전체 단계를 견뎌냈습니다. 기본 Qwen의 해당 요소들은 훨씬 더 이른 단계에서 무너졌습니다. 또한, 지난번에는 거의 모든 곳에서 도구 호출 (Tool calling) 기능이 가장 먼저 망가졌습니다. 이번에는 반대였습니다. 범용 출력 (General purpose output)이 먼저 망가졌고, 도구 호출은 상대적으로 잘 버텼습니다. 시작할 때는 예상치 못한 결과였습니다.
결합 모델 KLD (전체 양자화 파일, 조각 모음이 아닌 하나로 테스트됨):
Bedrock Final, 12.19 GiB, 3.90 BPW. general 0.0213, code 0.0041, math 0.0059, toolcalling 0.0104
Tightrope, 12.13 GiB, 3.88 BPW. general 0.0237, code 0.0047, math 0.0073, toolcalling 0.0127
Gambit, 10.43 GiB, 3.33 BPW. general 0.0460, code 0.0074, math 0.0156, toolcalling 0.0269
어떤 단계에서도 레드 존(0.1 초과)으로 넘어간 것은 없었습니다. Bedrock Final의 도구 호출 (Toolcalling)은 이를 숨기는 대신 노란색 선 경계에 딱 걸쳐 있었습니다. 이번 실험 전체에서 가장 이상한 결과였습니다.
Tightrope는 어텐션 (Attention)에 훨씬 더 많은 부하를 가함에도 불구하고 Bedrock Final보다 겨우 60MB 정도만 더 작습니다. 이는 이 모델에서 실제 품질 비용의 거의 대부분이 어텐션이 아닌 FFN (Feed-Forward Network) 정밀도에 달려 있다는 사실이 밝혀졌기 때문입니다. FFN이 보호되면 어텐션은 비용을 거의 깎아내지 못합니다. 이는 실험 시작 전 가정한 것이 아니라, 실제로 빌드하면서 얻은 진짜 발견입니다. Gambit 자체는 자리를 잡기까지 몇 차례의 시행착오가 있었습니다. 초기 버전은 소수의 작은 어텐션 및 상태 텐서 (State Tensors)를 너무 과하게 압축했고, 결과적으로 성능이 좋아지기는커녕 눈에 띄게 나빠졌습니다. 아래 링크된 버전은 이를 되돌려, 다른 축을 따라 크기 대신 품질을 선택했습니다. 이 버전은 제가 테스트한 5가지 실제 설정 중 모든 카테고리에서 가장 뛰어난 성능을 보였지만, 조합 내의 정확히 어떤 변화가 이러한 결과를 만들어내는지까지는 분리해내지 못했습니다. 솔직히 말씀드리면, 제가 하지 않은 부분입니다. 지금까지의 직접적인 테스트는 Gambit만을 대상으로 하며, 세 가지 코딩 작업(스트레스 테스트를 거친 LRU 캐시, 적대적 재귀 하강 파서 (Adversarial Recursive Descent Parser), 느슨한 사양의 할 일 관리 앱)을 수행했습니다. 모두 통과했으며, 몇 가지 작은 기계적 버그는 있었으나 실제 추론 실패처럼 보이는 것은 없었습니다. Bedrock Final과 Tightrope는 아직 직접 테스트하지 않았습니다. KLD 수치가 더 취약한 카테고리로 지목한 수학이나 도구 호출 (Toolcalling) 작업에 대해서도 구체적인 스트레스 테스트를 수행하지 않았습니다. 또한 소스 모델 자체의 ARC-C 주장도 독립적으로 검증하지 않았는데, 그것은 이 프로젝트가 테스트하려는 목적이 아니기 때문입니다. 이러한 공백은 시간이 부족해서 남겨둔 미결 사항이 아니라, 제 역할이 끝나고 여러분의 역할이 시작되는 지점입니다. 저는 양자화 (Quantization)가 얼마나 많은 리스크를 추가하는지는 말씀드릴 수 있습니다. 그 리스크가 여러분의 특정 워크로드에 중요한지는 오직 여러분만이 알아낼 수 있는 문제입니다. 링크: https://huggingface.co/enginetown/Qwen3.6-27B-Fable-Fusion-711-Calibrated 지난번과 마찬가지로, 무언가 고장 나거나 이상하다고 느껴진다면 단순히 "이상한 느낌이다"라고 하지 마시고, 작업 내용과 실제 프롬프트 (Prompt)를 알려주세요. 그것만이 제가 실제로 조치를 취할 수 있는 유일한 피드백입니다. 모두 감사합니다. /u/enginetown 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기