Hy3 (295B MoE) 및 NVIDIA Nemotron-Labs-Audex-30B-A3B (오디오 기능 지원 30B MoE) GGUF
요약
Tencent의 295B MoE 모델인 Hy3와 NVIDIA의 오디오 지원 30B MoE 모델인 Nemotron-Labs-Audex의 GGUF 양자화 세트를 소개합니다. imatrix 양자화와 벤치마크 데이터를 통해 각 모델의 품질과 성능 수치를 객관적으로 검증하여 제공합니다.
핵심 포인트
- Hy3(295B MoE)의 다양한 양자화 크기별 KLD 및 생성 속도 데이터 제공
- NVIDIA Nemotron-Labs-Audex의 텍스트 및 오디오 생성 지원 GGUF 공개
- imatrix 및 보정 코퍼스를 활용한 재현 가능한 양자화 방법론 제시
- 하드웨어 사양에 따른 최적의 양자화 모델 추천 가이드 포함
두 가지 GGUF 양자화(quant) 세트를 공유합니다. 두 세트 모두 동일한 방식을 적용했습니다: imatrix 양자화, BF16 참조 로짓(logits) 대비 KLD/PPL 측정, llama-bench 처리량(throughput) 수치, 그리고 리포지토리(repo)에 포함된 모든 원본 벤치마크 데이터입니다. 느낌에 의존한 "품질 테스트 완료" 같은 주장은 하지 않겠습니다. 모든 수치는 리포지토리의 파일들을 통해 재현 가능합니다.
- Hy3 — Tencent의 295B MoE (활성 파라미터 21B)
LordNeel/Hy3-GGUF
베이스: tencent/Hy3 — 295B MoE, 활성 21B, 262K 컨텍스트(context), Apache 2.0. Hy3가 활성화된 llama.cpp 브랜치를 사용하여 BF16에서 변환되었으며, 커스텀 보정 코퍼스(calibration corpus)를 사용한 imatrix를 적용했습니다.
| 양자화 크기 | 평균 KLD | Top-token 일치도 | 생성 토큰/s* |
|---|---|---|---|
| Q6_K | 226 GiB | 0.0207 | 95.1% |
| Q4_K_M | 167 GiB | 0.0904 | 90.0% |
| Q3_K_L | 143 GiB | 0.1624 | 86.8% |
| IQ2_M | 90 GiB | 0.5314 | 74.7% |
*8x RTX PRO 6000 Blackwell, 레이어 분할(layer split), F16 KV 캐시(cache). 품질 측정: WikiText-2, 128 chunks x 512 ctx vs BF16 no-MTP 참조 로짓(logits).
추천: 약 256GB의 여유가 있다면 Q6_K는 사실상 손실이 없는(lossless) 수준입니다. Q4_K_M은 합리적인 기본 선택지입니다 (96GB GPU 2개에 적합). IQ2_M은 단일 96GB 카드나 128GB Mac에 구겨 넣을 수 있지만, 품질 저하가 확실히 체감됩니다.
주의사항: --split-mode layer를 사용하세요 (이 아키텍처의 CUDA 디코딩에서 tensor split은 충돌이 발생했습니다). 또한, MTP/NextN 블록은 의도적으로 제외되었습니다. 직접 양자화 모델을 만들고 싶다면 imatrix, 보정 코퍼스, 전체 재현 스크립트가 리포지토리에 포함되어 있습니다.
- Nemotron-Labs-Audex-30B-A3B — NVIDIA의 오디오 기능 지원 30B 하이브리드 MoE
LordNeel/Nemotron-Labs-Audex-30B-A3B-GGUF
베이스: nvidia/Nemotron-Labs-Audex-30B-A3B — 30B Nemotron-H 하이브리드 MoE, 토큰당 약 3B 활성, 1M 컨텍스트, 오디오 이해 + 생성.
하나의 리포지토리에 두 가지 트랙이 있습니다:
quants/ — 일반적인 llama.cpp 사용을 위한 텍스트 전용 GGUF
audio_quants/ — 전체 어휘(full-vocab) 오디오 생성(audiogen) GGUF + 사이드카(sidecar) audio_support/ (NV-Whisper 인코더, 인과적 음성 디코더(causal speech decoder), 향상 VAE, 그리고 TTS, 오디오 QA, 음성-대-음성(speech-to-speech)을 위한 NVIDIA의 HF/vLLM 스크립트)
품질은 세 가지 코퍼스(WikiText-2 / code / GSM8K)를 통해 측정되었으며, 처리량은 2x RTX PRO 6000 Max-Q에서 측정되었습니다.
텍스트 전용 트랙(Text-only track):
| 양자화 크기 (Quant Size) | 평균 KLD (Mean KLD) | Top-token 일치도 (Top-token agreement) | 생성 속도 (Gen tok/s) |
|---|---|---|---|
| Q8_0 | 31.3 GiB | 0.0056 | 97.0% |
| Q5_K_M | 24.2 GiB | 0.0127 | 95.5% |
| Q4_K_M | 22.8 GiB | 0.0180 | 94.7% |
| MXFP4_MOE | 16.7 GiB | 0.0405 | 92.3% |
동일한 환경에서 BF16은 약 177 tok/s로 생성하므로, 양자화 모델(quants)은 약 2배 더 빠르게 실행됩니다. MXFP4_MOE는 실험적이지만 흥미롭습니다. 파일 크기가 가장 작으며, K-양자화(K-quants) 모델이 약 8.5K prompt tok/s를 기록할 때 11.5K prompt tok/s를 기록합니다. Audiogen 수치는 모델 카드(model card)에 코퍼스별 상세 내역 및 차트와 함께 근사치로 기재되어 있습니다. 사용을 시작하기 전에 주의할 점: 라이선스는 NVIDIA OneWay Noncommercial(상위 모델로부터 상속됨)로, 상업적 용도로 사용할 수 없습니다. llama.cpp는 nemotron_h LM 측면을 실행하며, 전체 오디오 파이프라인(audio pipeline)을 위해서는 사이드카(sidecar)와 NVIDIA의 스크립트가 필요합니다. 아직 모든 기능이 통합된(all in one) 오디오 GGUF 런타임은 존재하지 않습니다. 401개의 텐서 중 약 133개가 K-양자화(K-quantization) 과정에서 폴백(fall back)됩니다 (Nemotron-H MoE/SSM 텐서 형상 때문). 이것이 Q6_K의 크기가 Q8_0에 가깝게 나타나는 이유입니다. 두 리포지토리(repos) 모두 차트, 체크섬(checksums), 양자화 계획(quant plans) 및 양자화별 로그를 제공합니다. 질문이나 양자화 요청은 언제든 환영합니다. /u/Blahblahblakha가 r/LocalLLaMA에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기