
empero-ai/Qwythos-9B-v2-GGUF
요약
Qwythos-9B-v2는 기존 모델의 반복(looping) 문제를 FTPO 기술로 해결한 개선된 GGUF 모델입니다. 심층 사고 체인(CoT) 능력을 유지하면서도 탐욕적 디코딩 시의 퇴화 현상을 0%로 낮추었으며, MTP 지원을 통해 추론 효율을 높였습니다.
핵심 포인트
- FTPO를 적용하여 모델의 반복/퇴화 현상을 6.7%에서 0%로 개선
- 심층 사고 체인(CoT) 및 지식/추론 능력 유지
- MTP(Multi-Token Prediction) 헤드 복구 및 지원
- llama.cpp, Ollama, LM Studio 등 다양한 런타임 호환
빠른 시작 llama.cpp llama-cli \ -m Qwythos-9B-v2-Q4_K_M.gguf \ -p "Walk through the biochemistry of how organophosphate nerve agents inhibit acetylcholinesterase." \ -n 8192 \ --temp 0.6 --top-p 0.95 --top-k 20 --repeat-penalty 1.05 \ -c 16384 v2는 반복(looping) 문제가 학습을 통해 해결되었기 때문에, --repeat-penalty는 이제 선택 사항이며 탐욕적 디코딩 (greedy decoding, --temp 0) 상태에서도 일관성을 유지합니다. Ollama ollama run hf.co/empero-ai/Qwythos-9B-v2-GGUF:Q4_K_M LM Studio / jan / KoboldCpp .gguf 파일을 런타임의 모델 디렉토리에 넣기만 하면 됩니다. Qwythos는 표준 Qwen3.5 채팅 템플릿 (chat template)을 사용하며, 최신 GGUF 런타임은 파일에서 이를 자동으로 로드합니다. MTP 초안 추측 (MTP draft speculation) llama-server \ -m Qwythos-9B-v2-MTP-Q4_K_M.gguf \ --spec-type draft-mtp \ --spec-draft-n-max 6 \ -c 16384 --port 8080 MTP 지원을 위해서는 최신 llama.cpp 빌드가 필요합니다. 사용 중인 런타임이 아직 MTP를 지원하지 않는 경우, 일반 파일을 사용하세요. Qwythos-9B-v2는 새롭고 개선된 Qwythos입니다 — 기존 Qwythos의 모든 심층 사고 체인 (deep chain-of-thought reasoning)을 유지하면서 반복 동작(looping behavior)을 수정했습니다. 탐욕적 디코딩 또는 낮은 온도 (low-temperature) 디코딩 시 나타나던 반복/퇴화(looping/degeneration) 현상이 학습을 통해 제거되었으며 (6.7% → 0%), 네이티브 MTP 헤드(MTP head)가 복구되었고, 정체성 프롬프트(identity prompt)가 정리되었습니다. 그러면서도 지식과 추론 능력은 기본 Qwythos 수준(또는 그 이상)으로 유지됩니다. 이 수정에는 FTPO (Final-Token Preference Optimization)가 사용되었습니다: 반복 루프를 시작하는 정확한 토큰을 식별하고, 모델이 해당 위치에서 일관된 대안을 선호하도록 부드럽게 학습시켜 나머지 분포 — 즉 지식과 추론 능력 — 는 건드리지 않고 유지합니다. 전체 학습 세부 정보, 평가 수치 및 샘플 생성 결과는 기본 모델 카드 (base model card)를 참조하세요.
일반 텍스트 가중치 (Normal text weights) — 트렁크(trunk)만 포함 (32개 블록)
| 파일 | 양자화 (Quant) | 크기 | 비고 |
|---|---|---|---|
| Qwythos-9B-v2-Q4_K_M.gguf | Q4_K_M | 5.34 GiB / 5.74 GB | 권장 기본값 — 가장 작고 실용적이며 품질이 좋음 |
| Qwythos-9B-v2-Q5_K_M.gguf | Q5_K_M | 6.08 GiB / 6.52 GB | 품질과 크기의 균형 |
| Qwythos-9B-v2-Q6_K.gguf | Q6_K | 6.95 GiB / 7.46 GB | 높은 품질 |
| Qwythos-9B-v2-Q8_0.gguf | Q8_0 | 8.87 GiB / 9.53 GB | 손실에 가까운(near-lossless) 품질 |
| Qwythos-9B-v2-BF16.gguf | BF16 | 16.69 GiB / 17.92 GB | 전체 정밀도 (변환 기준값) |
어떤 것을 선택해야 할지 모르겠다면, Q4_K_M이 적절한 시작점입니다.
MTP 활성화 텍스트 가중치 (MTP-enabled text weights) (33개 블록, nextn_predict_layers = 1)
이 파일들은 복구된 Qwen3.5 호환 MTP 헤드 (MTP head)를 포함하고 있습니다. MTP 초안 추측 (MTP draft speculation)을 지원하는 llama.cpp 빌드( --spec-type draft-mtp )와 함께 사용하세요. MTP 행렬 (MTP matrices)은 모든 양자화 변형에서 Q8_0 정밀도로 유지됩니다.
| 파일 | 양자화 (Quant) | 크기 | 비고 |
|---|---|---|---|
| Qwythos-9B-v2-MTP-Q4_K_M.gguf | Q4_K_M + MTP | 5.50 GiB / 5.90 GB | 권장되는 MTP 기본값 |
| Qwythos-9B-v2-MTP-Q5_K_M.gguf | Q5_K_M + MTP | 6.25 GiB / 6.71 GB | 품질과 크기의 균형 |
| Qwythos-9B-v2-MTP-Q6_K.gguf | Q6_K + MTP | 7.14 GiB / 7.67 GB | 높은 품질 |
| Qwythos-9B-v2-MTP-Q8_0.gguf | Q8_0 + MTP | 9.11 GiB / 9.79 GB | 손실에 가까운(near-lossless) 품질 |
| Qwythos-9B-v2-MTP-BF16.gguf | BF16 + MTP | 17.14 GiB / 18.41 GB | 전체 정밀도 (변환 기준값) |
비전 프로젝터 (Vision projector) — 이미지 입력을 위한 용도
| 파일 | 크기 | 비고 |
|---|---|---|
| mmproj-Qwythos-9B-v2-BF16.gguf | 0.86 GiB / 0.92 GB | BF16 네이티브 정밀도의 CLIP 스타일 비전 인코더 (vision encoder) + 프로젝터 (projector); 이미지 사용 시 필수이며, 위의 모든 텍스트 양자화 모델과 쌍을 이룹니다. |
/u/techlatest_net 에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기