Qwen3.8-27B (HauhauCS) 언센서드 모델을 4090에서 262K 컨텍스트로 구동한 결과
요약
HauhauCS의 언센서드 Qwen3.8-27B 모델을 GGUF 형식으로 구동하는 새로운 방법을 제시합니다. 기존 llama.cpp에서 131K 컨텍스트로 작동하던 것과 비교하여, MTP3를 활용해 262K 네이티브 컨텍스트에서 높은 디코딩 속도와 프롬프트 수용률을 달성했습니다.
핵심 포인트
- Qwen3.8-27B 모델의 GGUF 배포 및 최적화 결과를 공유함.
- MTP3를 사용하여 262K 컨텍스트에서 높은 성능을 입증함.
- 프롬프트 수용률(70.8%)과 디코딩 속도(~130 tok/s)가 우수함.
HauhauCS는 자신들의 언센서드 Qwen3.8-27B를 GGUF 형식으로만 배포합니다. NInfer는 C++/CUDA 기반이어서 자체 포맷을 원했습니다. 이제 llama.cpp에서 91.6 tok/s / 131K로 구동되던 동일한 모델이 다음과 같이 작동합니다: MTP3를 사용하여 262K 컨텍스트(모델의 전체 네이티브 창)에서 ~130 tok/s 디코딩, 9K 프롬프트에 대해 70.8% 수용률로 3,591 tok/s 프리필을 달성했습니다. Perplexity는 공식 아티팩트와 1.3% 이내입니다. 따라서 변환이 깔끔합니다. Vision 및 tool 호출도 여전히 작동합니다. 컨버터와 상세 내용은 여기에서 확인하세요: https://github.com/T-Crypt/ninfer-4090/pull/4 질문 환영합니다. 레포지토리: ninfer-uncensored /u/Distinct-Pie2389 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기