Hugging Face의 모든 검열되지 않거나 파괴된 모델을 VRAM 8GB부터 24GB까지 각 티어별로 분석하고 최고의 모델들을 선정했습니다.
요약
본 기사는 Hugging Face에 존재하는 검열되지 않거나 파괴된(abliterated) AI 모델들을 VRAM 용량별로 분석하고, 각 티어에서 최고의 성능을 보이는 모델들을 선정했습니다. 8GB부터 24GB까지의 다양한 GPU 환경에 맞춰 최적화된 여러 버전의 bonsai 2, qwen 3.8, gemma 4 등의 모델들이 소개되었습니다.
핵심 포인트
- VRAM 용량별로 최적화된 'uncensored' 및 'abliterated' 모델을 제공합니다.
- bonsai 2와 qwen 3.8 등 주요 모델이 다양한 VRAM 환경에 맞춰 성능 개선 버전을 출시했습니다.
- gemma 4, bonsai 2 등의 모델들이 높은 다운로드 수치와 함께 주목받고 있습니다.
Hugging Face에서 존재하는 모든 검열되지 않았거나(uncensored) 파괴된(abliterated) 모델들을 살펴보고, VRAM 8GB부터 24GB까지 각 용량별로 가장 좋은 모델들을 골라봤습니다.
환영합니다... 위험 구역에 오신 것을 환영합니다 ⚠️
━━━━━━━━━━━━━━━━━━━━
8gb · rtx 3060 ti, 3070, 4060, 5060, 4060 ti 8gb, 5060 ti 8gb · amd rx 6600, 6650 xt, 7600, 9060 xt 8gb · 기본 모델은 3060 ti 8gb에서 초당 42.8 토큰(tok/s)을 출력하며 최대 96k 창 크기까지 지원합니다.
- bonsai 2 27b heretic, 1-bit, 5.95gb, 거부율 100개 중 95개에서 0개로 감소, 이번 달 다운로드 147k 건
- bonsai 2 27b abliterated, 거부율 83%에서 0%로 감소, mmlu 점수는 78%를 유지, 다운로드 77k 건
- bonsai 2 27b crack, harmbench 거부율 93%에서 0%로 감소 → https://t.co/tg0s3vO7OV
구형 8gb 카드 · gtx 1070, 1080 · 기본 모델은 2016년식 gtx 1080에서 초당 42 토큰(tok/s)을 출력합니다.
- gemma 4 e4b aggressive, 5.3gb, 465개 중 0개 거부, 이번 달 다운로드 1.43m 건
- gemma 4 e4b heretic, 거부율 100개 중 99개에서 3개로 감소
━━━━━━━━━━━━━━━━━━━━
12gb · rtx 3060 12gb, 3080 12gb, 4070, 4070 super, 4070 ti, 5070 · amd rx 6700 xt, 6750 xt, 7700 xt · 기본 bonsai 2는 커널과 속도 헤드(speed head)를 사용하여 3060 12gb에서 초당 50.1 토큰(tok/s)을 출력합니다.
- bonsai 2 27b abliterated v2 with the mtp speed head, 7.7gb, 거부율 84%에서 0%로 감소
- qwen 3.8 27b abliterated gsq-rco를 사용하여 10gb로 압축, 이번 달 다운로드 2.12m 건
- qwen 3.8 27b heretic gsq-rco, 9.3gb에서 10.1gb, 거부율 100개 중 0개에서 1개로 감소
- gemma 4 12b heretic, 7.4gb, 다운로드 120k 건
━━━━━━━━━━━━━━━━━━━━
16gb · rtx 4060 ti 16gb, 5060 ti 16gb, 4070 ti super, 4080, 5070 ti, 5080 · amd rx 6800, 6900 xt, 7600 xt, 7800 xt, 9060 xt 16gb, 9070 xt · 기본 bonsai 2는 모든 기능을 사용하여 5060 ti 16gb에서 초당 67.3 토큰(tok/s)을 출력합니다.
- qwen 3.8 27b heretic ara, 16gb에 맞춰 제작됨, 14gb
- qwen 3.8 27b aggressive with the mtp head, 12.8gb에서 15.7gb, 거부율 465개 중 0개, 이번 달 다운로드 2.06m 건
- bonsai 2 27b heretic with the full 262k window, the speed head and vision all on (전체 262k 창 크기, 속도 헤드 및 비전 모두 활성화)
- gemma 4 26b a4b abliterated, moe(Mixture of Experts)를 사용하며 토큰당 4b가 활성화됨, 13.4gb
24GB의 위험 구역(danger zone) · rtx 3090, 3090 ti, 4090 ·
amd rx 7900 xtx와 20GB인 7900 xt도 여기에 해당합니다.
base qwen 3.8 27b q4는 mtp head를 사용한 제 3090에서 초당 41.3 토큰(tok/s)으로 실행되었으며, 소유자들은 3090 ti에서 61, 4090에서 76을 보고했습니다.
- qwen 3.8 27b uncensored (검열되지 않음), q4 16.8GB, 이번 달 다운로드 2.31M
- qwen 3.8 27b abliterated (파괴됨), q4 16.8GB, 다운로드 2.12M
- qwen 3.8 27b aggressive with the mtp head (mtp head를 사용한 공격적 버전), 거부율 465회 중 0회, 다운로드 2.06M
- qwen 3.8 27b heretic (이단자), 거부율 100회 중 0~1회
- qwen 3.8 27b fable cold fusion (전설적인 콜드 퓨전), 검열되지 않은 코더 병합본, 다운로드 2.09M
- qwen 3.6 35b a3b aggressive (a3b 공격적 버전), 3B 활성 moe(Mixture of Experts) 적용, 누적 다운로드 11.9M 및 이 목록에서 가장 많은 '좋아요'
━━━━━━━━━━━━━━━━━━━━
거부율 수치는 각 출시자가 자체적으로 테스트한 것이므로 모델별로 읽어주시고, 속도는 nvidia 카드 기반의 기본 모델에 대한 것입니다. 이 빌드들은 크기가 동일하게 유지되므로 같은 성능을 보입니다. amd 카드는 llama.cpp의 vulkan 또는 rocm 백엔드를 사용하여 동일한 파일을 실행합니다. bonsai 빌드는 prismml의 llama.cpp에서 실행됩니다.
거부율이 없다는 것은 가드레일(guardrails)이 없다는 뜻이며, 당신이 요청하는 모든 것을 소유하게 됩니다. 이것을 북마크하고, 본인의 카드를 찾아서 오늘 밤 하나를 가져가세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: 오픈소스 LLM의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기