Abliterlitics로 비교한 23개의 Gemma 4 E4B 모델: 가장 많이 다운로드된 모델이 가장 망가져 있다
요약
HuggingFace의 23개 Gemma 4 E4B 모델을 대상으로 Abliterlitics 테스트를 진행하여 모델의 탈제한(abliteration) 성능을 비교 분석했습니다. 분석 결과, 다운로드 수가 많은 일부 모델이 실제로는 성능이 심각하게 저하된 상태임을 밝혀냈습니다.
핵심 포인트
- Heretic 변체 모델들이 능력 보존과 탈제한 성능 면에서 가장 우수함
- 높은 다운로드 수를 기록한 OBLITERATUS 모델은 성능이 완전히 망가진 것으로 확인됨
- 정교하게 텐서를 수정하여 모델 능력을 보존하는 것이 핵심임
- 마케팅이나 다운로드 수치만으로 모델의 품질을 판단해서는 안 됨
이번은 우리의 역대 최대 규모 비교입니다. 우리는 HuggingFace에서 23개의 Gemma 4 E4B 모델을 가져와 abliterlitics 테스트(gauntlet)를 진행했습니다. 또한 새로운 abliterlitics Discord가 생겼으니, 자유롭게 들어와서 제 벤치마크 선택을 비판(roast)하셔도 좋습니다! 아니면 그냥 채팅하며 시간을 보내셔도 됩니다. 이번 비교는 이전의 비교들과 유사하지만, 새로운 벤치마크들이 포함되었습니다. 모든 모델은 베이스(base) 모델과 비교되었으며, 모델 간의 텐서(tensor) 비교도 이루어졌습니다. 왜 그랬을까요? 얼마 전 저는 사람들이 자신의 모델에 대해 하는 허위 주장들에 진저리가 났기 때문입니다. 어떤 사람들은 자신의 모델이 베이스 모델과 어떻게 다른지 확인하기 위한 비교 작업을 시간 내에 수행하지 않습니다. 괜찮습니다, 우리가 직접 하면 되니까요! Gemma 4 E4B용 abliterlitics JSON, 로그 및 기타 아티팩트(artifacts)는 Gemma4-e4b-abliterlitics HuggingFace에 있습니다. Gemma E4B abliterlitics 웹사이트의 보고서도 확인하세요. 이 두 링크 모두에 전체적인 종합 보고서와 모든 데이터가 포함되어 있습니다. 또한, 이번 비교에 포함된 모든 모델이 abliteration(탈제한) 모델인 것은 아닙니다. 우리 모두 Opus나 Gemini의 추론 흔적(reasoning traces)으로 파인튜닝(fine-tuned)된 모델들을 본 적이 있을 것입니다. 저도 그런 모델들을 몇 개 섞어 넣었습니다. 또한 일부 abliterated 파인튜닝 모델들도 포함되었습니다. 더 공정하게 말하자면, 이들 중 대부분은 서로 직접적으로 비교하기 어렵습니다. 예를 들어, 베이스 모델과 비교한 KL 파인튜닝은 베이스 모델에서 직접 수행한 abliteration보다 항상 더 높게 나올 것입니다. 그렇다면 누가 최고였을까요? 무엇을 피해야 할까요? 이는 정말 사용 사례(use case)에 따라 다릅니다. Heretic 변체(variants)들이 전반적으로 가장 뛰어납니다. Harmbench에서 약 95%의 ASR을 달성한 이 모델들은 더 정교하게(surgical) 작업되었으며 모델의 대부분의 능력을 보존합니다. gemma-4-E4B-it-abliterix는 다른 비교 사례들과 마찬가지로 100% 거부 ASR을 보이지만, 그 대가로 일부 능력을 상실합니다. TrevorJS/gemma-4-E4B-it-uncensored는 99.3% ASR로 바로 뒤를 잇지만, Heretic 변체만큼 정교하지는 않습니다. OBLITERATUS/gemma-4-E4B-it-OBLITERATED는 피해야 합니다. 솔직히 말해서, 완전히 망가져 있습니다. bendernina와 physshell은 이 모델의 v2이며 훨씬 더 망가져 있습니다. 이들은 OBLITERATUS 도구를 사용하여 생성되었습니다.
23개의 비교 데이터는 Reddit에 담기에는 너무 방대하므로, 주요 하이라이트를 정리하면 다음과 같습니다: obliteratus 모델은 총 다운로드 수가 80만 회에 육박하지만, 완전히 망가져 있습니다. 사실 모델이 단순히 손상된 정도 때문에 거절(refusal)하지 않는 경우는 이번이 처음입니다. 거절하지 않는 모델을 찾아내기 위한 초기 정규 표현식 (regex) 검사 결과는 높게 나타났으나, 우리의 GLM 5.2 judge는 다른 이야기를 들려주었습니다. Harmbench에서 abliterated 모델 중 가장 낮은 ASR (공격 성공률)을 기록했습니다. 벤치마크 성능은 최악이었으며, KL 발산 (KL divergence)은 1.1로 가장 높았습니다. 다운로드 수치를 보면 사람들이 정말로 하이프(hype)나 마케팅 측면에 잘 속는다는 것을 보여줍니다. 이전 비교들과 마찬가지로, 더 정교하고(surgical) 텐서(tensor)를 적게 건드린 abliteration 모델들이 승자였습니다. Ilya626의 gemma-4-E4B-it-SDFT_Heretic_RP 모델은 이름에 heretic이 포함되어 있음에도 불구하고, 실제로 Harmbench에서 낮은 ASR을 보였습니다. 너무 낮아서 잘못된 모델이 업로드되었거나 어딘가에 실수가 있다고 믿을 정도였습니다. 이 모델은 거절(refusal)이 매우 많았습니다. 이와 유사하게, gemma-4-E4B-it-SDFT_Heretic_RP와 obliteratus가 정확히 동일한 381개의 텐서를 수정한다는 점이 이상하게도 주목되었습니다. 유일한 차이점은 수정된 값의 크기(magnitude)뿐입니다. gemma-4-E4B-it-SDFT_Heretic_RP는 7.5배 적게 수정합니다. 여기서 제가 발견한 패턴은 때때로 모델들이 서로를 기반으로 만들어진다는 점입니다. 어떤 경우에는 출처 표기(attribution)가 없습니다. Gemma 4 E2B의 경우에도 이런 일이 있었으며, 지적이 있자 저자가 즉시 모델 카드(model card)를 수정했습니다. infinimind는 trevorjs와 비트 단위로(bit-for-bit) 동일하지만, 출처가 명시되어 있습니다. bendernina와 physshell은 코사인 유사도(cosine similarity)가 0.99999로 출처 표기가 없으며, 서로 다른 모델임을 시사하는 별개의 모델 카드를 가지고 있습니다. 하지만 이 둘 모두는 단지 obliteratus v2일 뿐입니다. Reasoning distill 파인튜닝(fine-tunes) 모델들은 흥미로운 대조군(control group)이었습니다. 이들은 추론 능력을 향상시키지도, 안전성(safety)을 제거하지도 않았으며, 그저 모델을 망가뜨렸을 뿐입니다. Claude 4.6 Opus distill 모델이 그중 최악이었는데, GSM8K는 17포인트 하락했고 MMLU-Pro는 12.5포인트 하락했습니다. 마치 Gemma 4의 고유한 추론 회로(reasoning circuits)를 덮어써 버린 것 같습니다.
Gemini 3.1 Pro 증류(distill) 모델은 더 가벼웠지만 여전히 순부정적(net negative)인 결과를 보였습니다. DavidAU의 deckard 모델들은 흥미로운 사례입니다. 이들은 순수한 Abliteration(탈거)이라기보다 Abliterated 미세 조정(fine-tunes) 모델이기에, 역할극(roleplay) 학습으로 인한 트레이드오프(trade-off)가 일부 벤치마크에서 나타납니다. GSM8K strict와 MMLU-Pro는 모두 하락했지만, HellaSwag, ARC, PIQA는 실제로 상승했습니다. 제 추측으로는 역할극 학습이 추론 길이(reasoning length)를 늘려서, 모델이 문제를 해결하긴 하지만 #### N 답변 마커를 훨씬 지나서 횡설수설하는 경우가 많기 때문인 것 같습니다. HarmBench 결과 또한 상당히 많은 답변 절단(truncated responses) 사례를 보여주며 이를 뒷받침합니다. 이것이 단순히 벤치마크 노이즈일 수도 있지만, 23개의 변체 중 15개가 GSM8K strict 수학 테스트에서 약간 더 나은 성능을 보였습니다. 베이스 모델은 처음에 30.8%의 HarmBench ASR(공격 성공률)을 기록했는데, 이는 100개의 HarmBench 질문이 저작권과 관련되어 있기 때문입니다. 베이스 모델은 저작권이 있는 콘텐츠를 재생산하는 데 아무런 문제가 없습니다. 실제 차별점은 화학/생물 및 사이버 범죄와 같은 더 어려운 카테고리에서 나타납니다. 또한 apostate 프로젝트를 특별히 언급하고 싶습니다. 그들의 모델인 gemma-4-e4b-it-apostate는 Abliteration 접근 방식에 있어 완전히 독특합니다. 그들은 모델의 완전히 다른 부분을 수정하여 매우 좋은 결과를 얻어냈습니다. Attention 텐서와 비교하여 MLP 헤드 텐서(MLP head tensors)를 수정하는 Abliteration 기술을 본 것은 이번이 처음입니다. 제작자와 대화하고 싶다면 apostate Discord에 방문해 보세요. 저희는 Gemma 4 시리즈를 살펴보고 있으며, 다음으로는 12b 모델이 예정되어 있습니다. 비교를 원하는 모델이 있나요? 제가 놓친 제작자가 있나요? 알려주시면 분석 대상에 포함하도록 하겠습니다.
The Full Breakdown
Model ASR GSM8K strict KL Tensors abliterix 100.0% 87.1% 0.054 89 trevorjs 99.3% 88.3% 0.015 84 infinimind 98.5% 87.9% 0.015 84 huihui 98.3% 87.4% 0.027 70 nullpo 96.5% 88.7% 0.005 36 heretic 95.5% 88.2% 0.002 29 deckard 95.5% 80.2% 0.022 294 mythos 95.3% 88.0% 0.007 34 deckard-expresso 94.8% 60.4% 0.052 294 coder3101 93.8% 87.9% 0.002 21 heresy 93.3% 87.8% 0.002 34 heretic-std 91.0% 87.9% 0.001 28 wwt 88.3% 89.0% 0.032 34 apostate 85.8% 87.5% 0.004 152 treadon 76.3% 88.5% 0.021 34 treadon-combo 72.5% 88.0% 0.268 42 obliteratus 72.0% 66.0% 1.102 381 bendernina 58.0% 66.4% 0.923 345 physshell 58.0% 66.4% 0.923 345 claude-distill 40.0% 69.8% 0.074 294 distill 34.5% 83.3% 0.042 294 treadon-disin 33.5% 87.2% 0.296 40 sdft 30.8% 87.2% 0.002 381 base 30.8% 87.0% - - KL = 기본 모델 대비 출력 분포 변화(output distribution shift)이며, 낮을수록 깨끗하다(cleaner). Tensors = 가중치(weights)가 719개 중 수정된 것을 의미한다. 기본 모델은 참고용으로 굵게 표시되었다. 제출자: /u/nathandreamfast [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기