Qwen3.6-35B-A3B에서 CCP 정렬을 제거했습니다: 검열/선전 답변 89.8% → 2.8%, 일반 벤치마크는 약 1점 내
요약
Hirundo 연구팀은 Qwen3.6 모델의 정치적 정렬(CCP alignment)을 제거한 'Westernized' 버전을 공개했습니다. 이들은 머신 언러닝 기법을 사용하여 검열 및 선전 답변 비율을 89.8%에서 2.8%로 크게 낮추는 데 성공했다고 주장합니다. 일반적인 역량 벤치마크에서는 큰 변화가 없었으며, 특정 정치적 질문에 대해 중립적인 입장을 취하도록 수정되었습니다.
핵심 포인트
- Qwen3.6의 CCP 정렬을 제거한 Westernized 모델 공개
- 검열/선전 답변 비율이 89.8%에서 2.8%로 대폭 감소
- 머신 언러닝(machine unlearning) 기반 행동-비학습 방법론 사용
- 일반 역량 벤치마크 성능 저하가 미미하여 모델의 범용성 유지
공개 고지: 저는 이 모델을 만든 Hirundo의 연구원입니다. 무엇이든 기꺼이 답변하겠습니다. Qwen은 CCP의 정치적 정렬(political alignment)이 학습되어 출시되었습니다. Qwen3.6에게 1989년 6월 4일에 무슨 일이 있었는지 물어보면 '무엇을 말씀하시는지 모르겠습니다'라고 답합니다. 시스템 프롬프트만으로는 이것을 확실히 고칠 수 없는데, 그 행동이 가중치(weights) 안에 존재하기 때문입니다. 저희는 머신 언러닝(machine unlearning)을 통해 이를 제거하고 결과를 공개합니다: Qwen3.6-35B-A3B-Westernized: huggingface.co/hirundo-io/Qwen3.6-35B-A3B-Westernized, Qwen3.5-4B-Westernized: huggingface.co/hirundo-io/Qwen3.5-4B-Westernized 기술 보고서: hirundo.io/blog/westernizing-qwen 결과 (Qwen3.6-35B-A3B, 플래그 지정된 응답 비율, 낮을수록 좋음) 벤치마크 | 원본 | 저희 모델 CCPC-500 (저희가 만든: 15개 주제에 걸친 검열, 선전 프레이밍, 편향성) | 89.8% | 2.8% DECCP 거부(외부) | 65.26% | 3.16% ChinaBench 비준수(외부) | 96.67% | 6.67% 일반 역량 (GPQA, IFBench, LiveCodeBench, MMLU-Pro): 평균 변화 0.72점, 최대 1.83점. 4B 모델은 사고 기능(thinking off)을 끌 때 CCPC-500에서 89.2%에서 1.2%로, 사고 기능을 켤 때(thinking on)는 82.0%에서 6.8%로 떨어집니다. 비교를 위해, Snowdon1.1-Small (Thomson Reuters / Imperial College가 동일한 기반을 재정렬한 것)은 여전히 CCPC-500에서 30.0% 점수를 기록합니다. 이는 다른 이데올로기를 대체하는 것이 아닙니다. 대만 독립을 지지하는지에 대해 물었을 때, 원본 모델은 베이징의 입장을 인용합니다. 저희 모델은 중국 공산당(PRC), 대만, 미국 세 가지 입장을 제시하고 어느 한쪽 편을 들지 않겠다고 거절합니다. Abliteration과 어떻게 다른가? Abliteration은 모델 활성화(activations)에서 단일 '거부 방향'을 찾아내어 가중치 밖으로 투영함으로써, 모델이 거의 모든 것을 거부하는 능력을 상실하게 만듭니다. 이는 두 가지 이유로 여기서는 잘못된 도구입니다. 첫째, Qwen의 CCP 정렬 중 대부분은 아예 거부가 아닙니다: 대만이나 신장 위구르 자치구에 대해 물어보면, 베이징의 프레이밍으로 기꺼이 답변합니다. 제거할 거부가 없으므로, abliteration은 선전을 그대로 남겨둡니다. 둘째, 저희는 한 가지 행동만을 바꾸고 다른 것은 아무것도 바꾸고 싶지 않습니다.
저희의 방법론은 세 단계로 이루어져 있습니다: 기본 모델을 정치적 프롬프트에 실행하여 목표 행동(검열, 선전적 틀지음 또는 편향)을 보이는 응답을 보존합니다; 이러한 예시들을 사용하여 저희의 행동-비학습(behavioral-unlearning) 목적 함수로 LoRA 어댑터를 훈련시키고, 해당 행동을 유발하지 않는 프롬프트의 유지 세트(retain set)가 나머지 모든 것을 고정합니다; 그런 다음 이 어댑터를 기본 가중치에 병합합니다. CCPC-500 결과는 동결된 별도 평가 세트에서 측정되었습니다. 네 가지 역량 벤치마크는 평균 0.72점만큼 이동했습니다. XSTest와 CyberSecEval 2에서는 유해한 준수(harmful compliance)가 기본 모델 수준과 같거나 그 이하를 유지했으며, OR-Bench에서는 약간 상승했습니다(약 650개 중 4개의 응답 vs 2개). 전체 수치는 보고서에 있습니다. 한계점으로는 솔직히 CCPC-500은 저희 자체 개발한 벤치마크라는 점입니다. 곧 HF(Hugging Face)에 공개할 계획이니 (그전에 테스트하고 싶으시면 저에게 직접 메시지 주세요); 그때까지는 DECCP와 ChinaBench가 독립적인 검증 수단입니다. 2.8%가 0%는 아닙니다. 여전히 일부 주제들은 새어 나옵니다. 검열을 제거한다고 해서 지식이 추가되는 것은 아닙니다. 특히 4B 모델은 때때로 자신감 있게 답변하면서 세부 사항을 잘못 알기도 합니다. 세부 사항에 대한 평가는 보고서에 있습니다. 가장 어려운 프롬프트를 던져보고 발견한 것, 특히 실패 사례들을 게시해 주세요. 그것이 저희가 얻을 수 있는 가장 유용한 피드백입니다. submitted by /u/firstcenturyman [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기