가중치 수정 없이 LLM을 비검열화하는 방법: 작은 학습된 KV 캐시 뱅크(~18MB)를 주입하고 필요할 때 언로드
요약
phantom-kv는 LLM의 가중치를 수정하지 않고도 거부(refusal) 시스템을 우회하는 새로운 방법을 제시합니다. 이는 작은 학습된 KV 캐시 뱅크를 컨텍스트로 주입하여 모델이 이를 기존 대화 기록처럼 인식하게 만듭니다. 이 방식은 요청별로 기능을 교체할 수 있어, 영구적인 체크포인트 편집이나 복잡한 엔진 후킹 없이도 '비검열화'가 가능합니다.
핵심 포인트
- 가중치 수정 없이 LLM 거부 시스템 우회 (phantom-kv)
- 작은 학습된 KV 캐시 뱅크를 컨텍스트로 주입
- 요청별 교체가 가능한 기능 모드 구현
- 기존 접근 방식(Weight/Activation space)의 한계 극복
지난 몇 주 동안 개발해 온 결과물을 공개합니다: phantom-kv. 이는 대규모 언어 모델(LLM)의 거부(refusal) 제거 시스템으로, 단 하나의 가중치도 건드리지 않습니다. 모델을 편집하는 대신, 작은 학습된 키/값 텐서(key/value tensors) 뱅크를 컨텍스트로 모델의 KV 캐시에 로드합니다. 어텐션 메커니즘은 이를 이미 존재하는 대화 기록처럼 읽습니다. https://github.com/lordx64/phantom-kv/ https://reddit.com/link/1wms904/video/7efg1le3eyqh1/player 그 결과, '비검열화(uncensoring)'가 영구적인 체크포인트 편집이 아니라 요청별로 교체 가능한 기능 모드가 됩니다: 캐시를 언로드하면 기본 모델은 다시 바이트 단위로 동일해집니다. 거부 제거에 대한 이전의 모든 접근 방식은 어딘가에 영구적으로 기록을 남겼습니다. 가중치 공간에서의 소거(Weight-space abliteration)는 체크포인트를 재작성하며, 이를 되돌리려면 가중치를 다시 플래싱해야 하고 양자화(quantization)별로 깨집니다. 활성화 공간의 투영(Activation-space projection)은 런타임에 토큰별, 레이어별로 거부 방향을 빼내는데, 이는 엔진 후크(engine hook) 내부에서 모델의 신호 경로 자체를 부팅 시 패치합니다. phantom-kv는 이 둘 중 어느 것도 하지 않습니다: 이는 모델의 고유한 목표(유해한 프롬프트에는 순응하고, 무해한 프롬프트에서는 행동을 유지하는 것)에 대해 오프라인으로 학습되었으며, 새로운 체크포인트 대신 메가바이트 단위의 캐시 콘텐츠로 배포되고, 이미 입력 채널 어텐션이 소비하는 경로를 통해서만 모델에 영향을 미칩니다. 1차원 거부 방향 가정도 없고, 포워딩 패스 후크(forwarding-pass hooks)도 없으며, 새로운 아키텍처를 위한 장치별 재구축(per-arm rebuilds)도 없습니다. '파란 알약', 즉 인시던트 대응자 모드: API 해싱 뒤에 임포트를 숨긴 악성코드 샘플을 언팩하도록 요청하자, 기본 모델은 역공학(reverse engineering)처럼 들리는 모든 것에 거부하는 전형적인
레드 필(red pill): 사이버 선택성, 도메인별: 방어적인 블루 필은 방어 전용 모드를 거부하며 오프-도메인 가드레일을 유지합니다. 레드 필에서는 동일한 세션이 단계별 페이로드 설명을 제공합니다. 하나의 모델에 세 가지 기능 모드가 있습니다. 분석가를 위한 방어 팀 모드와 승인된 운영자를 위한 공격 팀 모드 모두는 별도의 체크포인트가 아닌 129개의 캐시 슬롯 간격으로 배포되는 동일한 가드레일이 적용된 가중치와 함께 제공됩니다. 또한 저희 스스로를 감사했습니다: 8B 규모의 심사 모델 감사는 어휘적 거부-억제 지표가 규정 준수(semantic refusal는 종종 재구성을 통해 지속됨)를 과대 주장하며, 이 영향은 장기 세션에서 약 2~4k 토큰 반감기를 가지며 (측정된 재주입 간격이 이를 완화함), 답변에는 법적/윤리적 프레이밍 언어가 포함되는데 이는 해당 영향의 역할이 모델의 전문 분야가 시작되는 지점에서 끝나기 때문입니다. 출처: https://x.com/lordx64/status/2102138825292276168?s=20 /u/Anony6666 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기