그래디언트 면역성 (Gradient Immunity): 악의적인 미세 조정에 대한 영공간 저항성 (Null-Space Resistance)
요약
악의적인 미세 조정을 통한 LLM의 안전성 파괴를 방어하기 위한 '그래디언트 면역성' 연구를 소개합니다. 영공간 큐빅 레이어와 역 어댑터를 활용한 단방향 안전 게이트(USG)를 통해 모델의 유용성을 유지하면서도 유해한 그래디언트 전파를 효과적으로 차단합니다.
핵심 포인트
- 악의적인 미세 조정에 저항하는 영공간 저항성(Null-Space Resistance) 제안
- 단방향 안전 게이트(USG)를 통한 유해 샘플의 그래디언트 억제
- 모델의 순방향 동작을 복원하는 역 어댑터 기술 적용
- 공격 성공률을 낮추면서도 높은 안전 통과율과 유용성 유지
배포된 정렬된 대규모 언어 모델 (LLM)은 여전히 악의적인 다운스트림 미세 조정 (Fine-tuning)에 취약합니다. 기존의 방어 기제는 주로 서비스형 미세 조정 (FTaaS) 패러다임을 위해 설계되었거나 다운스트림 사용자가 추가적인 안전 절차를 따를 것에 의존합니다. 따라서 본 연구에서 다루는 설정, 즉 대부분의 가중치는 학습 가능한 상태로 유지되면서 소수의 안전에 중요한 구성 요소만 배포 시점에 보존되는 '공급자가 제어하는 부분 보호 오픈 웨이트 (PPOW)' 배포 설정 문제를 직접적으로 해결하지 못합니다.
우리는 최종 Transformer 레이어 뒤에 삽입되는 역 어댑터 (Inverse Adapter)와 함께 영공간 큐빅 레이어 (Null Space Cubic Layer)로 구현되는 단방향 안전 게이트 (Unidirectional Safety Gate, USG)를 제안합니다. 다운스트림 미세 조정 과정에서, 큐빅 레이어는 은닉 상태 (Hidden states)가 보정된 보호 영역 내에 떨어지는 유해한 샘플로부터 발생하는 그래디언트 (Gradients)를 억제하거나 차단하며, 역 어댑터는 베이스 모델의 순방향 동작 (Forward behavior)을 복원합니다. 실제로 우리는 방어자가 보유한 유해 데이터를 사용하여 임계값 (Threshold)을 보정하며, 이를 통해 보호 기능이 인-디스트리뷰션 (In-distribution) 근처의 유해 샘플로 일반화될 수 있도록 합니다.
6가지 모델-데이터셋 설정에 걸쳐 평가한 결과, USG는 고정된 배포 임계값 하에서 미세 조정 후의 공격 성공률 (Attack success rate)을 배포 전 수준에 가깝게 유지했습니다. 동시에 쉬운 설정에서는 높은 안전 통과율 (Safe-pass rates)을 유지했으며, BeaverTails의 유해 샘플에 대해서는 더 명확한 안전-유용성 트레이드오프 (Safety-utility trade-off)를 보여주었습니다. 이러한 결과는 배포 시점의 표현 공간 차단 (Representation-space blocking)이 다운스트림의 협조를 요구하지 않고도 악의적인 다운스트림 적응 (Downstream adaptation) 비용을 높일 수 있음을 시사합니다. 코드는 https://github.com/OpenCausaLab/Gradient-Immunity 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기