탈옥 공격이 안전 정렬(Safety Alignment)에 주는 시사점: 탈옥 기여도에 대한 방어자 중심의 Shapley 기반 평가
요약
LLM 탈옥 공격을 공격자 중심의 성공률이 아닌, 모델의 안전성 개선에 기여하는 방어자 중심 관점에서 평가하는 새로운 프레임워크 A-MESS를 제안합니다. Shapley 기반의 AttackSHAP 점수를 통해 공격의 유용성을 측정하고 최적의 공격 부분 집합을 선택하는 방법을 다룹니다.
핵심 포인트
- 공격 성공률(ASR) 중심에서 방어자 중심의 안전성 개선 관점으로 평가 전환
- Shapley 기반의 AttackSHAP을 통한 개별 공격의 한계 효용 할당
- A-MESS 프레임워크를 통한 효율적인 레드팀 데이터(공격 부분 집합) 선택
- 탈옥 공격을 모델 안전성 개선을 위한 유용한 자원으로 재정의
대규모 언어 모델(Large Language Models, LLMs)에 대한 탈옥(Jailbreak) 공격은 대개 공격 성공률(Attack Success Rate, ASR)과 같은 공격자 중심(Attacker-centric) 지표로 평가되지만, 모델을 무너뜨리는 공격이 반드시 모델의 안전성을 개선하는 데 유용한 것은 아닙니다. 우리는 탈옥 공격이 안전 학습(Safety Training)을 위한 레드팀(Red-teaming) 데이터로 사용될 때, 해당 공격이 가능하게 하는 하위 단계의 안전성 개선 정도에 따라 공격을 평가하는 방어자 중심(Defender-centric)의 탈옥 평가 관점을 제안합니다. 이러한 관점을 바탕으로, 우리는 블랙박스 부분 집합 유용성 관찰(Black-box subset utility observations)로부터 탈옥 공격의 기여도를 할당하고 선택할 수 있는 설정 불가지론적(Setting-agnostic) 프레임워크인 A-MESS(Minimal Effective Attack-Subset Selection)를 소개합니다. A-MESS는 개별 공격에 한계 효용(Marginal utility)을 할당하는 Shapley 기반 점수인 AttackSHAP을 추정하며, 탐욕적(Greedy) 또는 대리 모델 기반(Surrogate-based) 최적화를 통해 사용자가 지정한 예산 내에서 압축된 공격 부분 집합을 선택합니다. 통제된 유용성 지형(Utility landscapes)과 실제 LLM 안전 설정 전반에 걸쳐 실험한 결과, ASR 순위는 방어자 중심의 유용성과 약하게 정렬되어 있으며, AttackSHAP은 제한된 유용성 쿼리로도 정확하게 추정될 수 있고, 부분 집합을 직접 최적화하는 것이 공격자 중심 또는 기여도 할당 전용 선택 방식보다 더 강력한 안전 유용성을 제공한다는 것을 발견했습니다. 이러한 결과는 탈옥 공격을 단순히 모델을 파괴하는 도구가 아니라, 안전성을 개선하기 위한 자원으로 평가해야 함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기