Caliber: 점수 반환 API를 위한 교차 아키텍처 추출 비용 제어 기술
요약
모델 추출 공격을 방어하기 위해 출력 섭동을 활용하는 Caliber 기술을 제안합니다. 가우시안 노이즈를 추가하여 대리 모델 학습을 방해하면서도, 깨끗한 로짓을 복구하는 데 필요한 쿼리 비용을 이론적으로 분석하고 제어합니다.
핵심 포인트
- 모델 추출 방어를 위한 출력 섭동 기법 Caliber 제안
- 가우시안 노이즈를 통한 지식 증류 공격 차단
- 노이즈 스케일에 따른 예측 일치성 저하 특성 규명
- 깨끗한 로짓 복구에 필요한 입력당 쿼리 비용 하한 도출
- 다양한 모델-데이터셋 조합에서 높은 캘리브레이션 정확도 입증
우리는 노이즈 선택을 캘리브레이션 (calibration) 문제로 공식화하여 모델 추출 (model extraction)에 대응하는 출력 섭동 (output-perturbation) 방어 기법인 Caliber를 제시합니다. 이 문제는 방어 기법이 대리 모델 (surrogate) 학습에 사용되는 지도 신호 (supervision signal)를 얼마나 저하시키는지, 그리고 깨끗한 로짓 (clean logits)을 복구하는 데 드는 입력당 증명 가능한 쿼리 비용 (query cost)이 얼마인지에 관한 것입니다. 반환된 점수를 지식 증류 (knowledge distillation)에 사용하는 공격자를 방어하기 위해, Caliber는 내부 로짓에 독립적이고 동일한 분포를 가진 가우시안 노이즈 (Gaussian noise)를 추가합니다. 우리는 결과적으로 발생하는 섭동된 예측 (perturbed predictions)에 대해 두 가지 속성을 확립했습니다. 단조적 일치성 저하 (Monotone agreement degradation): 깨끗한 로짓이 유일한 최대값 (maximizer)을 가질 때, 깨끗한 예측과의 일치성은 노이즈 스케일 (noise scale)에 따라 엄격하게 감소하므로, $(1/K, 1)$ 사이의 모든 타겟은 고유한 양의 스케일에 대응합니다. 작업 정확도 (task accuracy)는 계산 가능한 하한 및 상한 포락선 (envelopes)에 의해 제한됩니다. 입력당 복구 비용 (Per-input recovery cost): 우리는 고정된 입력에 대해 깨끗한 로짓을 복구하는 데 필요한 반복 쿼리에 대한 폐쇄형 미니맥스 하한 (closed-form minimax lower bound)을 도출합니다. Caliber는 노이즈 분산 (noise variance)을 상위 2개 로짓 마진 (top-two logit margin)의 제곱 중앙값으로 정규화하며, 결과적인 노이즈-유용성 (noise-utility) 관계를 모델별로 또는 작업 내에서 공유되는 로지스틱 곡선 (logistic curve)으로 피팅합니다. 30개 이상의 모델-데이터셋 조합에 대해, 모델별 캘리브레이션은 0.6-1.4%의 평균 절대 상대 오차 (mean absolute relative errors)를 달성했습니다. 엔드 투 엔드 (End-to-end) 실험 결과, 대리 모델의 성능은 일반적으로 설정된 저하 수준을 따르며, 고정 입력 평균화 (fixed-input averaging)는 예상된 분산 감소를 따르는 것으로 나타났습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기