백도어링(Backdooring)을 이용한 희소 오토인코더(Sparse Autoencoders)
요약
본 연구는 희소 오토인코더(SAEs)가 언어 모델의 공급망 공격 표면을 형성할 수 있음을 보여줍니다. 악성 수정된 SAE를 LLM의 순전파 과정에 삽입하여, 공격자가 원하는 행동을 유도하는 백도어를 구현했습니다. 이는 기존 모델 자체를 건드리지 않고도 행동적 취약점을 만들 수 있어 보안상 심각한 위협이 될 수 있습니다.
핵심 포인트
- SAEs는 LLM의 공급망 공격 표면을 형성할 수 있다.
- 수정된 SAE 삽입은 원본 모델 변경 없이 백도어 기능을 구현한다.
- 코드 생성 사례에서 높은 비율의 원치 않는 코드 삽입을 시연했다.
- SAE가 보안 민감 구성 요소로 취급되어야 함을 시사한다.
희소 오토인코더(SAEs)는 언어 모델(language models)을 해석하는 데 사용될 뿐만 아니라, 내부 표현에 개입하기 위해서도 점점 더 많이 활용되고 있습니다. 우리는 이것이 공급망 공격 표면(supply-chain attack surface)을 만든다는 것을 보여줍니다. 악의적으로 수정된 SAE가 원래 변경되지 않은 언어 모델의 순전파 과정(forward pass)에 삽입될 때, 공격자가 선택한 행동을 유도할 수 있습니다. 우리는 기본 LLM과 SAE 인코더를 모두 고정하고, 공격을 단일 보조 구성 요소와 단일 삽입 계층으로 제한하는 디코더 전용 SAE 백도어(backdoor)를 소개합니다. 코드 생성을 사례 연구로 사용하여, 세 가지 언어 모델과 광범위한 삽입 계층에 걸쳐 높은 비율의 원치 않는 코드 삽입을 시연했으며, 프롬프트 단서(prompt cue)에 조건화된 트리거 의존적 행동도 보여주었습니다. 우리는 HumanEval 및 선택된 SAEBench 메트릭을 사용하여 수정된 SAE를 추가로 평가했습니다. 공격 효과는 모델과 계층에 따라 다르지만, 강력한 백도어 행동이 여러 기존 SAE 품질 측정에서 비교적 작은 변화와 공존할 수 있습니다. 이러한 결과는 SAE가 언어 모델 자체를 수정하지 않고도 행동적 백도어를 운반할 수 있음을 확립하며, 따라서 보안 민감 구성 요소로 취급되어야 함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기