LLM 안전성을 위한 온폴리시 증류(On-Policy Distillation): 템플릿 강건한 재정렬을 위한 라우팅 접근 방식
요약
LLM 미세 조정 시 발생하는 유해 데이터 주입 문제를 해결하기 위해, 프롬프트 템플릿 변화에 강건한 '라우팅 기반 온폴리시 증류(ROPD)' 프레임워크를 제안합니다. 기존 방식의 한계인 성능 저하와 재-탈옥 취약성을 극복하고 모델의 전문 기술을 보존하며 안전성을 강화합니다.
핵심 포인트
- 기존 안전 재정렬 방식의 파괴적 망각 및 템플릿 취약성 문제 지적
- 출력 확률 분포의 발산을 모델링하는 ROPD 프레임워크 제안
- 템플릿 불일치 상황에서도 모델 성능과 방어 효과를 동시에 유지
- 기존 SOTA 베이스라인 대비 우수한 강건성 입증
미세 조정 (Fine-tuning)은 거대 언어 모델 (LLMs)을 전문화하기 위한 지배적인 패러다임이지만, 이는 치명적인 취약점을 노출합니다. 즉, 악의적인 데이터 제공자가 다운스트림 코퍼스 (corpora)에 유해한 행동을 심어 놓을 수 있으며, 이로 인해 모델이 전문적인 기술은 유지하면서도 요구에 따라 인간의 가치를 위반하게 만들 수 있습니다. 기존의 안전 재정렬 (safety-realignment) 방어 기제는 세 가지 주요 한계로 인해 실제 환경에서 실패하는 경우가 많습니다. 첫째, 전문화된 기술의 파괴적 망각 (catastrophic forgetting)을 빈번하게 유발합니다. 둘째, 방어자가 공격자의 프롬프트 템플릿 (prompt template)을 관찰할 수 없을 때 효과가 무너집니다. 셋째, 성공적으로 재정렬된 모델이라도 단순한 시스템 프롬프트 전환을 통한 재-탈옥 (re-jailbreaking)에 취약한 상태로 남습니다.
이러한 과제를 해결하기 위해, 우리는 특정 프롬프트 템플릿에 맞추는 대신 정렬된 출력 확률 분포와 침해된 출력 확률 분포 사이의 발산 (divergence)을 모델링하는 새로운 재정렬 프레임워크인 라우팅 기반 온폴리시 증류 (Routing-based On-Policy Distillation, ROPD)를 제안합니다. 우리는 세 가지 데이터셋과 다양한 정렬 강도를 가진 세 가지 베이스 모델을 대상으로 ROPD를 네 가지 최첨단 (state-of-the-art) 베이스라인과 비교하는 광범위한 실험을 수행했습니다. 실험 결과, 베이스라인 방어 기제들이 템플릿 불일치 (template mismatch)에 직면할 때, 종종 다운스트림 작업 성능의 심각한 저하를 동반하며 실패함을 확인했습니다. 반면, ROPD는 템플릿 불일치 위험을 실질적으로 완화하며, 방어 효과와 능력 보존 측면 모두에서 우수한 강건성 (robustness)을 유지합니다. 우리의 분석에 따르면 ROPD가 템플릿 변화에 완전히 면역된 것은 아니지만, 기존 방법들과 비교했을 때 성능 저하가 무시할 수 있는 수준이며, 이를 통해 강건한 LLM 재정렬의 새로운 표준을 제시합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기