GPT 모델에서 발견된 유해성 세탁(Harm Laundering): 안전 훈련을 거치면서 성차별이 감소하기보다 변형됨에 대한 증거
요약
본 연구는 LLM의 안전 평가 방법론이 불완전하며, 명시적 차별 콘텐츠가 제거되기보다 변형되는 '유해성 세탁(harm laundering)' 현상을 발견했습니다. GPT-2부터 GPT-5까지 분석한 결과, 성폭력 클러스터가 사라지는 대신 남성 대상 출력에서 긍정적인 재현 영역을 얻는 등 유해성이 다른 형태로 변형됨을 보여줍니다.
핵심 포인트
- LLM의 안전 평가는 표면적 분류기에 의존하여 불완전합니다.
- 차별 콘텐츠는 제거되기보다 '유해성 세탁'되어 변형됩니다.
- GPT-4 이후 모델은 여성 대상 출력의 주제 다양성이 감소하는 경향을 보입니다.
- 독성 점수 하락이 유해성 감소를 의미하지 않으므로 새로운 탐지 프로토콜이 필요합니다.
대규모 언어 모델(LLM)의 안전 평가는 표면적 분류기(surface-form classifiers)에 의존하며, 이 분류기는 모델 세대를 거치며 유해성 점수가 하락하는 것을 보고합니다. 우리는 이러한 방법론이 체계적으로 불완전하다는 증거를 제시합니다: 명시적인 차별 콘텐츠가 제거되기보다는 변형됩니다. 우리는 이를 '유해성 세탁(harm laundering)'이라고 부릅니다. GPT-2부터 GPT-5까지의 15개 모델에 걸쳐 총 450,000개의 성별 지향 완료(gender-directed completions)를 분석한 결과, GPT-2에서 두드러지게 나타났던 여성 대상 출력에서의 성폭력 클러스터는 GPT-4에서는 사라지는 반면, 남성 대상 완료는 여성 대상 완료가 가지지 못하는 긍정적인 재현 영역(양육, 정서적 범위, 지지자 정체성)을 얻는 것을 보여줍니다. 이러한 패턴은 GPT-5에서 가장 명확하게 나타납니다: Topic5 (1,997개 문서)는 유방암을 남성의 권리 논쟁으로 구성하는 반면, 여성 대상 출력에서는 이에 상응하는 클러스터가 전혀 나타나지 않습니다. 세 개의 독립적인 분류기는 이 콘텐츠를 비독성(non-toxic)으로 점수 매깁니다. 감성 점수는 GPT-4에서 역전됩니다: 초기 모델은 여성을 폄하하고, 후기 모델은 과도하게 교정합니다. 여성 대상 완료의 주제 다양성은 GPT-2에서의 $0.91$에 비해 GPT-4 정렬 경계에서는 남성에 비해 36% 감소합니다 (W/M$= 0.58$). REGARD는 재현적 유해성 격차와 상관관계가 있으며 ($
ho= +0.55$, $p = .034$), Detoxify는 그렇지 않습니다 ($
ho= -0.23$, $p = .42$): 독성 점수는 재현적 유해성이 증가함에 따라 떨어집니다. 우리는 유해성 세탁을 세 가지 기준의 테스트로 공식화하고, 모든 생성 모델에 적용 가능한 3단계 탐지 프로토콜을 제공합니다. OpenAI GPT 계보 내에서 독성 점수 감소는 유해성 감소를 위한 충분한 대리 지표가 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기