Fairness Pruning: 차등 활성화(Differential Activations)를 통한 GLU-MLP 레이어 내 인구통계학적 편향
요약
LLM 내 인구통계학적 편향을 완화하기 위한 경량 구조적 개입 방법인 Fairness Pruning을 제안합니다. GLU-MLP 레이어 내에서 특정 속성에 차등 반응하는 뉴런을 식별하고 제로화하여 편향을 조절하는 연구입니다.
핵심 포인트
- 차등 활성화를 통해 편향을 유발하는 특정 뉴런을 정밀하게 식별
- Llama-3.2 모델 대상 실험 결과, 극소수의 뉴런 제로화로 편향 조절 가능
- 모델의 일반 지식 성능을 99% 이상 유지하며 편향 회로 분리 확인
- 단순 제로화가 아닌 방향성 있는 행동 조절을 위한 방법론적 토대 마련
본 연구는 대규모 언어 모델(LLMs) 내의 인구통계학적 편향(demographic bias)을 관리하고 향후 완화하기 위해 설계된 경량 구조적 개입 방법인 Fairness Pruning을 제시합니다. 이 방법의 기초적인 실증적 검증으로서, 본 연구는 인과적 편향 위치 파악(causal bias localization)에 집중합니다. 최소한의 대조적 프롬프트 쌍(minimally contrastive prompt pairs)과 추론 시점의 활성화 캡처(inference-time activation capture)를 사용하여, 이 방법은 GLU 아키텍처에서 인구통계학적 속성을 처리할 때 차등적으로 반응하는 뉴런을 식별하며, down_proj 입력에서의 신호를 평가합니다. 실증적 평가는 표준화된 벤치마크 평가와 질적 텍스트 생성 실험을 결합하여 최대 30억 개의 파라미터를 가진 모델(Llama-3.2 제품군 및 Salamandra-2B)을 대상으로 수행되었습니다. 결과에 따르면, 식별된 뉴런을 제로화(zeroing)하면 모델이 관련 인구통계학적 변수에 반응하는 방식이 변화함을 보여줍니다. 그러나 평탄한 완화(flat mitigation)를 생성하기보다는, 이 개입은 양방향 편향 불안정화(bidirectional bias destabilization)를 유발합니다. BiasScore는 부호가 없기(unsigned) 때문에, 후보 세트에는 고정관념을 강화하거나 반하는 뉴런이 섞여 있으며, 총체적 편향에 미치는 순 효과는 어떤 부호가 지배적인지에 따라 달라집니다. 이 개입은 매우 정밀합니다(extremely surgical). Llama-3.2-1B에서 대부분 40개 미만의 뉴런을 제로화했을 때(전체 MLP 너비의 0.031% 미만), 추론 및 일반 지식 능력에서 평균 99.49%의 유지율을 달성했습니다. 이러한 발견은 인구통계학적 편향 처리와 모델 능력이 분리 가능한 회로(dissociable circuits)에서 작동함을 실증적으로 확인하며, 맹목적인 제로화(blind zeroing)에서 방향성 있는 행동 조절(directional behavior modulation)로 전환하기 위한 방법론적 토대를 구축합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기