누락된 최소 쌍: LLM의 고정관념 평가
요약
본 논문은 LLM의 편향성 평가에 대한 기존 단일 쌍 비교 방식의 한계를 지적하며, 이를 개선하기 위해 '이중 최소 쌍(dual minimal pair)' 설정을 제안합니다. 이 프레임워크는 패러프레이즈와 대체 속성을 활용하여 데이터셋을 증강하고, 사회 집단과 고정관념 속성 간의 상호 정보량(MI) 기반의 새로운 평가 지표를 도입하여 편향성 측정의 견고성을 높입니다.
핵심 포인트
- 기존 단일 쌍 비교 방식은 신뢰하기 어려움.
- 견고한 평가를 위해 '이중 최소 쌍' 설정 제안.
- 패러프레이즈 및 대체 속성으로 데이터 증강 프레임워크 제시.
- MI 기반 지표로 편향성 강도를 더욱 견고하게 측정 가능.
대규모 언어 모델(LLMs)에서 편향성을 측정하는 일반적인 접근 방식은 두 가지 대조적 고정관념 문장의 로그 우도(log-likelihoods)를 비교하는 것입니다. 우리는 이러한 단일 쌍 비교가 종종 신뢰하기 어렵다고 주장합니다. 동일한 고정관념을 대체 속성으로 단순히 다시 작성해도 논리적으로 일관되지 않은 선호도를 얻을 수 있기 때문입니다. 이를 해결하기 위해, 우리는 견고한 고정관념 평가를 위해 두 가지 비교 축을 도입하는 이중 최소 쌍(dual minimal pair) 설정을 제안합니다. 첫째, 우리는 패러프레이즈와 대체 속성을 생성하여 기존의 고정관념 데이터셋의 중요한 격차를 메우는 데이터 증강 프레임워크를 제시합니다. 이 프레임워크를 영어, 러시아어, 스페인어, 중국어 고정관념 세트에 적용했습니다. 둘째, 우리는 이중 최소 쌍 설정에 맞춰진 두 가지 평가 지표를 도입합니다. 이 중 하나의 지표는 사회 집단과 고정관념 속성 간의 상호 정보량(Mutual Information, MI)을 모델링함으로써 편향성에 대한 새로운 관점을 제공합니다. 이 MI 기반 지표는 집계에 더 적합하며 다양한 언어와 모델 전반에 걸쳐 고정관념 강도를 더욱 견고하게 비교할 수 있게 합니다. 저희 코드는 https://github.com/stepanat/missing-minimal-pair/에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기