LLM의 지역적 편향 평가: 추상적 고정관념에서 구체적 사회적 의사결정까지
요약
LLM의 지역적 편향을 추상적 고정관념부터 구체적 사회적 의사결정까지 체계적으로 평가하는 S2D 프레임워크를 제안합니다. 중국의 34개 행정 구역을 대상으로 6개 모델을 분석한 결과, 지역적 편향이 경제 및 디지털 발전 지표와 연관되어 체계적으로 나타남을 확인했습니다.
핵심 포인트
- S2D 프레임워크를 통한 LLM의 지역적 편향 체계적 평가
- 고정관념(따뜻함, 유능함)과 사회적 의사결정 간의 상관관계 규명
- 지역적 편향이 경제 및 디지털 발전 지표와 밀접하게 연관됨을 발견
- 중국어와 영어 프롬프트 전반에서 안정적으로 나타나는 편향 패턴 확인
대규모 언어 모델 (LLMs)의 지역적 편향 (Regional bias)은 지역 집단에 대한 인식과 서로 다른 지역 출신 개인에 대한 의사결정 모두에 영향을 미칠 수 있습니다. 그러나 기존 연구들은 이러한 현상들을 종종 별개로 조사하여, 그 구조와 결과가 불분명한 상태로 남겨두고 있습니다. 우리는 추상적인 고정관념 (Stereotypes)에서부터 구체적인 사회적 의사결정 (Social decisions)에 이르기까지 지역적 편향을 평가하는 체계적인 프레임워크인 Stereotypes-to-Decisions (S2D)를 소개합니다. 중국의 34개 성급 행정 구역 전체를 포괄하는 S2D는 따뜻함 (Warmth, 인지된 친밀도 및 신뢰성)과 유능함 (Competence, 인지된 능력 및 지능)에 대한 고정관념 평점과 더불어 교육 (Education), 직업 (Occupation), 사회적 상호작용 (Social Interaction)에 걸친 쌍 선택 과업 (Paired-choice tasks)을 사용하여 6개의 LLMs를 평가합니다. 결과에 따르면 지역 점수에서 상당한 지역적 차이가 나타났으며, 특히 유능함 (Competence)과 직업 (Occupation) 결정에 있어 모델 간 상당한 일치성을 보였습니다. 나아가, 이러한 패턴은 지역의 경제 및 디지털 발전 지표와 연관되어 있으며, 특정 지역이 한 차원에서는 높게 평가되지만 다른 차원에서는 낮게 평가되는 등 인간과 유사한 혼합된 고정관념을 보여줍니다. 또한 이러한 패턴은 중국어와 영어 프롬프트 전반에 걸쳐 대체로 안정적으로 유지됩니다. 종합적으로, 우리의 연구 결과는 LLM의 지역적 편향이 만연하고 체계적이며 중대한 결과를 초래한다는 것을 보여주며, 지역적 인식을 반영한 평가 및 완화 조치의 필요성을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기