LKValues: 대규모 언어 모델(LLMs)을 스리랑카 사회적 가치에 정렬하기
요약
LLM의 서구 중심적 가치 편향을 해결하기 위해 스리랑카의 사회적 가치를 반영한 LKValues 리소스를 제안합니다. 40개의 사회적 가치를 도출하고, 이를 바탕으로 지시어 코퍼스(LKvaluesIT)와 평가 벤치마크(LKvaluesBench)를 구축했습니다.
핵심 포인트
- 스리랑카의 문화적 맥락을 반영한 최초의 가치 정렬 리소스 제안
- 40개의 사회적 가치를 포함한 15만 개의 지시어 코퍼스 구축
- Qwen 및 Aya-Expanse 모델 미세 조정을 통한 성능 개선 확인
- 저자원 언어 및 국가별 특화된 가치 정렬 파이프라인 제공
대규모 언어 모델 (LLMs)의 가치 정렬 (Value alignment)은 서구적 규범에 문화적으로 편향되어 있음이 밝혀졌습니다. 이는 스리랑카와 같이 고유한 문화적 역동성을 가진 다언어 사회에서 현지 가치를 잘못 다루는 결과로 이어집니다. 기존의 벤치마크 (benchmarks)들은 공식 언어인 싱할라어 (Sinhala)로 된 스리랑카 맥락의 가치들을 간과하고 있으며, 이는 문화적으로 민감한 평가 및 미세 조정 (fine-tuning)을 저해합니다. 이러한 격차를 해소하기 위해, 우리는 스리랑카 가치 정렬을 위한 최초의 설문 조사 기반 리소스 제품군인 LKValues를 제안합니다. 조정된 글로벌 프레임워크와 LLM이 유도한 현지 구성 요소를 결합하여 205명의 응답자를 대상으로 실시한 3개 국어 설문 조사를 통해, 우리는 다수가 지지하는 40개의 사회적 가치를 도출했습니다. 이 가치들을 사용하여, 우리는 15만 개의 시나리오 기반 인스턴스를 포함하는 싱할라어-영어 뉴스 유래 지시어 코퍼스 (instruction corpus)인 LKvaluesIT와 1,000개의 인스턴스로 구성된 가치 민감형 평가 벤치마크인 LKvaluesBench를 구축했습니다. 우리는 LKvaluesBench를 사용하여 일련의 폐쇄형 (proprietary) 및 오픈 웨이트 (open-weight) LLM들을 평가합니다. 우리는 세 가지 오픈 웨이트 베이스 모델 (Qwen3.5-4B-Base, Qwen3.5-9B-Base, 그리고 Aya-Expanse-8B-Base)을 미세 조정합니다. 우리의 실험 결과는 최신 및 더 큰 규모의 LLM들이 여전히 저자원 (low-resource) 및 문화적 가치 정렬 격차를 보인다는 것을 보여줍니다. LKValues 미세 조정은 영어와 싱할라어에서 Qwen 제품군 모델들을 개선하여, 무효한 출력과 교차 언어적 격차를 줄여주지만, 그 이득은 모델 제품군에 따라 달라집니다. 이는 스리랑카 가치를 내재화하는 데 있어 LKValues의 효능을 강조하며, 저자원 및 국가별 특화된 다원주의 가치 정렬을 위한 복제 가능한 파이프라인을 제공합니다. 데이터셋은 https://github.com/NextME14/LKValues 에서 공개적으로 사용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기