KyrgyzLLM-Bench: 키르기스어 언어 이해 벤치마킹
요약
키르기스어와 같은 저자원 언어의 LLM 평가를 위해 설계된 KyrgyzLLM-Bench 벤치마크를 소개합니다. 현지 작성 데이터와 정교하게 번역된 데이터셋을 통해 26개 모델의 성능과 교차 언어 전이 능력을 체계적으로 분석했습니다.
핵심 포인트
- 키르기스어 특화 벤치마크인 KyrgyzLLM-Bench 개발
- 26개 오픈 소스 및 폐쇄형 LLM의 성능 비교 분석
- 언어 간 성능 격차 및 번역 아티팩트의 영향 확인
- 데이터셋, 평가 코드 및 모델별 결과 공개
다양한 언어에 걸쳐 거대 언어 모델 (LLMs)을 평가하는 것은 여전히 어려운 과제로 남아 있습니다. 대부분의 다국어 벤치마크 (benchmarks)가 번역된 영어 데이터셋에 의존하기 때문에, 대상 언어의 언어적 및 문화적 특수성이 가려지는 경우가 많기 때문입니다. 이러한 문제는 키르기스어 (Kyrgyz)와 같이 자원이 부족한 언어에서 특히 두드러지며, 신뢰할 수 있는 현지 작성 평가 데이터가 부족한 실정입니다. 이전에 소개된 키르기스어 평가 데이터셋을 바탕으로, 본 연구는 KyrgyzLLM-Bench 벤치마크 제품군을 사용하여 키르기스어 환경에서 LLM을 체계적이고 대규모로 평가한 첫 사례를 보고합니다. KyrgyzLLM-Bench는 현지에서 작성된 두 가지 데이터셋인 KyrgyzMMLU와 KyrgyzRC를 비롯하여, WinoGrande, HellaSwag, BoolQ, TruthfulQA를 정교하게 번역하고 수동으로 사후 편집한 버전들로 구성됩니다. 우리는 제로샷 (zero-shot) 및 퓨샷 (few-shot) 설정 하에서 26개의 오픈 소스 및 폐쇄형(closed-source) LLM을 평가하며, 모델 성능, 교차 언어 전이 (cross-lingual transfer), 그리고 번역 아티팩트 (translation artifacts)가 평가 신뢰성에 미치는 영향을 분석합니다. 다양한 모델군과 작업에 걸쳐, WinoGrande와 BoolQ에서는 모델 순위가 영어에서 키르기스어로 폭넓게 전이되는 반면, MMLU에서는 그 정도가 덜하며, HellaSwag는 번역으로 인한 개연성 변화 (plausibility shifts)와 일치하는 상당한 영어-키르기스어 성능 격차를 보여줍니다. 퓨샷 프롬프팅 (few-shot prompting)은 독해 작업에서 여러 오픈 소스 모델의 성능을 향상시키지만, 번역된 작업에 대해서는 폐쇄형 모델(proprietary models)에서 일관되지 않은 동작을 보입니다. 우리는 모든 데이터셋, 평가 코드, 모델별 결과를 공개적으로 배포하며, 향후 키르기스어 자연어 처리 (NLP) 연구를 지원하기 위해 키르기스어 작업들을 널리 사용되는 다국어 평가 프레임워크에 통합합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기