MORFES: 현대 그리스어의 생산적 굴절 능력 측정을 위한 벤치마크
요약
현대 그리스어의 굴절 능력을 전문적으로 평가하기 위한 새로운 벤치마크인 MORFES를 소개합니다. 이 벤치마크는 다양한 오픈 웨이트 모델들의 형태론적 문법 능력을 측정하며, 연구팀이 개발한 Sophea-Genesis-1 모델이 해당 분야에서 뛰어난 성능을 보임을 입증했습니다.
핵심 포인트
- 그리스어 굴절 능력 평가를 위한 500개 항목의 MORFES 벤치마크 공개
- 저빈도 표제어를 활용하여 단순 암기가 아닌 규칙 기반 능력을 측정
- LLaMA, Qwen, DeepSeek-R1 등 다양한 오픈 웨이트 모델 평가
- Sophea-Genesis-1 모델이 굴절 형태론 부문에서 우수한 성능 기록
현대 그리스어는 풍부한 굴절 (inflection)을 가진 언어이지만, 이를 위해 구축된 언어 모델들은 주로 사실적 지식에 대해서만 평가되며, 모델의 굴절 능력 (inflectional competence)을 전담하여 평가하는 벤치마크는 없습니다. 우리는 그리스어 굴절 형태의 인식 (recognition)과 생성 (production)을 테스트하는 500개의 전문가 검증 항목으로 구성된 벤치마크인 MORFES (Morphological Open-class Recognition-and-Formation Evaluation Suite)를 소개합니다. 이 벤치마크는 정답이 암기된 형태가 아닌 규칙을 반영할 수 있도록 저빈도 표제어 (lemmas)를 선호하도록 설계되었습니다. 우리는 이를 https://huggingface.co/datasets/KIEFERSA/MORFES 에서 공개적으로 사용할 수 있도록 제공합니다. 우리는 LLaMA에서 Qwen3, DeepSeek-R1, Magistral, 그리고 Kimi K2에 이르기까지 빠르게 확장되는 오픈 웨이트 (open-weight) 생태계 내의 다양한 오픈 언어 모델들을 MORFES로 평가합니다. 이 생태계에서는 다국어 커버리지는 성장하고 있지만, 형태론적으로 풍부한 언어에서의 문법적 능력 (grammatical competence)은 여전히 충분히 측정되지 않고 있습니다. 이들 중 우리가 개발하여 https://huggingface.co/KIEFERSA/Sophea-Genesis-1 에 오픈 웨이트로 공개한 모델인 Sophea-Genesis-1은 일반적인 능력 면에서는 비슷한 크기의 모델들과 대등하면서도, 굴절 형태론 (inflectional morphology) 부문에서는 선두를 달리고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기