고대 그리스어에서 현대 그리스어로의 기계 번역: LLM 및 NMT 모델에 대한 새로운 벤치마크와 미세 조정 실험
요약
고대 그리스어에서 현대 그리스어로의 번역을 위한 새로운 병렬 코퍼스인 AG-MG를 소개하며, 데이터 부족 문제를 해결하기 위한 새로운 데이터 생성 파이프라인을 제시합니다. NMT 모델과 LLM을 대상으로 한 미세 조정 실험을 통해, Llama-Krikri-8B의 전체 파라미터 미세 조정이 가장 높은 성능을 기록함을 입증했습니다.
핵심 포인트
- 132,481개의 문장 정렬 쌍을 포함하는 새로운 AG-MG 병렬 코퍼스 구축
- VecAlign과 Gemini 2.5 Flash를 결합한 다단계 데이터 정제 및 정렬 파이프라인 도입
- NLLB, M2M100, Llama-Krikri-8B 모델을 활용한 다양한 미세 조정 전략 평가
- 미세 조정 시 기본 모델 대비 최대 +10.3 BLEU 포인트의 성능 향상 확인
- Llama-Krikri-8B의 전체 파라미터 미세 조정이 13.16 BLEU로 최고 성능 달성
고대 그리스어 (AG)에서 현대 그리스어 (MG)로의 기계 번역 (MT)은 대규모의 고품질 병렬 데이터 부족으로 인해 제약을 받는 저자원 (low-resource) 작업입니다. 우리는 문학, 역사 및 성서 텍스트에서 추출한 132,481개의 문장 정렬 쌍을 포함하는 새로운 리소스인 AG-MG 병렬 코퍼스를 도입함으로써 이 격차를 해결합니다. 우리는 웹 스크래핑된 발췌 수준의 데이터와 다단계 문장 수준 정렬 및 정제 프로세스를 결합한 새로운 코퍼스 생성 파이프라인을 제시합니다. 우리의 방법은 LaBSE 임베딩을 사용한 VecAlign을 활용하며, 먼저 수동으로 정렬된 AG-MG 하위 집합에서 이를 미세 조정(fine-tune)한 다음, 높은 정렬 품질을 보장하기 위해 Gemini 2.5 Flash를 사용한 LLM 기반 오류/미정렬 수정 단계를 거칩니다. 나아가, 우리는 NMT 모델 (NLLB, M2M100)과 그리스어 LLM (Llama-Krikri-8B) 전반에 걸쳐 세 가지 미세 조정 전략을 평가함으로써 이 작업에 대한 현대 MT 모델의 첫 번째 종합적인 벤치마크를 제공합니다. 우리의 실험은 미세 조정이 기본 모델에 비해 최대 +10.3 BLEU 포인트의 성능 향상을 가져오는 상당한 개선을 이룬다는 것을 보여줍니다. 구체적으로, Llama-Krikri-8B의 전체 파라미터 미세 조정 (full-parameter fine-tuning)은 13.16의 BLEU 점수로 가장 높은 전반적인 성능을 달성했으며, QLoRA가 적용된 M2M100-1.2B 모델은 가장 큰 상대적 이득과 매우 경쟁력 있는 결과를 보여주었습니다. 우리의 데이터셋과 모델은 그리스어 자연어 처리 (NLP) 분야에 중요한 기여를 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기