교차 언어 전이(Cross-Lingual Transfer) 및 LoRA 어댑터 병합(Adapter Merging)을 통한 저자원 아랍 문자
요약
아랍 문자 기반 저자원 언어의 생물 의학 번역 성능을 높이기 위해 교차 언어 전이와 LoRA 어댑터 병합 전략을 연구했습니다. 고자원 언어를 피벗으로 활용하여 다리어, 파슈토어 등 저자원 언어의 번역 품질을 개선하는 다양한 전이 기법을 평가했습니다.
핵심 포인트
- LoRA 미세 조정을 통한 도메인 특화 피벗 어댑터 학습
- 제로 데이터 LoRA 어댑터 병합을 통한 추가 비용 없는 성능 향상
- 다리어의 경우 500개 문장만으로도 피벗 언어에 근접한 품질 달성
- 언어 간 구조적 거리가 멀 경우 교차 언어 전이의 한계 존재
우리는 아랍 문자 언어(Arabic-script languages)를 위한 생물 의학 신경망 기계 번역(NMT) 자원의 부족 문제를 해결하기 위해 의료 도메인의 교차 언어 전이(cross-lingual transfer)에 대한 체계적인 연구를 제시합니다. 우리는 extbf{4개의 심각한 저자원} 대상 언어인 다리어(Dari, 아프가니스탄 페르시아어, 페르시아어의 표준화된 변체), 파슈토어(Pashto), 소라니 쿠르드어(Sorani Kurdish, 중앙 쿠르드어, 쿠르드어의 주요 표준화된 변체), 우르두어(Urdu, 힌디어와 밀접하게 연관됨)의 번역을 개선하기 위해 아랍어와 페르시아어를 고자원 피벗(higher-resource pivots)으로 사용합니다. 소규모 디코더 전용 대규모 언어 모델(decoder-only LLMs)에 LoRA 미세 조정(fine-tuning)을 적용하여, extit{도메인 특화 피벗 어댑터(domain-specific pivot adapters)}를 학습시키고 extbf{세 가지 전이 전략}을 평가합니다: 퓨샷 인컨텍스트 학습(few-shot in-context learning), 최소 지도 적응(minimal supervised adaptation), 그리고 우리가 아는 바로는 이 설정에서 최초로 시도되는 제로 데이터 LoRA 어댑터 병합(zero-data LoRA adapter merging)입니다. 단 500개의 문장을 사용한 지도 적응(Supervised adaptation)은 다리어에 대해 피벗 언어에 근접한 품질(CHrF++ 41.01)을 달성하였고, 우르두어에 대해서도 유의미한 향상(28.88)을 보였습니다. 반면 어댑터 병합(adapter merging)은 추가 비용 없이 다리어에 대해 지도 적응의 3.5 CHrF++ 이내 수준에 도달했습니다. 파슈토어와 소라니 쿠르드어는 고위험 임상 배치(high-stakes clinical deployment)를 수행하기에는 여전히 불충분하며, 이는 피벗과의 구조적 거리(structural distance)가 너무 멀 때 교차 언어 전이가 갖는 한계를 드러냅니다. LoRA 어댑터 병합은 대상 언어의 생물 의학 데이터가 없더라도 밀접하게 연관된 언어들에 대해서는 놀라울 정도로 잘 작동합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기