TransBERT: 도메인 특화 언어 모델링을 위한 합성 번역 프레임워크
요약
본 논문은 특정 도메인의 비영어권 언어 데이터 부족 문제를 해결하기 위해 TransBERT라는 새로운 프레임워크를 제안합니다. 이 프레임워크는 오직 합성 번역 텍스트만을 사용하여 언어 모델을 사전 학습하는 것이 가능함을 보여줍니다. 프랑스어 생명과학 도메인에 적용하여 높은 성능을 입증했습니다.
핵심 포인트
- 합성 번역 데이터만으로도 효과적인 NLP 모델 구축이 가능하다.
- TransBERT와 TransCorpus 툴킷을 공개하여 재현성을 높였다.
- 저자원 언어/도메인 쌍에서 고품질 리소스 구축에 기여한다.
특정 도메인의 비영어권 언어 데이터 부족은 효과적인 자연어 처리(NLP) 도구 개발에 심각한 제약을 초래합니다. 본 논문에서는 오직 합성 번역 텍스트만을 사용하여 언어 모델을 사전 학습하는 새로운 프레임워크인 TransBERT와 확장 가능한 번역 툴킷인 TransCorpus를 소개합니다. 프랑스어 생명과학 도메인에 초점을 맞춘 저희의 접근 방식은, 합성 번역 데이터만 활용하여도 다양한 다운스트림 태스크에서 최첨단 성능을 달성할 수 있음을 입증합니다. 저희는 TransCorpus 툴킷, TransCorpus-bio-fr 코퍼스(프랑스어 생명과학 텍스트 36.4GB), TransBERT-bio-fr, 그리고 사전 학습 및 미세 조정에 필요한 재현 가능한 코드까지 공개합니다. 저희의 결과는 저자원 언어/도메인 쌍에서 고품질 NLP 리소스를 구축하는 데 있어 합성 번역이 높은 자원 번역 방향으로 활용될 수 있는 실현 가능성을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기