시각적 정보 기반 다국어 PDF 번역을 위한 ForMaT 데이터셋
요약
원본 레이아웃을 보존하며 다국어 PDF를 번역하기 위한 새로운 병렬 코퍼스인 ForMaT 데이터셋을 소개합니다. 15개 언어 쌍과 3,956개의 PDF로 구성되었으며, K-Medoids 샘플링을 통해 표나 수식 같은 복잡한 기하학적 구조를 포함하도록 설계되었습니다. 이 데이터셋은 시각적 문맥과 텍스트를 통합하는 레이아웃 인식 번역 모델 개발을 위한 벤치마크 역할을 합니다.
핵심 포인트
- 원본 레이아웃 메타데이터를 보존하는 15개 언어 쌍의 ForMaT 데이터셋 공개
- K-Medoids 샘플링을 통해 중첩된 표 및 수식 등 복잡한 기하학적 특징 포함
- 기존 MT 시스템이 겪는 공간적 접지 및 기하학적 동기화 문제 식별
- 고충실도 문서 재구성을 위한 레이아웃 인식 번역 모델 개발의 벤치마크 제공
우리는 멀티모달 기계 번역 (Multimodal Machine Translation)을 위해 제안된, 원본 레이아웃 메타데이터를 보존하는 15개 언어 쌍의 3,956개 PDF로 구성된 병렬 코퍼스인 ForMaT (Format-Preserving Multilingual Translation)를 선보입니다. 데이터셋의 구조적 다양성을 보장하기 위해, 우리는 45개의 기하학적 특징 (Geometric features)에 대해 K-Medoids 샘플링을 적용하여 중첩된 표 (Nested tables) 및 수식 (Formulas)과 같은 복잡한 요소들을 포착하고, 시각적으로 다양한 PDF 문서에만 집중하도록 했습니다. 우리의 평가 결과에 따르면, 현재의 기계 번역 (MT) 시스템은 공간적 접지 (Spatial grounding) 및 기하학적 동기화 (Geometric synchronization)에 어려움을 겪고 있으며, 텍스트와 그 시각적 문맥 사이의 연결을 자주 놓치는 것으로 나타났습니다. ForMaT는 고충실도 문서 재구성 (High-fidelity document reconstruction)을 위해 시각적 문맥과 텍스트 문맥을 통합하는 레이아웃 인식 번역 모델 (Layout-aware translation models) 개발을 위한 벤치마크를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기