Persian Pixel: 페르시아어를 위한 대규모 합성 OCR 데이터셋
요약
페르시아어 OCR 기술 발전을 위해 설계된 대규모 합성 데이터셋인 Persian Pixel을 소개합니다. 343,000개 이상의 고충실도 이미지-텍스트 쌍을 통해 복잡한 페르시아 문자 체계와 다양한 문서 환경을 모델링합니다.
핵심 포인트
- 343,000개 이상의 고충실도 이미지-텍스트 쌍 제공
- 25개 이상의 확률적 열화 모델로 실제 문서 환경 모사
- 저자원 언어의 OCR 발전을 위한 비용 효율적 합성 데이터 생성 방식 입증
- TrOCR, Donut 등 최신 트랜스포머 기반 모델 학습에 최적화
페르시아어는 여러 국가에서 1억 1천만 명 이상의 사람들이 사용함에도 불구하고, 페르시아어를 위한 광학 문자 인식 (OCR) 기술은 라틴 문자 기반 언어들에 비해 여전히 상당히 미성숙한 상태입니다. 이러한 격차는 두 가지 근본적인 문제로 인해 발생합니다: 페르시아-아랍 (Perso-Arabic) 문자 체계의 본질적인 복잡성과 대규모의 고품질 주석 데이터셋 (annotated datasets)에 대한 제한된 가용성입니다. 페르시아 문자 체계는 의무적인 필기체 연결성, 문맥 의존적 글리프 형태 (glyph shaping), 광범위한 합자 (ligatures), 발음 구별 부호 (diacritic) 배치, 그리고 Naskh 및 Nastaliq과 같은 서체에 따른 양식적 변형을 나타내며, 이 모든 요소는 텍스트 인식을 현저히 복잡하게 만듭니다. 동시에, 수동 주석 작업의 높은 비용과 노동 집약적인 특성은 지속적인 데이터 병목 현상을 야기하여, 강력한 OCR 시스템의 개발을 제한하고 페르시아 문서 디지털화의 진전을 늦추고 있습니다.
본 논문에서 우리는 이러한 과제들을 해결하기 위해 특별히 설계된 종합적인 합성 OCR 데이터셋인 Persian Pixel을 소개합니다. 343,000개 이상의 고충실도 이미지-텍스트 쌍으로 구성된 이 데이터셋은 SynthOCR-Gen 렌더링 프레임워크를 사용하여 신중하게 선별된 700만 단어 규모의 페르시아어 코퍼스 (corpus)로부터 생성된 문장, 단락 및 전체 페이지 문서 레이아웃을 포괄합니다. 생성 파이프라인은 문맥적 문자 연결, 위치별 글리프 변형, 발음 구별 부호 배치, 그리고 다수의 대표적인 페르시아 서체를 포함하여 페르시아 문자 체계의 타이포그래피적 특성을 충실히 모델링합니다.
합성 데이터와 실제 데이터 간의 도메인 간극 (domain gap)을 메우기 위해, 렌더링된 이미지에는 잉크 번짐 (ink bleed), 종이 노화 (paper aging), 흐림 (blur), 조명 변화 (illumination variation), 스캐너 결함 (scanner imperfections), 압축 아티팩트 (compression artifacts), 그리고 다수의 노이즈 프로세스 (noise processes)를 포함하여 실제 문서 획득 시 발생하는 아티팩트 (artifacts)를 모사하는 25개 이상의 확률적 열화 모델 (stochastic degradation models)을 적용하여 더욱 풍부하게 구성되었습니다. 주석이 달린 (annotated) 페르시아어 OCR 데이터의 고질적인 부족 문제를 극복함으로써, Persian Pixel은 TrOCR 및 Donut과 같은 트랜스포머 기반 (transformer-based) 모델을 포함한 현대적 OCR 아키텍처를 학습시키고 미세 조정 (fine-tuning)할 수 있는 확장 가능하고 공개적으로 사용 가능한 리소스를 제공합니다. 이 데이터셋은 페르시아어 문서 분석, 역사적 필사본 디지털화, 그리고 엔드 투 엔드 (end-to-end) 문서 이해 연구를 위한 강력한 토대를 마련하는 동시에, 프로그래밍 방식의 합성 데이터 생성 (programmatic synthetic data generation)이 저자원 (low-resource) 및 타이포그래피적으로 복잡한 문자의 OCR 발전을 위해 수동 주석 (manual annotation)을 대체할 수 있는 실용적이고 비용 효율적이며 확장 가능한 대안임을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기