Infini-News: 13억 개의 처리된 Common Crawl 뉴스 기사에 대한 효율적인 쿼리 가능 접근 방식
요약
Infini-News는 13억 개 이상의 Common Crawl 뉴스 기사를 효율적으로 검색하고 분석할 수 있도록 설계된 새로운 툴킷이자 인덱스입니다. 텍스트 정제, 언어 감지, 지리적 귀속 정보를 포함한 풍부한 메타데이터를 제공하며, Suffix-array 기반의 Infini-gram 인덱스를 통해 대규모 아카이브 내 텍스트 패턴을 1초 미만으로 검색할 수 있습니다.
핵심 포인트
- 13억 5천만 개 이상의 뉴스 기사에 대한 텍스트 추출 및 구조화된 메타데이터 제공
- GlotLID, lingua, CommonLingua를 활용한 정밀한 언어 감지 및 222개국 대상 지리적 귀속 정보 포함
- Infini-gram 인덱스(Suffix-array 구조)를 통해 전체 아카이브에서 1초 미만의 초고속 검색 가능
- 계산 사회 과학 및 NLP 연구를 위한 대규모 뉴스 코퍼스의 접근성 및 비용 문제 해결
대규모 뉴스 코퍼스 (News corpora)는 계산 사회 과학 (Computational Social Science) 및 자연어 처리 (NLP) 분야의 광범위한 연구를 지원하지만, 접근성 측면에서는 여전히 제약이 있습니다. 상업용 아카이브는 과도한 비용과 라이선스 제한을 부과하며, Common Crawl의 CC-News와 같은 공개 대안은 테라바이트 규모의 저장 공간과 계산 집약적인 처리를 요구합니다. 본 논문에서는 2016년 8월부터 최신 스냅샷까지의 전체 CC-News 아카이브를 위한 검색 툴킷이자 인덱스인 Infini-News를 제시합니다. 우리의 기여는 세 가지 측면으로 나뉩니다. 첫째, 13억 5천만 개 이상의 기사에서 텍스트를 추출 및 정제하고 구조화된 메타데이터 (Metadata)를 파싱 (Parse) 합니다. 둘째, 세 가지 최첨단 언어 분류기 (GlotLID, lingua, CommonLingua)를 사용한 언어 감지 (Language detection)와 222개국에 걸쳐 기사의 83.4%에 대해 원산지를 식별하는 다중 소스 지리적 귀속 (Geographic attribution)을 통해 코퍼스를 풍부하게 만듭니다. 셋째, 연구자들이 임의의 텍스트 패턴을 1초 미만의 시간 내에 전체 아카이브에서 검색할 수 있게 해주는 접미사 배열 (Suffix-array) 구조인 Infini-gram 인덱스를 구축합니다. 이러한 자원들은 종합적으로 종단적 (Longitudinal) 및 국가 간 미디어 연구의 장벽을 낮춰줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기