【충격】 200페이지 PDF를 0.47초 만에 해석할 수 있습니다😳
요약
Firecrawl 팀이 Rust로 개발한 초고속 PDF 해석 도구를 공개했습니다. 브라우저 내부에서 200페이지 PDF를 0.47초 만에 정형 텍스트로 변환하며, 표 추출 정밀도가 매우 높습니다.
핵심 포인트
- 200페이지 PDF를 0.47초 만에 해석하는 압도적 속도
- 텍스트와 이미지 스캔 여부를 자동 판정하여 분류
- 좌표와 서체를 유지한 정형 텍스트(Structured Text) 변환
- Rust 기반 오픈 소스이며 npm, pip, cargo로 설치 가능
【충격】
200페이지의 PDF를 0.47초 만에 해석할 수 있습니다😳
기존에는 2.8초였습니다. 게다가, 브라우저 내부에서만 완결됩니다.
내부에서 무엇을 하고 있냐면👇
・텍스트 포함 여부인지, 이미지 스캔인지 여부를 10~50밀리초(ms) 내에 판정하여 분류
・좌표와 서체를 유지한 채 본문을 추출하여, 제목이나 표가 포함된 정형 텍스트(Structured Text)로 변환
・표 추출 정밀도는 200건의 비교에서 0.814로 1위. 읽기 순서 재현도 1위
・이미지 읽기 처리를 일절 거치지 않으므로, 가지고 있는 PC만으로 완결
만든 것은 Firecrawl 팀, 언어는 Rust이며 라이선스는 MIT입니다.
설치 방법은 npm, pip, cargo 중 선택할 수 있으며, 변환용 커맨드도 동봉되어 있습니다.
즉, 자료 더미를 AI에게 전달하기 전의 대기 시간이 공정별로 사라진다는 뜻입니다.
서류 PDF를 매일 다루는 사람일수록, 효과가 노골적으로 달라집니다.
오픈 소스는 이쪽👇
AI 자동 생성 콘텐츠
본 콘텐츠는 X @opensourcelab9 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기