ExtractBench: 스키마 가이드 기반 기업 문서 추출을 위한 벤치마크
요약
기업 문서에서 스키마 가이드 기반 추출 성능을 평가하기 위한 새로운 벤치마크인 ExtractBench를 소개합니다. 값의 정확도, 완전성, 근거 제시, 비용을 종합적으로 평가하며, LlamaExtract Agentic Plus가 우수한 성능을 보였습니다.
핵심 포인트
- 스키마 가이드 기반 추출을 위한 최초의 종합 벤치마크 제시
- 정확도, 완전성, 근거 제시, 비용 등 4가지 핵심 지표 평가
- VLM과 코딩 에이전트 간의 성능 및 비용 효율성 비교
- LlamaExtract Agentic Plus가 높은 정확도와 낮은 비용으로 1위 달성
기업 워크플로우는 점점 더 extit{스키마 가이드 기반 추출 (schema-guided extraction)}을 위해 에이전트(agents)에 의존하고 있습니다. 즉, 문서와 사용자 정의 스키마(schema)가 주어졌을 때, 에이전트는 스키마를 충실히 따라 근거 메타데이터(grounding metadata)로서 소스 증거를 포함한 정확한 출력을 생성합니다. 본 논문에서는 스키마 가이드 기반 추출을 위한 벤치마크인 ExtractBench를 제시하며, 저희가 알기로는 값의 정확도(value accuracy), 대규모 레코드 완전성(record completeness), 근거 제시(grounding), 그리고 측정된 비용(measured cost)을 함께 평가하는 최초의 벤치마크입니다. 평가 시스템은 370개의 기업 문서, 8개의 비즈니스 도메인, 67개의 문서 유형에 걸쳐 4,869페이지를 포함하며, 도전적인 시나리오를 구분하는 명확한 태그가 포함되어 있습니다. 확장 가능한 스키마 및 정답(ground-truth) 큐레이션 파이프라인은 실제 문서에 대한 독립 시스템 간의 일치성(independent-system agreement), 합성 리스트(synthetic lists)에 대한 기지 값(known values), 그리고 양식(forms)에 대한 인간 검증(human verification)을 결합합니다. 저희는 값의 정확도를 위해 순서에 무관한 값 F1(order-insensitive value F1)을 보고하며, 소스 추적 가능성(source traceability)을 위한 두 가지 근거 지표인 단어 및 페이지 수준의 F1을 보고합니다. 상용 VLM(Vision-Language Models)은 짧은 문서에서는 성능이 좋지만 긴 문서에서는 레코드 리스트를 생략(truncate)하는 경우가 빈번한 반면, 코딩 에이전트(coding agents)는 훨씬 더 높은 비용을 소모하면서도 더 높은 정확도를 유지합니다. LlamaExtract Agentic Plus는 세 가지 지표 모두에서 1위를 차지했으며, 코딩 에이전트와 유사한 정확도를 훨씬 적은 비용으로 달성했습니다. 데이터셋과 평가 코드는
ef{https://huggingface.co/datasets/llamaindex/ExtractBench}{HuggingFace} 및
ef{https://github.com/run-llama/ExtractBench}{GitHub}에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기