HistoRAG: 스캔된 지역 역사 및 문화유산 아카이브를 활용한 인용 기반 질의응답 어시스턴트
요약
HistoRAG는 스캔된 지역 역사 및 문화유산 아카이브를 활용하여 인용 기반 질의응답을 제공하는 어시스턴트입니다. 이 시스템은 비전 언어 모델로 페이지를 전사하고, 하이브리드 텍스트 인덱스, 관계형 데이터베이스, 지식 그래프 세 가지 저장소를 구축합니다. 이를 통해 질문 유형에 따라 적절한 저장소로 라우팅하여 정확성과 출처 검증 가능성을 높였습니다.
핵심 포인트
- 스캔된 자료의 한계를 극복하는 인용 기반 Q&A 시스템 제시
- VLM을 활용해 페이지 전사 및 라인 레벨 신뢰도 유지
- 하이브리드 텍스트, DB, 지식 그래프 세 가지 저장소 결합
- 질문 유형별 경량 라우터가 정확한 답변 경로 안내
지역 역사 및 문화유산을 가르치는 교사들은 사용하기 어려운 자료로 작업합니다. 주요 출처는 텍스트 레이어가 없는 스캔된 책들이고, 보조 기록은 스프레드시트로 공개되는 행정 카탈로그입니다. 일반적인 챗봇은 이러한 질문에 유창하게 답하지만, 교사가 가장 필요로 하는 검증 가능한 출처가 없습니다. 본 논문은 HistoRAG를 제시합니다. 이는 하나의 지역 컬렉션으로부터 답변하며 모든 사실에 대해 권(volume)과 페이지를 인용하는 질의응답 어시스턴트입니다. HistoRAG는 비전 언어 모델을 사용하여 각 페이지를 전사하고 토큰 확률에서 라인 레벨 신뢰도를 유지합니다. 이는 동일한 컬렉션으로부터 세 가지 저장소를 구축합니다: 하이브리드 텍스트 인덱스, 관계형 카탈로그 데이터베이스, 그리고 엔티티 밀집 구절에서만 추출된 지식 그래프입니다. 경량 라우터는 각 질문을 필요한 저장소로 보내어, 계산적인(counting) 질문은 데이터베이스에, 관계적인(relational) 질문은 그래프에 도달하게 합니다. 우리는 36권의 스캔된 자료와 동일 지역의 문화유산 카탈로그를 아우르는 516개의 질문으로 벤치마크를 구축했으며, 이는 통계적, 사실적, 시간적, 다단계(multi-hop) 질문을 포함합니다. HistoRAG는 구절 검색 기반 기준선(passage retrieval baselines)과 그래프 기반 검색 시스템보다 더 많은 질문에 대해 정확하게 답변하며, 질문당 비용은 훨씬 적습니다. 이 어시스턴트는 채팅 인터페이스 뒤에서 실행되므로, 교사는 어떤 진술이 어느 페이지에서 왔는지 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기