텍스트, 테이블, 지식 그래프 간의 지식 불일치 탐지
요약
텍스트, 테이블, 지식 그래프(KG) 간의 정보 불일치를 탐지하는 연구를 소개합니다. 새로운 분류 체계와 자동화 프레임워크인 Kontrast를 통해 모달리티 간의 충돌을 식별하고 지식의 일관성을 검증합니다.
핵심 포인트
- 텍스트, 테이블, KG 간의 교차 모달 지식 불일치 분류 체계 도입
- Text-to-SPARQL 및 LLM을 활용한 자동화 프레임워크 Kontrast 제시
- 지식 불일치가 실제 충돌뿐 아니라 KG의 불완전성도 드러냄을 증명
- 대규모 지식 감사(Knowledge Auditing)를 위한 도구 및 벤치마크 제공
Wikipedia와 Wikidata는 정보 접근, LLM (Large Language Model) 사전 학습, 그리고 검색 증강 생성 (RAG, Retrieval-Augmented Generation)을 위해 널리 사용됩니다. 이들의 지식은 깊게 연결되어 있지만 텍스트, 테이블, 그리고 지식 그래프 (KG, Knowledge Graphs)에 흩어져 있습니다. 이는 실질적인 질문을 던집니다: 이러한 모달리티 (modalities)가 서로 일치하지 않을 때, 어떻게 그 충돌을 탐지하고 설명할 수 있을까요? 우리는 이 문제를 extit{모달리티 수준의 불일치 탐지 (modality-level inconsistency detection)}로 연구합니다. 먼저 우리는 정보의 입도 (granularity) 차이, 직접적인 충돌, 시간적 변화, 그리고 KG의 불완전성을 포괄하는 교차 모달 지식 불일치의 분류 체계 (taxonomy)를 도입합니다. 그런 다음, 우리는 Text-to-SPARQL과 LLM 추론을 사용하여 테이블 기반의 답변을 KG 증거와 비교하고 결과로 나타나는 불일치를 분류하는 자동화된 프레임워크인 extsc{Kontrast}를 제시합니다. 다양한 Table-QA 데이터셋에 대한 실험은 교차 모달 불일치가 흔하며 유익한 정보를 제공한다는 것을 보여줍니다. 이러한 불일치는 실제 지식 충돌뿐만 아니라 누락된 KG 구조와 시간적 불일치도 드러내지만, Text-to-SPARQL 오류와 노이즈에 의해 제한을 받기도 합니다. 우리의 분석은 텍스트, 테이블, 그리고 KG가 체계적인 비교를 통해 서로를 보완하고 수정할 수 있음을 보여줍니다. extsc{Kontrast}는 대규모 지식 감사 (knowledge auditing)를 위한 실질적인 도구를 제공하며, 교차 모달 지식 일관성에 관한 향후 연구를 위한 벤치마크를 구축합니다. 코드와 데이터는 https://github.com/ECLADATTA/KONTRAST 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기