GPTKB 2.0: 대규모 언어 모델(LLM)로부터 중의성이 해소된 지식 베이스(Knowledge Base)의 직접 구축
요약
LLM을 활용하여 중의성이 해소된 대규모 지식 베이스를 직접 구축하는 방법론인 GPTKB 2.0을 제안합니다. 엔티티, 관계, 클래스에 대한 실시간 중의성 해소를 통해 확장성과 정확도를 동시에 확보했습니다.
핵심 포인트
- LLM 기반의 자동 지식 베이스 구축(AKBC) 방법론 제안
- 엔티티, 관계, 클래스에 대한 실시간 중의성 해소 통합
- 100만 개 이상의 엔티티와 3,840만 개의 트리플 확보
- 정확도, 규모, 비용 간의 트레이드오프 분석 수행
자동 지식 베이스 구축 (Automated Knowledge Base Construction, AKBC)은 핵심적인 자연어 처리 (NLP) 작업이며, 최근 연구들은 모델 자체를 지식 소스로 취급하여 대규모 언어 모델 (Large Language Models, LLMs)로부터 지식 베이스를 직접 생성하는 방안을 제안하고 있습니다. 그러나 LLMs는 본질적으로 엔티티 (Entities)에 대한 표현을 보유하고 있지 않아, 중복 항목이나 혼동이 발생하게 됩니다. 우리는 LLMs로부터 중의성이 해소된 지식 베이스 (KBs)를 직접 구축하기 위한 방법론인 GPTKB 2.0을 제안합니다. GPTKB 2.0은 엔티티, 관계 (Relations), 클래스 (Classes)에 대한 실시간 중의성 해소 (On-the-fly disambiguation)를 통합하며, 확장성 (Scalability)과 중의성 해소 정확도를 모두 충족하도록 세심하게 설계되었습니다. 우리는 핵심적인 설계 결정 사항들을 분석하고 정확도, 규모, 비용 사이의 트레이드오프 (Trade-offs)를 규명합니다. 우리는 GPTKB 2.0을 대규모로 실행하여, 100만 개 이상의 중의성이 해소된 엔티티와 3,840만 개의 트리플 (Triples)을 포함하는 구체화된 지식 베이스를 확보했습니다. 이는 엔티티, 관계, 클래스에 대한 명시적인 내부 정규화 (Canonicalization)를 갖춘 최초의 백만 단위 규모 LLM 네이티브 지식 베이스이며, 기존의 Wikimedia 중심 연구들과는 크게 차별화됩니다. GPTKB 2.0은 https://gptkb.org/ 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기