ANNOTARES: 독일 법령 텍스트에서 논리적 구조를 추출하기 위한 데이터셋
요약
독일 법령 텍스트에서 법적 요건과 결과를 식별하기 위한 새로운 데이터셋인 ANNOTARES를 소개합니다. 다양한 모델을 통해 벤치마킹한 결과, BERT와 LLM 기반 모델이 복잡한 법률 구조를 파악하는 데 탁월한 성능을 보였습니다.
핵심 포인트
- 독일 법령의 논리적 구조 추출을 위한 ANNOTARES 데이터셋 공개
- 법적 요건(Tatbestand)과 법적 결과(Rechtsfolge) 식별 과업 수행
- BERT 및 LLM 기반 모델이 기존 모델 대비 우수한 성능 입증
- 도메인 특화 성능 및 법전 간 일반화 성능 평가 설계
법률 텍스트의 자동 구조 분석은 리걸 테크놀로지 (Legal Technology)의 초석이지만, 그 논리적 구성 요소를 추출하는 것은 여전히 중요한 과제로 남아 있습니다. 본 논문에서 우리는 독일 법령 텍스트 내에서 법적 요건 (Tatbestand) 및 법적 결과 (Rechtsfolge)를 식별하고 분할하는 과업을 소개합니다. 이 과업을 지원하기 위해, 우리는 스팬 수준 (span-level) 주석이 포함된 독일 법률 텍스트로 구성된 새로운 데이터셋인 ANNOTARES (Annotations of Tatbestand-Rechtsfolge Sequences)를 제시합니다. 세 가지 서로 다른 법전 (legal codes)에 걸쳐 있는 이 데이터셋은 도메인 특화 성능과 법전 간 일반화 성능을 모두 평가하도록 설계되었습니다. 우리는 규칙 기반 베이스라인 (rule-based baseline), CRF (CRFs), BiLSTM (BiLSTMs), BiLSTM-CRF, 그리고 BERT 변형 모델 및 LLM (LLM)-기반 방법론을 포함한 현대적인 트랜스포머 (Transformer) 기반 모델 등 다양한 아키텍처 접근 방식을 벤치마킹합니다. 우리의 결과는 BERT 및 LLM 기반 모델이 법률 언어의 복잡한 구문 구조를 포착하는 데 있어 우수한 성능을 달성함을 보여줍니다. 우리는 자동화된 법적 추론 (automated legal reasoning)에 관한 추가 연구를 촉진하기 위해 우리의 데이터셋을 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기