LP-Eval: 법률 명제 생성 품질 측정을 위한 루브릭 및 데이터셋
요약
본 논문은 LLM을 활용하여 유럽연합 사법재판소 판결문으로부터 법률 명제를 자동 생성하고 평가하는 방법론을 제안합니다. 법률 전문가와 공동 설계한 3단계 평가 루브릭인 LP-Eval과 100개의 전문가 주석이 포함된 데이터셋을 공개하며, LLM의 법률 명제 생성 능력과 평가자로서의 성능을 분석합니다.
핵심 포인트
- 법률 명제의 품질을 형식적 타당성과 실질적 차원으로 구분하는 3단계 평가 루브릭 'LP-Eval' 개발
- LLM은 대체로 고품질의 법률 명제를 생성할 수 있으나, 확립된 판례에서 더 높은 품질을 보임
- LLM을 평가자로 활용할 경우 루브릭 기반 판단은 전문가와 유사하나, 미세한 차이를 포착하는 데는 한계가 있음
- 유럽연합 사법재판소 판결문을 기반으로 한 법률 명제 생성 및 평가 데이터셋 공개
법률 명제 생성 (Legal proposition generation)은 법적 추론 (legal reasoning) 및 법학 연구의 핵심이지만, 법률 자연어 처리 (Legal NLP) 분야에서는 여전히 충분히 연구되지 않은 상태입니다. 본 논문은 대규모 언어 모델 (LLMs)을 사용하여 유럽연합 사법재판소 (Court of Justice of the European Union)의 판결문으로부터 법률 명제를 자동 생성하고 평가하는 방법을 조사합니다. 우리는 법률 전문가들과 공동 설계하여 법률 명제의 품질을 형식적 타당성 (formal validity)과 실질적 차원 (substantive dimensions)으로 분해하는 3단계 평가 루브릭 (rubric)인 LP-Eval을 소개합니다. 이 루브릭을 사용하여, 우리는 100개의 LLM 생성 법률 명제에 대한 두 전문가의 주석 (annotations)이 포함된 데이터셋을 공개합니다. 연구 결과, LLMs는 주로 잘 형성된 고품질의 명제를 생성할 수 있음을 보여주었으며, 전문가 평가 결과 확립된 판례에서 도출된 명제가 최근 판례에서 도출된 명제보다 품질이 더 높다는 것을 확인했습니다. 나아가 우리는 평가자로서의 LLMs를 조사하였으며, 루브릭에 기반한 LLM의 판단이 직접적인 종합 점수 산정보다 전문가의 평가와 더 밀접하게 일치하지만, 인간 전문가가 포착하는 미세한 차이에는 여전히 민감하지 않다는 것을 발견했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기