대규모 언어 모델(LLM)은 콜롬비아 법률을 알고 있는가? 콜롬비아 법률 시스템의 신뢰성 벤치마크
요약
본 연구는 콜롬비아 법률 시스템에 대한 LLM의 신뢰성을 검증하는 전문가 벤치마크를 제시했습니다. 총 1,042개의 항목으로 구성된 이 벤치마크를 통해 Gemini 3.1 Pro 등 여러 모델을 평가한 결과, 자유 형식 답변의 사실적 정확도는 전반적으로 낮았습니다. 특히, 모델들이 신뢰성 있게 보이지만 실제로는 자주 틀리는 경향(답변 관련성과 정확성의 분리)이 발견되었으며, 법률 작업에는 전문가 감독과 출처 기반 근거 제시가 필수적임을 강조합니다.
핵심 포인트
- LLM의 콜롬비아 법률 시스템 신뢰성을 평가하는 벤치마크를 구축함.
- 자유 형식 답변의 사실적 정확도는 전반적으로 낮았으며, 모델 간 편차가 큼.
- 모델들이 틀린 것처럼 보이는 '환각' 경향이 발견되어 주의가 필요함.
- 법률 작업에는 반드시 전문가 감독과 출처 기반 근거 제시(grounding)가 요구됨.
대규모 언어 모델(LLMs)은 법률 실무, 교육 및 연구 지원에 점점 더 많이 사용되고 있지만, 미국 외 국가 법률 시스템에서의 신뢰성은 여전히 거의 문서화되지 않은 상태입니다. 우리는 콜롬비아 법률 시스템에서 LLM의 신뢰성을 평가하기 위한 전문가 검증 벤치마크를 소개합니다. 이 벤치마크는 인간 참여형(human-in-the-loop) 파이프라인과 다단계 전문가 검토를 거쳐 구축되었으며, 10개 법률 영역과 3가지 질문 형식(객관식 선택형, 반(semi)-개방형, 주관식 IRAC)에 걸친 총 1,042개의 항목으로 구성되어 있습니다. 우리는 적절한 형식별 지표를 사용하여 15개의 최신 독점 및 오픈 가중치 모델을 평가했습니다. 객관식 질문의 정확도는 Gemini 3.1 Pro의 0.905부터 0.577까지 넓게 분포하지만, 자유 형식 법률 답변에 대한 사실적 정확성은 어떤 모델에서도 0.45(0-1 척도)를 초과하지 못했습니다. 우리는 답변 관련성과 정확성 사이에 분리(dissociation)가 있음을 발견했습니다(Spearman rho = -0.46): 즉, 모델들은 신뢰할 수 있게 응답하는 것처럼 보이지만 실제로는 자주 틀리는 경향을 보여주며, 이는 비전문 사용자에게 특히 우려되는 패턴입니다. 객관식 질문의 정확도와 자유 형식 답변의 정확도는 강하게 순위 상관관계(rho = 0.94)를 보였기 때문에, 저렴한 객관식 선별 검사는 모델 순위를 예측하지만 절대적인 신뢰성을 과대평가합니다. 독립적인 루브릭 기반 LLM 심사 및 블라인드 인간 전문가 채점 모두 자유 형식 답변의 순위(rho >= 0.88)를 재현했습니다. 또한, 이 심사관은 규범 모델들이 인용하는 것 중 약 절반만이 정확하며 나머지는 틀리거나 존재하지 않음을 밝혀냈습니다. 신뢰성은 법률 영역별로 체계적으로 다르며 질문 복잡도에 따라 역U자 형태를 따릅니다. 우리의 결과는 현재 LLM이 콜롬비아 법률 작업을 수행하기 위해서는 전문가의 감독이 필요하며, 답변을 권위 있는 출처에 근거(grounding)하는 것이 더 높은 신뢰성으로 가는 유망한 경로임을 시사합니다. 우리는 재현 가능한 평가를 지원하기 위해 벤치마크 구축 파이프라인을 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기