우리가 만든 새로운 교정기가 단 하나의 단어도 쓸 수 없다는 것
요약
본 글은 AI 모델 Jev를 통해 법률 문서의 규칙을 검토하고, 특히 '필수 요구 사항'과 '단순 허용 사항'을 구분하는 데 초점을 맞춘 과정을 설명합니다. 기존 모델이 요약이나 구조화된 데이터에 오류를 포함시키는 경향을 발견하여, 질문 방식을 개선하고 추출 모델의 필드 설정을 변경했습니다.
핵심 포인트
- AI가 법률 문서에서 필수/허용 사항 구분에 어려움을 겪음.
- 요약 및 구조화된 데이터는 원본보다 과도한 정보를 담기 쉬움.
- 질문 형식을 '예/아니오'로 단순화하여 정확도를 높임.
- 추출 모델의 빈칸 필드는 이제 선택 사항으로 변경됨.
저희는 '예' 또는 '아니오'로만 답변하는 AI를 가지고 있었고, 저희가 발행하는 모든 규칙을 재검토했습니다. 그 과정은 다음과 같습니다.
지난주 TypeSafe에서 글을 쓸 수 없는 AI 모델인 Jev를 출시했습니다. 이 모델에 텍스트와 질문 목록을 제공하면,
약 95%의 규칙은 문제가 없었습니다. 나머지 부분에서는 인용문과 출처는 괜찮았고, 문제는 판사가 언급한 내용보다 약간 더 많은 내용을 담은 요약이나 필드였습니다. 한 판사는 당사자가 권위 자료집(compendium of authorities)의 예의상 사본 두 부를 '제출할 수 있다(may submit)'고 썼는데, 저희 요약이 이를 필수 요구 사항처럼 바꾼 경우였습니다. 또 다른 판사는 주니어 변호사들이 동의서(motions)에 대해 주장하도록 장려했는데, 저희 구조화된 데이터는 그 판사가 한 번도 언급하지 않은 '경력 연차 제한'을 붙여 넣었습니다. 증거 자료철(exhibit binders) 탭핑에 관한 규칙은 어딘가에서 페이지 여백(page margins)을 가져와서 기록했습니다.
소송 변호사(litigator)는 주로 어떤 것이 필수 요구 사항인지 아니면 단순히 허용되는 것인지를 알아보기 위해 규칙을 읽기 때문에, 저희는 이 점들을 심각하게 받아들였습니다. 저희는 샘플을 직접 손으로 검토했고, Jev와 의견을 모아 당일 바로 문제가 된 규칙들을 수정했습니다.
또한 추출 모델(extraction model)이 채우는 양식도 변경했습니다. 이전에는 여백이나 경력 제한 같은 항목에 필수 빈칸(required blanks)이 있었는데, 모델은 필수 빈칸이 주어지면 무언가를 채워 넣으려는 경향이 있었습니다. 이제 해당 필드들은 선택 사항이며, 비어 있다는 것은 판사가 언급하지 않았다는 의미입니다.
문제가 되었던 부분
저희의 첫 번째 객관식 질문은 실패작이었고, 저희 잘못이었습니다. 저희는 Jev에게 11가지 문서 유형 메뉴를 주고 해당 페이지가 어떤 유형인지 물었는데, 모델은 거의 모든 빈 템플릿 순서(blank template order)가 특정 명명된 사건에서 제출된 명령이라고 판단했습니다. 저희는 모델 탓을 했고 별도의 예/아니오 질문으로 전환했는데, 이것이 효과적이었습니다.
이후 Jerry Liu가 DocJev를 발표했는데, 이 도구는 문서의 주요 목적에 대해 한 문장으로 각 카테고리를 정의하여 문서를 분류합니다. 저희의 11가지 옵션은 단순히 라벨만 붙어 있을 뿐, 서로 무엇이 다른지 알려주는 것이 없었습니다. 저희가 메뉴를 그렇게 다시 작성하고 배치(batch) 문서들에 적용해 보았는데, 그중 다섯 개는 이미 수동으로 읽었던 문서였습니다. 이 도구는 네 개에서 저희의 판독 결과와 일치했습니다. 오답은 아무런 규정을 언급하지 않고 파일링 규칙에 대해 이야기하는 링크 페이지였으며, 이는 이제 두 번째 예/아니오 질문을 통해 포착됩니다. Parallel found에서 보았듯이 매우 긴 라벨 목록도 이 도구의 성능을 떨어뜨리므로, 저희는 메뉴를 짧게 유지하고 있습니다.
이 도구의 신뢰도 점수는 끝부분에서만 의미가 있습니다. 요약문과 인용구가 모순된다고 95% 확신할 때는 보통 맞았지만, 60%일 때는 네 번 중 한 번 정도 맞았으며, 한 번은 '최소 21일 전'과 '늦어도 21일 전까지'가 상충한다고 주장했습니다. 또 다른 때는 90분 시간 제한에서 정확한 숫자를 뽑아낸 후 단위가 시간이라고 알려주었습니다.
그리고 이 도구는 자체적인 아이디어가 없습니다. 저희가 가진 모든 규칙에 대해, 아주 저렴한 비용으로 어떤 카테고리든 세어줄 것이지만, 저희가 카테고리를 가져다줘야 합니다.
이전에는 감당할 수 없었던 질문들
저렴하다는 점이 무엇을 물어볼지 결정합니다. 저희는 판사들이 마감일을 어떻게 표현하는지 알아내기 위해 큰 모델에 비용을 지불하지 않았겠지만, 이 가격대에서는 그 질문을 해당 규정 거의 9천 개에 걸쳐 실행해 보았습니다. 세 개 중 하나 이상은 단순히 '일(days)'이라고만 언급하고 어떤 종류인지 저희가 파악하도록 내버려 둡니다. 약 14개 중 1개는 '법원 근무일(court days)'이라고 언급하는데, 이는 법정 공휴일을 건너뛰며 영업일(business days)과는 다릅니다. 저희는 이 설문조사 결과에 맞춰 마감일 필드를 재작업하고 있습니다.
또한, 저희는 '이 페이지가 소송 당사자에게 무언가를 하라고 지시하는가?'라는 단 하나의 질문을 가지고 약 4천 개의 원본 문서에 대해 테스트를 진행했습니다. 이 작업은 70초밖에 걸리지 않았습니다. 그 결과, 우리가 따로 빼두었던 수백 페이지의 문서를 발견했는데, 대부분 판사가 당사자들이 채워 넣도록 만든 빈 양식 명령서였습니다. 물론 이런 문서들도 요구 사항을 담고 있습니다. 증거를 인용해야 하는 두 번째 모델은 무작위로 추출한 40개 중 39개에서 동의했습니다. 해당 문서는 현재 추출 대기열에 있습니다.
현재 기능
이제 Jev가 우리가 수집하는 문서에 규칙이 포함되어 있는지 여부에 대해 첫 의견을 제시합니다. 대규모 모델(large model)은 Jev가 확신하지 못할 때만 검토에 참여합니다. 또한, 교정 작업도 담당하게 되었습니다. 새로운 규칙의 요약과 값들은 해당 규칙이 검색하는 페이지에 표시되기 전에 판사의 문장과 대조하여 확인되며, 근거를 제시할 수 없는 규칙은 저희가 검토하도록 플래그 지정됩니다. 이 기능이 어느 정도 작동한 후에 얼마나 많은 것을 잡아내는지 말씀드리겠습니다.
원문 게시일: Court Rules.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기