도메인 법률 에이전트를 위한 훈련 전 도구 사용법
요약
법률 도메인 에이전트 CoCounsel의 정확도가 크게 향상된 사례를 다룹니다. 단순히 모델만 사용하는 것이 아니라, Westlaw와 Practical Law 같은 전문 도구를 에이전트가 호출할 수 있도록 통합하고 명확한 지침을 제공하는 것이 핵심입니다. 이를 통해 초기 버전 대비 작업 성공률이 25%에서 70% 이상으로 급증했습니다.
핵심 포인트
- 도메인 특화 에이전트는 외부 도구 연동이 필수적이다.
- 에이전트에게 도구 사용법과 지침을 제공하는 것이 성능 향상의 핵심 동력이다.
- Claude Agent SDK 기반의 아키텍처가 활용되었다.
- 프론티어 모델은 최첨단 지능 작업을 위해 스택에 남아 있어야 한다.
맞춤형 모델에 대한 훈련을 진행하기 전에 에이전트에게 해당 도메인의 도구와 인용 출처 확인 기능을 제공하세요. CoCounsel Bench에서 Joel Hron은 이전의 CoCounsel이 질문 중 약 25%를 한 번에 답변했지만, 에이전트가 도구와 기본적인 지침을 갖게 되자 거의 하룻밤 사이에 70% 이상까지 도달했다고 말했습니다. 실행된 모든 출처를 기록하고 목록에 없는 인용은 거부하세요.
Joel Hron은 Thomson Reuters의 최고 기술 책임자(Chief Technology Officer)로서 이 내용을 2026년 8월 Chain of Thought에서 다루었습니다. 그는 Westlaw, Practical Law, CoCounsel을 포함하여 법률, 세금, 감사 및 규정 준수 전반에 걸쳐 제품 엔지니어링을 이끌고 있습니다. CoCounsel은 애플리케이션이며, Thomson이 모델입니다.
새로운 모델 이전의 원샷 정확도를 높인 요인은 무엇인가?
도구와 해당 도구를 사용하는 방법에 대한 간결한 지침들입니다. Hron에 따르면 초기 CoCounsel 버전들은 코딩 에이전트 아키텍처가 아니었습니다. 새로운 CoCounsel은 Westlaw와 Practical Law를 에이전트가 호출할 수 있는 도구로 분해합니다. CoCounsel Bench는 그들의 법률 작업 세트로, 약 3,000개의 질의를 포함하며 거의 매일 더 많은 질문이 추가되고 있습니다.
CoCounsel은 Claude Agent SDK를 기반으로 구축되었으며 OpenAI와 Google의 모델도 사용합니다. Thomson은 그가 설명한 후속 단계입니다: 모델을 이러한 도구, 이전 기술 및 시스템 프롬프트를 사용하도록 훈련하는 것입니다. Thomson의 첫 CoCounsel 작업은 대규모 문서 세트에 대한 실사(due diligence)와 같은 벌크 문서 검토입니다. 그는 이 출시와 관련된 표 형식 분석에 대해 Thomson이 기존에 사용하던 모델 버전에 비해 정확도에서 약 5 퍼센트 포인트 더 나은 성능을 보였다고 말했습니다. 그는 프론티어 모델들은 최첨단 지능 작업을 위해 스택에 남아 있어야 한다고 언급했습니다. 따라서 Thomson은 이 경로를 진행하기 위해 Claude, OpenAI 또는 Gemini를 대체할 필요가 없습니다.
하지만 이전 버전의 CoCounsel에서는 그러한 질문 중 약 25%에 대해서는 한 번에 답변할 수 있었습니다. 그리고 이 새로운 버전의 CoCounsel을 구축했을 때, 거의 하룻밤 사이에 에이전트가 작업을 수행하는 데 필요한 도구와 해당 도구를 사용하는 방법에 대한 기본적인 지침만 제공함으로써 70% 이상을 달성했습니다.
Joel Hron(Thomson Reuters 최고기술책임자), Chain of Thought ep 69에서 발췌
Thomson 1: The New $40M Legal … - Chain of Thought | AI Agents, Infrastructure & Engineering - Apple Podcasts
Podcast Episode · Chain of Thought | AI Agents, Infrastructure & Engineering · August 24 · 54m
에이전트가 열어보지 않은 인용을 어떻게 차단하나요?
검토한 모든 사례를 기록하고 이를 활용하여 주장을 근거화합니다.
Hron은 '인용 출처 장부(citation ledger)'라는 개념을 설명했습니다. 이는 연구 과정에서 검토된 모든 사례를 기록하는 장부이며, 에이전트가 제시하는 주장의 근거로 사용됩니다. Thomson Reuters는 CoCounsel의 인용 출처 장부 및 인용 확인 접근 방식에 대한 특허 출원 중입니다. Westlaw의 Litigation Document Analyzer는 완성된 법률 문서(brief)에 유사한 검사를 적용합니다. 이 도구는 문서를 주장별로 분할하고, 각 주장을 뒷받침하는 판례를 찾으며, 출처를 찾을 수 없을 때는 그렇게 밝힙니다.
Hron은 조작된 사례 이름(fabricated case names)이 심각한 실패 사례라고 말했습니다. 이러한 오류는 여전히 발생하며, 그 빈도는 뉴스에서 알려진 것보다 훨씬 낮다고 그는 보고 있습니다. 그가 더 잡기 어렵다고 언급한 실패 유형은 에이전트가 실제로 열어본 법률에 대한 오해석입니다. 인간의 검토가 여전히 주요 확인 수단으로 남아있습니다. 그는 코드(code)를 다룰 때와 같은 자동화된 검증 루프는 이러한 모델에는 없다고 말했습니다._
적용하기 위한 최소한의 개요일 뿐, 즉시 사용할 라이브러리는 아닙니다.
class CitationLedger:
def __init__(self):
self.opened = set()
...
법을 오해석하는 것이 정말 포착하기 어려운 나쁜 환각(hallucinations)입니다... 혹은 판사의 이 진술을 사실 대 의견으로 해석할 수 있습니다. 이러한 종류의 것들은 에이전트가 작동하는 방식을 바꿀 수 있습니다.
Joel Hron, Thomson Reuters 최고 기술 책임자(Chief Technology Officer), Chain of Thought ep 69의 발언
지속적인 사전 학습은 도구와 어떤 관계에 있나요?
지속적 사전 학습(Continuous pre-training)은 에이전트 기반 강화학습(agentic reinforcement learning)이 도구 사용을 가르치기 전에, 선택된 일부 데이터 조각(slice)에서 이루어지는 더 이른 훈련 단계입니다. 새로운 판례법(case law)은 여전히 검색 문제(retrieval problem)로 남아 있습니다.
사전 학습에 사용되는 텍스트는 Westlaw, Practical Law, Checkpoint(세금 리서치 콘텐츠), 그리고 Reuters News Archive에서 가져오며, 이들은 업무에 가장 중요한 것을 선택합니다. 그는 그 코퍼스 중 10% 미만이 적용되었다고 말했으며, 이 비율이 증가할 것으로 예상합니다. 그들은 하루에 수천 건, 아니 수십만 건의 판례를 출판하므로, 가중치(weights)만으로는 최신 상태를 유지하는 실용적인 방법이 아닙니다. 모델은 Westlaw와 세금 및 뉴스 도구를 사용하도록 훈련됩니다.
그리고 이 지점까지도, 우리는 작게 시작했지만, 지속적 사전 학습을 위해 그 코퍼스 중 10% 미만이 적용되었습니다. 따라서 이것은 시간이 지남에 따라 증가할 것이라고 생각하는 훈련 과정의 요소입니다.
Joel Hron, Thomson Reuters 최고 기술 책임자(Chief Technology Officer), Chain of Thought ep 69의 발언
FAQ
Thomson을 훈련시키는 것이 약 25%에서 70% 이상으로 변화를 가져왔나요?
아닙니다. Hron은 그 변화를 재구축된 CoCounsel 에이전트, 도구(tools), 그리고 해당 도구에 대한 기본 지침과 연결지었습니다. Thomson에게 도구를 더 직접적으로 사용하도록 훈련하는 것은 나중 단계입니다. 그가 Thomson을 위해 언급한 첫 번째 CoCounsel 사용 사례는 대량 문서 검토(bulk document review)입니다.
인용 기록(citation ledger)이 실제 사례의 오독을 잡아낼 수 있을까요?
에이전트가 검토한 사례들에 대한 주장을 근거지어 제시합니다. 조작된 이름은 여전히 낮은 비율로 발생합니다. Hron은 더 어려운 오류는 판례법의 오해석, 예를 들어 판결(holding)을 너무 광범위하게 해석하거나 판사의 진술을 사실로 간주하는 것이라고 말했습니다. 이 부분은 여전히 사람이 필요합니다.
코퍼스 중 얼마나 많은 부분이 첫 번째 지속적 사전 훈련 단계에 사용되었나요?
10% 미만이며, Westlaw, Practical Law, Checkpoint, Reuters News Archive에서 선택된 텍스트를 기반으로 합니다. Hron은 이 비율이 증가해야 한다고 말했습니다. 그는 그들의 출판 속도를 하루 수천 건, 아니 수십만 건의 사례로 언급했으므로, 검색 도구를 가중치(weights) 옆에 유지해야 한다고 했습니다.
핵심 요약 (Takeaway)
- 도메인 도구가 존재하기 전과 후에 고정된 작업 세트에서 원샷 정확도를 측정하여, 훈련 실행과는 별개로 변화를 확인하세요.
- 각 도구와 함께 기본적인 사용 설명서를 제공하세요. 이는 Hron이 CoCounsel Bench의 원샷 움직임에 연결한 조합입니다.
- 에이전트가 여는 모든 출처를 기록하세요. 로그에 없는 출처를 인용하는 답변은 거부해야 합니다.
- 검토자가 실제 사례들을 검토하여, 지나치게 광범위한 판결이나 의견이 아닌 사실로 취급된 진술이 있는지 확인하도록 하세요.
- 도구들이 작동한 후에 선택된 슬라이스에 대해 지속적 사전 훈련(continued pretraining)을 실행하고, 훈련 주기보다 빠르게 업데이트되는 자료에 대해서는 검색 기능을 유지하세요.
전체 대화 내용은 스크립트와 함께 Chain of Thought에서 확인할 수 있습니다.
에피소드 스크립트를 기반으로 AI의 도움을 받아 작성됨.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기