국가 표준 문서의 규칙 집약적 검토를 위한 LLM 벤치마킹 및 강화
요약
국가 표준 문서와 같이 규칙 집약적인 문서를 검토하기 위한 새로운 벤치마크인 GB/T-Bench와 멀티 에이전트 프레임워크 GB/T-Reviewer를 제안합니다. 기존 벤치마크가 놓치기 쉬운 문서의 구조적 일관성과 규범적 규칙 준수 능력을 정밀하게 평가하고 개선하는 데 중점을 둡니다.
핵심 포인트
- 국가 표준 문서 검토를 위한 최초의 벤치마크 GB/T-Bench 소개
- 25가지 오류 유형을 포함하는 계층적 검토 분류 체계 구축
- 결정론적 규칙과 LLM 재작성을 결합한 반례 생성 메커니즘 활용
- 멀티 에이전트 프레임워크 GB/T-Reviewer를 통한 검토 성능 향상
대규모 언어 모델 (LLMs)은 점점 더 복잡한 전문 업무를 지원하고 있지만, 규칙 집약적인 문서 검토 (rule-intensive document review)에서의 능력은 여전히 충분히 평가되지 않은 상태입니다. 중국 GB/T 표준과 같은 국가 표준 문서는 대표적인 테스트베드를 제공합니다. 이러한 문서들은 분량이 길고, 고도로 구조화되어 있으며, 범위, 용어, 규범적 문구 및 섹션 간 일관성에 대한 명시적인 규칙을 따릅니다. 기존의 벤치마크 (benchmarks)는 도메인 지식과 질의응답에 집중되어 있어, 전문 문서에 대한 본질적인 품질 검토를 크게 간과하고 있습니다. 이러한 검토는 인간 전문가에게 크게 의존하므로 비용이 많이 들고 확장하기 어렵습니다. 이 격차를 해소하기 위해, 우리는 국가 표준 문서의 구조적 검토를 위한 최초의 벤치마크인 GB/T-Bench를 소개합니다. GB/T-Bench의 GB/T 검토 분류 체계 (GB/T Review Taxonomy)는 문서 구조, 범위 일치, 규범적 양태 (normative modality), 용어 일관성 및 규범적 참조를 다루는 계층적 스키마 (schema)로, 25가지의 진단 가능한 오류 유형을 포함합니다. 제어 가능한 반례 생성 메커니즘은 결정론적 규칙 (deterministic rules)과 제약 조건이 있는 LLM 재작성 (rewriting)을 결합하여 488개의 문서를 7,306개의 추적 가능한 검토 오류 사례로 처리합니다. 우리는 또한 오류 위치, 검토 차원, 오류 유형에 대한 정확한 일치를 요구하며, 문서 수준의 커버리지 지표를 포함하는 진단 중심의 평가 프로토콜을 개발했습니다. 나아가 우리는 검토 지식을 전문적인 기술로 변환하고 전역 검사, 타겟 진단, 규칙 스캐닝 및 결과 검증을 조정하는 멀티 에이전트 프레임워크 (multi-agent framework)인 GB/T-Reviewer를 제안합니다. 14개의 주요 LLM을 대상으로 한 실험 결과, 상당한 인간-LLM 격차가 드러났습니다. 가장 강력한 모델은 전문가의 0.6640 CMCS에 비해 0.3280 CMCS만을 달성했습니다. GB/T-Reviewer는 최고 CMCS를 0.5094로 높였으며, 이는 규칙 집약적인 문서 검토를 위한 구조화된 기술 조정의 가치를 보여줍니다. 본 연구는 표준화 및 기타 고위험 문서 도메인에서 신뢰할 수 있는 AI를 위한 길을 열어줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기