동일 숫자 인용 스와프: 재무 증거 판정가로서 Jev 스트레스 테스트
요약
본 연구는 LLM이 생성한 재무 보고서에서 단순 계산의 정확성을 넘어, 잘못된 재무 역할을 인용하는 문제를 다룹니다. Jev를 활용하여 출처 지원 검증기를 개발하고, 확률적 증거 검증이 수치 일치 이상의 어떤 가치를 제공하는지 평가했습니다.
핵심 포인트
- LLM은 계산적으로 정확해도 잘못된 재무 역할을 인용할 수 있습니다.
- Jev를 이용한 출처 지원 검증기는 단순 숫자 일치보다 더 많은 정보를 제공합니다.
- 재무 보고서의 역할 인식 오류와 유효 인용 유지 사이의 상충 관계가 존재합니다.
재무 보고서는 기간, 지표 및 회계 계정에 걸쳐 반복되는 값을 포함하며, 이는 LLM이 생성한 계산이 수치적으로는 정확하지만 잘못된 재무 역할을 인용할 수 있게 합니다. 우리는 GPT-4.1-mini의 계산 추적에 대한 출처 지원 검증기(source-support verifier)로서 Jev를 사용하여, 확률적 증거 검증이 단순 숫자 일치 이상의 무엇을 추가하는지 평가합니다. 서명된 포인터에서의 숫자 기반 기준선은 정확한 인용 확인보다 대부분의 복구율을 설명합니다. 남아 있는 역할 인식 문제를 격리하기 위해, 우리는 피연산자와 산술 연산을 고정하고, 동일한 숫자가 포함된 셀 사이에서 인용을 이동시키며, 동등한 사실을 표현하는 제어(controls)를 유지합니다. 이러한 대조는 통과하는 잘못된 역할 인용과 보류되는 유효한 대체 인용 모두를 드러냅니다. 명시적인 열 레이블은 선택된 잘못된 역할 결정 능력을 향상시키는 동시에 일부 등가 증거에 대한 지원을 낮춥니다. 비(非)저자 검토자가 레이블링한 36개의 새로운 출처 페이지에 대해 구성된 후속 연구는 이러한 평가를 확장하고, 역할 오류 감지와 유효 인용 유지 사이의 동일한 상충 관계를 노출합니다. 본 기여는 수치적 일치가 고정되었을 때 확률적 재무 검증기가 무엇을 구별하는지를 식별하는 통제된 평가입니다. LLM 기반 금융 비서에게 있어, 이는 수치적 정확성, 인용된 역할 지원 및 수용 결과를 개별적으로 평가할 수 있게 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기