VetScore: 인용구가 포함된 수의학 장문 질의응답(Long-Form QA)을 위한 위험 가중 사실 검증
요약
수의학 분야의 신뢰성을 높이기 위해 생성된 답변의 주장이 인용된 출처와 얼마나 일치하는지 평가하는 VetScore를 제안합니다. 각 주장의 위해 가능성을 고려하여 위험 조정 점수를 계산하는 다단계 평가 방식을 사용합니다.
핵심 포인트
- 수의학 장문 QA를 위한 위험 가중 사실 검증 방법론 제시
- 주장의 위해 가능성에 따라 가중치를 부여하는 점수 체계 도입
- 작은 판사 모델로도 전문가 수준의 높은 상관관계 달성
- 평가 과정에서 높은 수준의 설명 가능성 제공
인용구 발췌본(Citation excerpts)은 생성된 출력물의 신뢰성과 인용된 출처에 대한 충실도(faithfulness)를 높이는 데 사용될 수 있으며, 이는 인간 및 수의학(veterinary medicine)과 같이 이해관계가 큰(high-stakes) 분야에서 특히 중요합니다. 그러나 이것이 생성된 주장(claims)이 제공된 발췌본에 충실하다는 것을 보장하지는 않습니다. 우리는 수의학 장문 질의응답(long-form question answering)을 위한 다단계 평가 방법인 VetScore를 제시합니다. 이는 생성된 주장이 제공된 발췌본에 의해 얼마나 잘 뒷받침되는지를 평가하도록 설계되었으며, 각 주장의 위해 가능성(harm potential)에 따라 이 정보에 가중치를 부여합니다. VetScore는 먼저 출력을 분할하여 개별 주장으로 분해한 다음, 각 주장의 위해 가능성에 따라 점수를 매기고 출처 발췌본에 대한 충실도를 평가하며, 마지막으로 전체적인 위험 조정 점수(risk-adjusted score)를 계산합니다. 우리는 전문가가 주석을 단 메타 평가(meta-evaluation) 데이터셋을 수집하고, 다양한 판사 모델(judge models)로 우리의 접근 방식을 평가하였으며, 작은 판사 모델을 사용하더라도 여러 차원에서 설명 가능성(explainability)을 제공하는 동시에 수의학 전문가와 높은 상관관계(correlations)를 달성함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기