개방형 생성 평가를 위한 2단계 메타 루브릭: 사실적 완결성 벤치마크인 GAMUT
요약
장문 생성 모델의 사실적 완결성을 평가하기 위한 새로운 벤치마크인 GAMUT을 소개합니다. 2단계 메타 루브릭 프레임워크를 통해 복잡한 사실 관계와 콘텐츠의 구조적 중요성을 정밀하게 측정합니다.
핵심 포인트
- 사실적 완결성(Factual Completeness) 측정을 위한 2단계 메타 루브릭 도입
- 구조화된 메타 루브릭을 기계 판독 가능한 이진 체크리스트로 변환
- 웨어러블 이미지 기반 1,813개 질문 및 전문 주석 데이터셋 구축
- 프런티어 및 오픈 웨이트 모델 대상의 높은 변별력과 견고함 입증
장문 생성(long-form generations)의 사실성(factuality)을 평가하는 것은 주로 모델이 내세우는 주장이 정확한지를 측정하는 정밀도(precision)에 집중해 왔습니다. 지배적인 분해-탐색-검증(decompose-search-verify) 파이프라인은 잘못된 주장을 잘 잡아내지만, 응답이 포함해야 할 모든 정보를 담고 있는지에 대해서는 거의 알려주지 않습니다. 사실성의 나머지 절반인 사실적 완결성(factual completeness)을 측정하는 것은 더 어렵습니다. 이는 완전한 답변이 포함해야 할 전체 사실 집합을 열거해야 하며, 이러한 사실들은 평면적인 목록(flat list)을 형성하는 경우가 드물기 때문입니다. 사실들은 종종 커버리지(coverage)가 중요한 개방형 집합, 순서가 있는 프로세스, 그리고 독립적인 불리언(boolean) 체크 목록으로는 포착할 수 없는 사실 간의 관계를 포함합니다. 우리는 개방형 생성 평가를 위한 2단계 메타 루브릭(two-level meta-rubric) 프레임워크를 도입하며, 이를 장문 생성의 사실적 완결성을 위한 벤치마크인 Gamut (Grounded Assessment of Multimodal Factuality)으로 구체화합니다. 이 프레임워크는 2단계 루브릭 표현에 기반합니다. 구조화된 메타 루브릭은 필수 콘텐츠의 조직과 중요성을 포착하며, 이는 이후 LLM 판정관(judge)이 신뢰성 있게 점수를 매길 수 있는 이진(binary) 방식의 기계 판독 가능 루브릭의 평면적 체크리스트로 기계적으로 컴파일됩니다. 우리는 10개의 다양한 도메인에 걸쳐 실제 웨어러블 이미지에 기반한 1,813개의 질문을 구축하였으며, 각 질문은 전문 인간 주석가(human annotators)가 검증한 증거 기반 루브릭과 쌍을 이룹니다. 이 프레임워크는 양식 불가지론적(modality-agnostic)이기 때문에, 텍스트 전용 변형 모델도 함께 공개합니다. 14개의 프런티어(frontier) 및 오픈 웨이트(open-weight) 모델을 평가한 결과, 이 벤치마크는 진정으로 도전적이며(Gemini 3.1 Pro의 최고 점수 58.7%), 변별력이 높고, 판정관의 선택에 대해 견고(robust)하다는 것을 발견했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기