벤치마크 평가하기: 대화형 에이전트(Conversational Agents)를 위한 벤치마크 평가
요약
대화형 에이전트 벤치마크의 품질을 평가하기 위한 새로운 참조 없는(reference-free) 프레임워크를 제안합니다. LLM 판사를 활용하여 벤치마크의 일관성, 복잡성, 정책 범위를 측정하고 약점을 진단합니다.
핵심 포인트
- LLM 판사를 이용한 벤치마크 품질 평가 프레임워크 소개
- 벤치마크의 일관성, 복잡성 및 정책 범위(policy coverage) 측정
- 인간 주석과의 높은 일치성 및 다양한 도메인에서의 검증 완료
- 합성 및 수동 선별 벤치마크 모두에 적용 가능한 실용적 접근법
태스크 지향적 대화형 에이전트(Task-oriented conversational agents)는 선별되거나 자동으로 생성된 벤치마크를 사용하여 평가되지만, 벤치마크의 품질은 거의 평가되지 않습니다. 품질이 낮은 벤치마크는 일관성 없는 태스크, 단순한 시나리오 또는 제한된 정책 범위(policy coverage)를 포함할 수 있으며, 이는 신뢰할 수 없는 평가로 이어질 수 있습니다. 우리는 LLM 판사(LLM judges)를 사용하여 벤치마크의 일관성, 복잡성 및 정책 범위(policy coverage)를 평가하는 동시에 약점에 대한 실행 가능한 진단을 제공하는 참조 없는(reference-free) 프레임워크를 소개합니다. 우리는 독립적인 인간 주석(human annotations)과의 일치성을 입증하고, 다양한 능력을 가진 LLM에 의해 생성된 벤치마크 및 통제된 품질 저하 섭동(quality-degrading perturbations)을 가한 벤치마크를 평가함으로써 이 프레임워크를 검증합니다. 다양한 도메인과 판사 모델(judge models)에 걸쳐, 제안된 지표는 벤치마크 품질 수준을 일관되게 구분해냅니다. 나아가 우리는 수동으로 선별된 벤치마크에 대한 프레임워크의 적용 가능성을 입증합니다. 우리의 프레임워크는 합성(synthetic) 및 수동으로 선별된 대화형 에이전트 벤치마크를 평가하기 위한 실용적인 접근 방식을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기