FriendBench: 인간과 멀티모달 거대 언어 모델(Multimodal Large Language Models)의 이자 관계 친밀도 추론
요약
멀티모달 거대 언어 모델(MLLM)이 대화 클립을 통해 두 사람의 친밀도를 추론하는 능력을 평가하는 새로운 벤치마크 FriendBench를 소개합니다. 26개 모델을 대상으로 텍스트, 오디오, 비디오 모달리티를 분석하여 인간과 모델의 추론 방식 차이를 규명했습니다.
핵심 포인트
- FriendBench: 대화 상호작용을 통한 친밀도 추론 벤치마크 제안
- 7개 기업 26개 모델의 멀티모달 성능을 인간 패널과 비교 분석
- 최상위 모델은 인간과 유사한 정확도를 보이나 '낯선 사람'으로 편향되는 경향 확인
- 인간은 언어 외 가시적 행동을 통해 추론 성능을 높이는 특징을 보임
- 자극물, 인간 평가 데이터 및 모델 예측값 공개
사회적 상황을 읽는 것은 종종 말뿐만 아니라 행동에 달려 있습니다. 우리는 두 사람이 이미 친숙한 사이인지 아니면 낯선 사람으로서 만나는 것인지를 20초 분량의 이자 관계(dyadic) 아이스브레이킹 대화 클립을 통해 추론하는 벤치마크인 FriendBench를 소개합니다. 모든 쌍(pair)은 동일한 유형의 프롬프트(prompt)에 답하므로, 오직 상호작용 방식만이 정답을 드러낼 수 있습니다. 텍스트, 오디오, 비디오 전반에 걸쳐, 우리는 7개 기업의 26개 모델을 96개의 균형 잡힌 이자 관계에 대해 매칭된 인간 패널과 비교합니다. 가장 우수한 모델과 인간 군집은 모든 모달리티(modality)에서 정확도 측면에서 통계적으로 구별할 수 없을 정도의 차이를 보였으나, 그 정확도에 도달하는 방식은 달랐습니다. 인간은 두 가지 답변에 대해 균형을 유지하는 반면, 가장 강력한 모델들은 "낯선 사람(stranger)" 쪽으로 치우치는 경향을 보였습니다. 이는 변별력의 문제가 아니라 유효 사전 확률(effective prior)의 차이입니다. 더 풍부한 채널은 양측 모두에게 불균등하게 도움을 주며, 오직 인간만이 언어 외에 가시적인 행동을 통해 이득을 얻습니다. 우리는 자극물(stimuli), 인간의 평가, 그리고 모델의 예측값을 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기