현재 AI 벤치마크가 측정하지 못하는 것들: 모달리티, 검색, 인용 및 안전 평가에 대한 시사점
요약
현재 LLM 벤치마크가 단일 모달리티와 정확도에만 치중되어 있음을 지적하며, 실제 배포 환경을 반영하지 못하는 한계를 분석합니다. 웹 검색 활성화 여부, API와 채팅 UI 간의 차이, 응답 일관성 및 인용 근거 등을 포함한 다각적인 평가 체계의 필요성을 제안합니다.
핵심 포인트
- 단일 모달리티와 정확도 중심 평가의 한계 지적
- 웹 검색 기능이 모델의 정확도와 성능 추세에 미치는 영향 분석
- 동일 프롬프트에 대한 응답 일관성 부족 문제 확인
- API와 채팅 UI 간의 성능 및 인용 근거 차이 발견
- 실제 배포 환경을 반영한 체계적인 AI 안전 평가 필요성 강조
대규모 언어 모델(LLM) 벤치마크 평가는 모델의 안전성, 신뢰성 및 배포 준비 상태에 대한 주장을 뒷받침하기 위해 일상적으로 사용됩니다. 하지만 대부분의 평가는 단일 접근 모달리티(모델 API)에 의존하며, 프롬프트당 단일 실행을 수행하고, 웹 검색과 같이 배포 환경에서 모델 동작에 영향을 미칠 수 있는 조건을 고려하지 않은 채 정확도를 주요 결과 측정 지표로 보고합니다. 우리는 가장 널리 사용되는 LLM 중 하나를 대상으로 이러한 가정들을 감사(audit)하며, 웹 검색 활성화 여부에 따라 두 가지 모달리티, 즉 ChatGPT의 채팅 UI와 OpenAI의 API를 비교했습니다. 우리는 BBQ와 SafetyBench라는 두 인기 있는 벤치마크에서 가져온 401개의 프롬프트에 대한 계층화된 총 샘플을 사용했으며, 프롬프트당 세 번 반복 실행하여 총 4,812개의 응답을 수집했습니다. 표준 성능 측정 지표를 넘어, 우리는 응답 일관성(response consistency), 응답 텍스트 유사성(response text similarity), 인용 근거 마련(citation grounding), 그리고 거부 행동(abstention behavior)을 포함한 모델 출력 차원들을 평가했습니다. 예를 들어, 검색 기능이 비활성화된 상태에서 두 벤치마크 모두에서 채팅 UI의 응답은 API 응답보다 정확도가 낮았습니다. 웹 검색 기능을 활성화하는 것은 정확도를 최대 8% 포인트까지 감소시켰고, 심지어 한 벤치마크에서는 모달리티 성능 추세의 방향을 역전시키기도 했습니다. 동일한 프롬프트에 대한 반복 실행은 최대 21%의 프롬프트에서 일관되지 않은 응답을 생성했습니다. 두 모달리티는 또한 다른 인용문을 기반으로 답변을 근거화했으며, 거부 행동 역시 두 모달리티 전반에 걸쳐 일관성이 부족했습니다. 이러한 결과들은 모델 제품군 내에서도 단순한 정확도 지표만을 보고하는 것이 AI 안전 평가와 관련된 중요한 모델 행동 변이 형태를 가릴 수 있음을 보여줍니다. 우리는 AI 안전 평가는 배포된 AI 시스템이 실제 환경에서 어떻게 동작하는지를 더 잘 반영하기 위해 모달리티, 다중 실행 일관성(multi-run consistency), 검색 조건, 그리고 응답 수준의 행동들을 체계적으로 고려해야 한다고 주장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기