표지를 보고 판단하기: 표면적 특징 누출을 방지하기 위한 LLM 진실성 벤치마크 정제
요약
본 논문은 LLM 진실성 벤치마크가 표면적 특징 누출에 취약할 수 있음을 지적합니다. 단순한 로지스틱 분류기만으로도 정답과 오답을 분리하는 현상을 발견했으며, 이에 대응하여 'Audit-Prune'이라는 메커니즘을 개발했습니다. 이 메커니즘은 표면 특징 누출이 최소화된 새로운 TruthfulQA 버전을 제공합니다.
핵심 포인트
- LLM 진실성 벤치마크는 표면적 특징 누출에 취약할 수 있습니다.
- 단순 분류기로도 정답/오답 구분이 가능하여 모델의 추론 능력을 과대평가할 위험이 있습니다.
- 'Audit-Prune' 메커니즘으로 데이터셋을 정제하는 방법을 제시했습니다.
- 표면 특징 누출이 감소된 TruthfulQA 버전을 공개합니다.
이진 선택형 진실성 벤치마크는 모델에게 정답과 오답 중 하나를 선택하도록 요구하지만, 만약 두 답변이 표면적인 특징에서 체계적으로 다르다면, 모델은 의도된 추론을 수행하지 않고도 우연 이상의 성능을 보일 수 있습니다. 우리는 이러한 실패 모드가 감지 가능하며 다운스트림 분류기(classifier)에 의해 악용될 수 있음을 보여줍니다. TruthfulQA에서는 간단한 6개 특징의 로지스틱 분류기가 정답과 오답을 분리하는 데 상당한 정확도를 달성합니다. 나아가 우리는 유사한 표면적 인공물(artifact)이 추가적인 벤치마크에도 존재함을 보여줍니다. 이에 대응하기 위해, 우리는 가장 누출을 강화하는 쌍(pair)들을 제거하여 이를 정제하는 일반적인 메커니즘을 개발했습니다. 우리는 표면 특징 누출이 우연에 가깝게 감소된 TruthfulQA 버전을 공개하고, 데이터셋이 공개되기 전에 정제될 수 있도록 Audit-Prune이라는 메커니즘을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기