사용자가 틀린 답을 고집할 때는 거부하지만, '검증된 출처'가 제시하면 같은 오답을 수용하는 LLM의 권위 편향(Authority Bias)
요약
본 논문은 LLM이 사용자의 잘못된 주장을 거부하는 반면, '검증된 출처'가 제시하면 같은 오답을 수용하는 현상을 발견하고 이를 권위 편향(Authority Bias)이라 명명했습니다. 이 현상은 AI 에이전트의 자율성이 높아지면서 도구 기반 정보에 과도하게 의존할 위험성을 보여주므로, 잘못된 출처에 대한 대비가 중요합니다.
핵심 포인트
- LLM은 사용자 주장보다 '검증된 출처'를 더 신뢰하는 경향을 보입니다.
- 이 현상을 권위 편향(Authority Bias)이라 명명하고 그 심각성을 지적했습니다.
- AI 에이전트의 자율성 증가에 따라 도구 기반 정보 오도 위험성이 커지고 있습니다.
- 잘못된 출처가 모델 답변에 미치는 영향을 정량적으로 측정했습니다.
저는 이 논문의 저자 중 한 명입니다. 저희는 사용자가 틀린 답을 고집할 때는 입장을 지키다가도, 동일한 주장이 '검증된 출처'에서 나온 것으로 제시되면 답변을 바꾸는 모델들을 계속 목격했습니다. 저희는 이러한 현상이 얼마나 자주 발생하는지 측정하고, 모델이 두 가지 경우를 다르게 표현하는지 확인하고자 했습니다. 저희는 이 효과를 권위 편향(Authority Bias)이라고 명명했습니다. 왜 이것이 중요하다고 생각하는가? 표준적인 아첨성 평가(sycophancy evals)는 사용자 측면에서 압력을 가하기 때문에, 모델은 이를 통과하면서도 검색 결과, 검색된 문서 및 도구 출력 등을 통해 쉽게 오도될 수 있습니다. 또 다른 이유는 현재 AI 연구가 더 에이전트적이고 자율적인 모델 쪽으로 가속화되고 있으며, 도구가 그 흔적을 숨기고 사용자(사용자가 수정하려고 할 수도 있는)보다 도구를 '더' 신뢰하는 사례들이 발생하고 있기 때문입니다. 따라서 도구로부터의 잘못된 정보에 대비하는 것이 특히 중요합니다! 설정. 저희는 모델이 이미 올바르게 답변할 수 있는 TriviaQA 질문들을 사용했습니다. 각 질문에는
모델 내부에서 (오픈 웨이트 모델만, 평균 차이 방향 사용) Qwen3.5, GPT-OSS 및 OLMo-3.1에서 '출처가 보증함(source endorsed this)' 방향을 제거하면 잘못된 출처에 대한 준수도가 6478점 감소합니다. '사용자가 보증함(user endorsed this)' 방향을 제거하면 최대 11점 감소합니다. 두 방향은 또한 약 0.900.99의 매우 높은 코사인 유사도를 가집니다. 저희는 이들이
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Research의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기