선택적 컨텍스트 선호 최적화를 통한 신뢰 시점 학습
요약
언어 모델이 잘못된 외부 신호에 휘둘리지 않으면서도 유용한 컨텍스트는 수용할 수 있도록 하는 '선택적 신뢰' 연구를 소개합니다. 새로운 벤치마크 MIST와 지표 SC2W를 통해 모델의 취약성을 평가하고, SCOPE 방법론을 통해 모델의 강건성과 정확도를 동시에 개선합니다.
핵심 포인트
- 잘못된 신호에 저항하면서 유용한 컨텍스트는 활용하는 '선택적 신뢰' 개념 정의
- 인간 주석 기반의 MIST 벤치마크 및 SC2W 지표 제안
- DPO를 활용한 SCOPE 방법론으로 모델의 오답률 감소 및 정확도 유지
- 단순 저항성보다 선택적 신뢰 관점의 모델 평가 필요성 강조
언어 모델(Language models)은 외부 신호에 의존하여 답변을 생성하는 경향이 강하며, 단 하나의 오해의 소지가 있는 신호만으로도 정확한 답변을 잘못된 것으로 바꿀 수 있습니다. 이러한 신호에 저항하도록 모델을 훈련시키는 것은 분명한 해결책처럼 보이지만, 한 가지 실패 모드를 숨기고 있습니다. 즉, 모든 컨텍스트를 무시하는 모델은 강건해 보일지라도, 그 컨텍스트가 신뢰할 만한 가치를 지닐 때는 쓸모없다는 것입니다. 우리는 이 문제를 선택적 신뢰(selective trust)로 재정의하고, 각 추론 항목을 네 가지 일치 조건(clean, misleading, correct-context, irrelevant-context) 하에서 평가하는 인간 주석 기반 벤치마크인 MIST를 소개합니다. 또한, 오해의 소지가 있는 신호가 깨끗한 올바른 답변을 잘못된 답변으로 바꾸는 빈도를 계산하는 쌍별 지표(paired metric)인 SC2W도 함께 제시합니다. 포괄적인 벤치마크 연구를 통해 우리는 이러한 취약성이 보편적임을 관찰했습니다. 이에 따라, 우리는 SCOPE를 제안하는데, 이는 깨끗한 올바른/오해의 소지가 있는 잘못된 사례(clean-correct/misleading-wrong failures)를 채굴하고, 오직 오해의 소지가 있는 항목에 대해서만 최적화하는 대신 네 가지 모든 조건에 걸쳐 균등하게 균형을 맞춘 매칭 선호 쌍(matched preference pairs)에 대해 표준 직접 선호 최적화(Direct Preference Optimization, DPO) 목적 함수를 최적화합니다. 우리의 접근 방식은 인기 있는 오픈 소스 모델의 SC2W를 크게 줄이는 동시에, 추가된 컨텍스트가 깨끗하거나 올바르거나 관련이 없을 때 정확도를 유지합니다. 본 연구를 통해 우리는 모델을 단지 저항성만으로 판단할 것이 아니라 선택적 신뢰(selective trust)로 평가해야 한다고 주장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기