CLIF: 투명한 Bottleneck 모델을 위한 개념 수준의 영향 함수 (Concept-Level Influence Functions)
요약
딥러닝 모델의 블랙박스 문제를 해결하기 위해 샘플 및 개념 수준에서 영향 함수를 활용하는 새로운 접근 방식인 CLIF를 제안합니다. 이 방식은 훈련 샘플의 레이블과 가중치를 조정하여 재학습 없이 모델 성능을 복구할 수 있으며, Concept Bottleneck Models(CBM) 내의 핵심 개념을 식별하여 모델의 의사 결정 과정을 투명하게 만듭니다.
핵심 포인트
- 샘플 및 개념 수준의 영향 함수를 통해 NLP 모델의 해석 가능성 향상
- 영향력 있는 훈련 샘플 식별을 통한 효율적인 데이터 디버깅 가능
- 재학습 없이 레이블 및 가중치 조정을 통해 모델 성능을 베이스라인 수준으로 복구
- Concept Bottleneck Models(CBM) 내 핵심 개념 식별을 통한 모델 동작의 관찰 가능성 확보
최근 몇 년 동안 딥러닝 (Deep Learning) 모델의 블랙박스 (Black-box) 특성은 해석 가능성 (Interpretability)이 필수적인 의료 진단 및 금융과 같은 고위험 분야에서의 적용을 제한해 왔습니다. 이를 해결하기 위해, 우리는 샘플 (Sample) 및 개념 (Concept) 수준 모두에서 NLP 모델의 해석 가능성을 향상시키기 위해 영향 함수 (Influence Functions)를 사용하는 새로운 접근 방식을 제안합니다. CEBaB 및 Yelp 데이터셋에 대한 실험 결과, 영향 함수가 모델 예측에 도움이 되거나 해가 되는 가장 영향력 있는 훈련 샘플을 효과적으로 식별함을 보여줍니다. 이러한 샘플들의 레이블 (Labels)과 가중치 (Weights)를 조정함으로써, 재학습 (Retraining) 없이도 모델 성능을 베이스라인 (Baseline) 수준으로 복구할 수 있음을 입증하였으며, 이는 효율적인 데이터 디버깅 (Data Debugging)을 위한 영향 함수의 가치를 확인시켜 줍니다. 나아가, 우리의 개념 수준 분석은 예측에 유의미한 영향을 미치는 개념 병목 모델 (Concept Bottleneck Models, CBM) 내의 핵심 개념들을 식별합니다. 이러한 개념들을 수정하면 모델의 동작이 관찰 가능하게 변화하며, 이는 의사 결정 과정에 대한 명확한 통찰력을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기