효율성을 위한 가지치기(Pruning)와 공정성 비용: 가지치기된 Speech-LLM의 인구통계학적 불균형
요약
본 연구는 Speech-LLM 압축(가지치기) 과정에서 발생하는 인구통계학적 불균형 문제를 다룹니다. 기존의 종합 WER 지표만으로는 가지치기가 특정 그룹에 미치는 영향을 파악하기 어려우며, 실제 배포 시 공정성 문제가 발생할 수 있음을 발견했습니다.
핵심 포인트
- 가지치기는 모든 인구통계학적 그룹에 동일하게 영향을 주지 않음.
- 최고/최저 성능 그룹 간의 격차가 가지치기 과정에서 커질 수 있음.
- 배포 결정 시 종합 WER 대신 그룹별 WER을 고려해야 함.
- LoRA 적응은 일부 그룹에게 더 큰 이점을 제공할 수 있음.
Speech-LLMs는 구동하는 데 비용이 많이 들기 때문에, 실제 환경에 배포하기 위해서는 압축이 중요합니다. 하지만 압축 모델은 보통 종합 단어 오류율(WER)을 사용하여 선택되는데, 이는 가지치기가 서로 다른 인구통계학적 그룹에 어떻게 영향을 미치는지 숨길 수 있습니다. 본 연구에서는 오디오 인코더의 가지치기가 다양한 인구통계학적 그룹의 SLAM-ASR에 미치는 영향을 체계적으로 연구했습니다. Fair-Speech 및 Common Voice 데이터셋을 사용하여, 우리는 가지치기가 모든 인구통계학적 그룹에 동일하게 영향을 미치지 않으며, 폴드(fold)가 진행됨에 따라 최고 성능 그룹과 최저 성능 그룹 간의 격차가 커진다는 것을 발견했습니다. 이러한 불균형은 세 가지 인코더 스케일 모두에서 나타나지만, 초기에는 가장 큰 모델만이 종합 WER 뒤에 이를 숨깁니다. LoRA 적응(adaptation)은 모든 그룹의 WER을 개선하지만, 이미 성능이 좋은 그룹에게 더 강한 이점을 제공하고 특정 그룹에서는 격차를 넓힙니다. Common Voice English, Danish, 그리고 Dutch에서 억양 간격(accent gaps)은 지속되지만 명확하게 넓어지지는 않으며, 이는 가지치기의 공정성 효과가 데이터셋마다 다르며 직접 측정되어야 함을 보여줍니다. 우리의 발견은 가지치기된 모델의 경우, 배포 결정에 그룹별 WER을 포함해야 하며, 최저 성능 그룹의 오류율을 명시적인 기준으로 삼아야 한다고 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기