전이되지 않는 안전성: 배포 가능한 의료용 언어 모델의 교차 언어적 임상 정확도 드리프트 (Cross-Lingual Clinical
요약
영어 기반의 LLM 안전성이 저자원 언어인 하우사어 환경에서 어떻게 변화하는지 연구했습니다. 실험 결과, 로컬 배포 가능한 소규모 모델들은 영어 대비 하우사어 사용 시 임상 정확도가 급격히 하락하는 '드리프트' 현상을 보였습니다.
핵심 포인트
- 영어의 임상 안전성이 저자원 언어(하우사어)로 전이되지 않음
- 소규모 로컬 배포 모델에서 심각한 임상 정확도 저하 발생
- 성능 저하의 원인은 언어 자체보다 모델 규모(Deployable tier)의 특성임
- 프런티어 모델은 상대적으로 언어 간 성능 격차가 적음
대규모 언어 모델 (LLM)의 안전성 평가는 주로 영어로, 그리고 주로 프런티어 (Frontier) 시스템을 대상으로 수행됩니다. 하지만 이러한 조건은 소규모 양자화 (Quantised) 시스템이 로컬에서 실행되고 현지 언어로 질의되는 저자원 의료 환경에서 해당 모델들이 어떻게 마주하게 되는지를 설명하지 못합니다. 우리는 영어로 확립된 임상적 안전성이 하우사 (Hausa) 어로 전이되는지, 그리고 발생하는 실패가 언어 때문인지, 임상 작업 때문인지, 아니면 저자원 배포가 허용하는 모델의 클래스 때문인지를 묻습니다. 나이지리아 북부의 부담이 큰 세 가지 상황인 말라리아, 겸상 적혈구 질환 (Sickle cell disease), 결핵에 대해 매칭된 영어-하우사 질문 쌍을 구축하여 지식 회상 (Knowledge recall), 응급 분류 (Emergency triage), 금기된 행동을 유도하는 유도 질문, 그리고 전통 요법 주장 여부를 조사했습니다. 총 6개의 모델을 평가했습니다: 의료 분야로 미세 조정 (Fine-tuned)된 2개와 프런티어 시스템 1개를 포함하여, 40억~90억 개의 파라미터(Parameters)를 가진 로컬 배포 가능 시스템 5개입니다. 128개의 모든 응답은 서로를 모르는 상태에서 독립적으로 작업하는 두 명의 유창한 하우사어 화자에 의해 나이지리아 국가 치료 가이드라인을 기준으로 채점되었습니다. 로컬 배포 가능 모델들 사이에서, 평균 임상 정확도는 정답이 2점, 적극적으로 해로운 답변이 -1점인 척도에서 영어의 1.57점에서 하우사어의 -0.03점으로 떨어졌습니다. 프런티어 모델은 2.00에서 1.75로 이동했으며, 두 언어 모두에서 해로운 것으로 판단된 응답을 생성하지 않았습니다. 드리프트 (Drift) 현상은 세 가지 상황 모두에서 일관되게 나타났습니다. 평가자 간 일치도 (Inter-rater agreement)는 임상 정확도에 대해서는 상당 수준이었으나 (kappa = 0.70), 위해성에 대한 일치도는 초기에는 낮았으며 (kappa = 0.22) 이에 대해 자세히 조사되었습니다. 프런티어 모델이 하우사어로 동일한 질문에 유능하게 답변한다는 점을 고려할 때, 이러한 결핍은 언어나 임상 자료의 특성이 아니라, 배포 가능한 계층 (Deployable tier)의 특성입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기