LLM은 뱅골어 의료 시각 질의응답을 얼마나 잘 수행하는가? 데이터셋 및 벤치마킹
요약
본 연구는 뱅골어(Bangla)를 위한 의료 시각 질의응답(MedVQA) 벤치마크인 BanglaMedVQA 데이터셋을 새롭게 제안합니다. Gemini, GPT-4o mini, Gemma-3 등 주요 파운데이션 모델을 평가한 결과, 저자원 언어의 한계로 인해 전문적인 의료 추론 성능이 현저히 낮음을 확인했습니다.
핵심 포인트
- 뱅골어 특화 의료 시각 질의응답 데이터셋인 BanglaMedVQA를 최초로 소개함
- Gemini 및 GPT-4o mini와 같은 고성능 모델도 뱅골어 기반 전문 의료 진단에는 한계를 보임
- Gemma-3와 같은 오픈 소스 모델이 일반 범주에서는 우수한 성능을 보이기도 하나 복잡한 임상 질문에는 취약함
- 저자원 언어 환경에서 LLM/LVLM의 미세한 의료 추론 능력을 개선하기 위한 연구가 시급함
최근 거대 언어 모델 (LLMs) 및 거대 시각 언어 모델 (LVLMs)의 발전은 범용 시스템이 의료 분야를 포함한 복잡한 추론 작업에서 유망한 능력을 보여줄 수 있게 했습니다. 의료 시각 질의응답 (MedVQA)은 이러한 발전으로부터 특히 많은 혜택을 입었습니다. 그러나 뱅골어 (Bangla)가 전 세계적으로 가장 널리 사용되는 언어 중 하나임에도 불구하고, 이를 위한 확립된 MedVQA 벤치마크는 존재하지 않습니다. 이러한 격차를 해소하기 위해, 우리는 임상적으로 검증된 이미지-질문-답변 쌍으로 구성된 데이터셋인 BanglaMedVQA를 소개하며, 이 리소스를 활용하여 현재의 파운데이션 모델 (foundation models)에 대한 종합적인 평가를 수행합니다. 기존 영어 MedVQA 벤치마크에서 현재 모델들의 성능이 낮게 보고된 이전 연구 결과들과 일관되게, 우리의 분석은 뱅골어 성능이 실질적으로 더 낮음을 보여주며, 이는 저자원 언어 (low-resource languages)에 내재된 어려움을 반영합니다. Gemini 및 GPT-4.1 mini와 같은 최고 성능의 모델들조차 전문적인 진단 질문에 정확히 답하는 데 실패하며, 이는 미세한 의료 추론 (fine-grained medical reasoning)에서의 심각한 한계를 나타냅니다. Gemma-3와 같은 특정 오픈 소스 모델들이 일반적인 범주에서는 때때로 이러한 모델들보다 뛰어난 성능을 보이기도 하지만, 이들 역시 임상적으로 복잡한 질문에는 어려움을 겪으며, 이는 최고 수준의 평가 방법론이 시급히 필요함을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기