9,400만 명의 하우사어(Hausa) 사용자, 그럼에도 AI는 여전히 그들을 거의 이해하지 못한다. 3년간의 풀뿌리 활동을 통해 배운 것들
요약
하우사어와 같은 저자원 언어가 LLM에서 성능이 낮은 기술적 이유를 분석합니다. 단순 데이터 부족을 넘어 표기법 불일치, 문자 체계의 이원화, 코드 스위칭 문제로 인해 발생하는 데이터 품질 저하 문제를 다룹니다.
핵심 포인트
- 표준 표기법과 비공식 표기법 간의 불일치로 인한 음소 정보 누락
- Boko와 Ajami라는 두 가지 문자 체계 사용에 따른 데이터 편향
- 영어 및 아랍어 혼용(Code-switching)으로 인한 언어적 복잡성
- 부적절한 데이터로 인한 토크나이저 파편화 및 추론 효율 저하
하우사어(Hausa)는 나이지리아에서만 약 9,400만 명에 가까운 사람들이 사용하며, 니제르와 더 넓은 사헬(Sahel) 지역 전역에 수천만 명이 더 사용하고 있습니다. Nature는 ChatGPT와 LLM(대규모 언어 모델)이 하우사어로 작성된 문장의 10~20%만을 정확하게 이해한다고 보고했습니다.
저는 지난 3년 동안 그 격차를 줄이기 위해 노력해 왔습니다. 처음에는 혼자 시작했지만, 이후 바우치(Bauchi) 주에 제가 설립한 커뮤니티와 함께하며 현재는 500명 이상의 규모로 성장했습니다. 이것은 단순한 프로젝트 회고록이 아닙니다. 업계가 조용히 훈련 데이터(training data)를 들일 가치가 없다고 결정해 버린 언어를 위한 언어 기술(language technology)을 구축하는 데 실제로 무엇이 필요한지, 그리고 그 일을 저와 함께 수행하는 사람들을 이끄는 과정에서 무엇을 배웠는지에 대한 솔직한 기록입니다.
격차가 존재하는 이유, 그리고 웹 스크래핑(scraping)이 해결책이 될 수 없는 이유
하우사어의 AI 격차에 대한 쉬운 설명은 "데이터가 충분하지 않다"는 것입니다. 맞는 말이지만, 이는 문제의 심각성을 과소평가하는 것입니다. 하우사어는 단순한 데이터 수집만으로는 단순히 부족한 것을 넘어, 오히려 잘못된 정보를 제공하게 만드는 기술적 특성을 가지고 있습니다.
먼저 철자법(orthography)부터 시작해 보겠습니다. 표준 하우사어 표기법은 표준 키보드에는 존재하지 않는 세 개의 갈고리 모양 자음인 ɓ, ɗ, ƙ를 사용합니다. 공식적이고 편집된 텍스트에는 이 글자들이 포함되어 있습니다. 하지만 웹을 실제로 지배하고 있는 비공식적인 하우사어(소셜 미디어, SMS, WhatsApp, 사람들이 실제로 사용하는 키보드)에서는 이 글자들이 일상적으로 일반 b, d, k로 평탄화됩니다. 오픈 웹(open web)에서 하우사어 데이터를 스크래핑하면, 상당수의 예시에서 음소 정보(phonemic information)가 조용히 누락된 코퍼스(corpus)를 얻게 되며, 이 격차는 토크나이저(tokenizer)부터 텍스트 음성 변환(text to speech) 모델에 이르기까지 이를 기반으로 학습된 모든 것에 전파됩니다.
다음은 문자 체계(script)입니다. 하우사어는 한 세기 넘게 두 가지 체계로 작성되어 왔습니다. 현재 표준인 라틴 기반 문자인 보코(Boko)와, 여전히 종교 및 문학적 맥락에서 사용되는 아랍어 기반 문자인 아자미(Ajami)입니다. 보코(Boko) 소스만으로 구축된 데이터셋은 이미 실제 쓰여진 언어의 상당 부분을 배제하고 있는 셈입니다.
다음은 코드 스위칭 (code-switching) 문제입니다. 일상적인 하우사어, 특히 온라인상의 하우사어는 영어를 자유롭게 혼용하며, 이슬람 학문 전통으로부터 유래된 아랍어 차용어 (Arabic loanwords)의 오랜 역사를 담고 있습니다. 하우사어를 깨끗하고 고립된 언어로 취급하는 모델은 이 언어가 실제로 어떻게 사용되는지를 놓치게 됩니다.
이러한 요소들을 종합해 보면, "저자원 언어 (low-resource language)"라는 말은 "하우사어 데이터가 충분하지 않다"는 의미보다는 "스크래핑 (scraping)하기 쉬운 하우사어는 실제 사람들이 말하는 하우사어의 퇴락한 표본이다"라는 의미에 더 가깝게 보이기 시작합니다. 동일한 퇴락한 표본으로 학습된 표준 다국어 토크나이저 (multilingual tokenizers)는 하우사어 단어를 그에 상응하는 영어 문장이 필요로 하는 것보다 훨씬 더 많은 서브워드 (subword) 조각으로 파편화합니다. 이는 토큰당 모델이 학습할 수 있는 깨끗한 예시가 적어지기 때문에, 추론 (inference) 비용을 높이고 생성 (generation) 품질을 눈에 띄게 저하시킵니다.
이것이 실제 문제입니다. "AI가 하우사어를 모른다"가 아닙니다. AI는 얇고 평면화된 버전의 하우사어를 제공받아 왔으며, 그 결과가 나타나고 있는 것입니다.
내가 실제로 시작한 지점, 그리고 왜 LLM으로 시작하지 않았는가
나는 2022년 10월, 아부바카르 타파와 발레와 대학교 (Abubakar Tafawa Balewa University)에서 AI Bauchi를 설립했습니다. 설립 첫날부터 변하지 않은 미션은 AI를 외부에서 소비하기만 하는 것이 아니라, 바우치 주 (Bauchi State) 내부에서 토착화하고 접근 가능하게 만드는 것이었습니다. 언어 관련 작업은 그 미션에서 파생된 것이지, 그 반대가 아니었습니다.
유혹적인 행보이자, 자금력이 풍부한 이니셔티브들이 보여주는 방식은 첫날부터 "하우사어 LLM"을 발표하는 것입니다. 나는 그렇게 하지 않았고, 자원봉사 커뮤니티가 그렇게 해서도 안 된다고 생각합니다. 완전한 생성형 언어 모델 (generative language model)이 그 이름값을 하려면 엄청난 양의 깨끗한 데이터와 컴퓨팅 자원 (compute)이 필요합니다. 본업이 있는 자원봉사자 커뮤니티와 단체 채팅방이 실제로 가진 것은 시간, 원어민의 지식, 그리고 더 어려운 기초 작업이 밑바탕에서 구축되는 동안 좁지만 유용한 무언가를 출시할 수 있는 능력입니다.
따라서 그 순서는 의도적이었습니다. 우선 하우사어 텍s-to-speech (TTS) 모델을 구축했는데, 이는 철자법 (orthography)과 발음 문제를 직접적으로 해결하도록 강제하기 때문입니다. 그와 동시에 하우사어-사야와어 (Hausa to Sayawa) 번역기를 병행했는데, 이는 팀이 하우사어를 단순히 영어와 비교하는 대신 다른 토착 언어와의 관계 속에서 생각하도록 만들기 위함입니다. 그리고 이 두 가지를 프로젝트 외부의 개발자도 실제로 가져와 사용할 수 있는 형태로 변환해 주는 미디어 처리 라이브러리인 HausaMediaLab을 만들었습니다. 이 각각의 프로젝트는 남들에게 깊은 인상을 남기기 위해서가 아니라, 실제로 출시(ship)하는 것에 초점을 맞추어 범위를 설정했습니다. 또한 각 프로젝트는 부산물로서 더 깨끗하게 라벨링된 데이터 (labeled data)를 생성하며, 이는 결국 더 야심 찬 언어 모델 (language model)이 필요로 하는 바로 그 연료가 됩니다.
실제로 어려운 부분: 단순한 엔지니어 이상의 팀을 구축하는 것
다른 기술 리더에게 제가 가장 강력하게 옹호할 결정은 바로 이것입니다. TTS 프로젝트의 기여자들은 단순히 머신러닝 (machine learning) 엔지니어들만이 아니라는 점입니다. 그들은 ML 엔지니어, 데이터 과학자 (data scientists), 언어학자 (linguists), 그리고 소프트웨어 개발자들이 의도적으로 함께 협력하고 있습니다.
이것은 단순히 다양성을 존중하기 위한 미덕이 아니라, 엔지니어링 측면에서의 요구 사항입니다. ML 엔지니어는 텍스트-음성 변환 (text to speech) 파이프라인을 구축할 수 있습니다. 하지만 팀에 언어학자가 없는 ML 엔지니어는 성조 표기 (tone marking)나 결합 자음 (hooked consonants)을 미묘하게 틀리게 만들 수 있으며, 이는 해당 언어를 모국어로 사용하지 않는 사람에게는 보이지 않지만, 모국어 사용자에게는 명백하게 드러나는 문제입니다.
그 밑바탕에는 두 번째 표현 (representation) 문제가 깔려 있습니다. 바로 '어떤 하우사어인가' 하는 점입니다. 이 언어는 실제 방언적 변이 (dialectal variation)를 포괄합니다. 흔히 표준으로 취급되는 카노 (Kano) 방언이 이 언어가 실제로 사용되는 유일한 버전은 아닙니다. 특정 지역의 음성에 기반해 훈련된 단일 합성 음성 (synthetic voice)은 다른 모든 사람들에게 그들의 하우사어가 표준에서 벗어난 변종이라는 메시지를 조용히 전달하게 됩니다. 회의실에 언어학자가 있는 이유는 이러한 문제가 출시된 후가 아니라, 출시되기 전에 이를 잡아내기 위함입니다.
따라서 구조는 다음과 같습니다: 주간 진행 상황 회의, 원어민의 언어적 결정 검토, 엔지니어의 모델 검토, 그리고 초기 기여자 몇 명이 바빠질 때 기여자 파이프라인 (contributor pipeline)이 고갈되지 않도록 신규 참여자를 위해 이슈(issue)가 명시적으로 태그된 공개 저장소 (public repo)로 구성됩니다. 언어 프로젝트와 병행하여, 저희는 해당 파이프라인을 성장시키기 위해 특별히 마련된 11주 과정의 AI 부트캠프 (AI bootcamp)와 6주 과정의 컴퓨터 비전 (computer vision) 부트캠프를 운영합니다. 난도가 높은 프로젝트에 참여하는 대부분의 기여자는 먼저 이러한 코호트 (cohort) 중 하나를 통해 성장했습니다.
저장소 외부에서의 모습
만약 제가 모델에 대해서만 이야기한다면, 실제로 무엇이 움직였는지를 과소평가하는 것이 될 것입니다. 실제적인 영향력으로서 제가 꼽고 싶은 몇 가지 사항은 다음과 같습니다:
저는 2023년에 6개월 동안 NITDA의 AI 개발자 교육 (AI Developer Training) 강사로 활동했습니다. 이는 AI Bauchi의 작업을 이끄는 아이디어들이 단 하나의 커뮤니티 안에 머물지 않고, 국가적 교육 코호트 (training cohort)에 도달했음을 의미합니다. DevFest Bauchi 2023에서 저는 "토착 AI의 민주화 (Democratizing Indigenous AI)"라는 주제로 강연을 했습니다. 하우사어 (Hausa)를 구체적으로 생각해 본 적이 없는 대다수의 일반 개발자들에게, 포용적인 AI 개발은 자신이 서비스한다고 주장하는 커뮤니티의 언어적, 문화적 뉘앙스를 존중하는 것에서부터 시작되어야 한다는 논거를 제시했습니다. 2025년에는 더 많은 젊은 여성들이 이 파이프라인에 조기에 진입할 수 있도록 설계된 EmpowerHer AI Bauchi를 운영했습니다. 왜냐하면 이미 스스로를 엔지니어로 인식하는 사람들만을 모집하는 커뮤니티는 계속해서 동일한 사각지대 (blind spots)를 만들어내기 때문입니다. 또한 저희는 이러한 활동을 대학 밖으로 완전히 확장하여, I-Scholars International Academy의 중고등학생들을 나이지리아 국립 인공지능 및 로봇 공학 센터 (NCAIR)로 초청해 STEM 견학을 진행했습니다. "누가 이것을 구축할 것인가"를 바로잡아야 할 가장 이른 시점은 누군가가 전공을 선택하기 전이기 때문입니다.
이 중 그 어떤 것도 커밋 히스토리 (commit history)에는 나타나지 않습니다. 하지만 이 모든 것들이 바로 커밋 히스토리가 존재하는 이유입니다.
더 큰 그림 속에서의 위치
2025년, 나이지리아 연방 정부는 NITDA와 NCAIR를 통해 요루바어(Yoruba) 및 이보어(Igbo)와 함께 하우사어(Hausa)를 포함하는 자체 다국어 모델(multilingual model) 프로젝트를 공개했습니다. 이는 매우 긍정적인 일이며, AI Bauchi가 2023년부터 공개적으로 작업해 온 문제에 대해 막대한 자금이 투입된 거대한 검증이라고 볼 수 있습니다.
저는 저희와 같은 풀뿌리(grassroots) 활동이 그러한 국가적 노력과 경쟁한다고 생각하지 않습니다. 오히려 그것이 국가적 노력을 정직하게 유지해 주는 역할을 한다고 생각합니다. 연방 정부의 자금을 지원받는 모델은 빠르게 움직이며 넓은 범위를 다룰 수 있습니다. 하지만 언어학자들이 참여하고 원어민이 모든 성조 기호(tone mark)를 검토하는 커뮤니티 구축 모델은, 속도에 치중한 버전이 이미 오픈 웹(open web)에서 뭉개버린 미묘한 뉘앙스(nuance)를 다시 한번 평면화하지 않도록 보장하는 역할을 합니다. 두 가지 모두 필요합니다. 저는 저희의 작업이 헤드라인을 차지하기 위해 경쟁하는 대상이 되기보다, 더 큰 규모의 프로젝트가 책임을 다할 수 있도록 감시하는 역할을 하기를 바랍니다.
발행 전 스스로에게 남기는 메모: 이 섹션은 프로그램에 대한 일반적인 제스처가 아니라, 내가 실제로 사용한 것에 근거하여 작성하고 싶다. 이 작업에 기여한 실제 서비스, 크레딧, 또는 멘토링 대화 내용을 명시하는 것이 AWS 검토자들이 가장 면밀히 확인할 부분이다.
AWS 커뮤니티 빌더(AWS Community Builder)가 실제로 제공한 것
이 작업에 있어 프로그램의 가치는 결코 굿즈(swag)가 아니었습니다. 그것은 연결성이 낮고 자원이 제한된 환경(low connectivity, resource constrained environments)에 모델을 배포하는 문제에 대해 이미 깊이 고민해 온 AWS 전문가들과의 멘토링 대화였으며 — 이는 Bauchi가 처한 정확한 상황이기도 합니다 — 그리고 자원봉사 커뮤니티가 비용 문제로 실행하지 못했을 실험들을 수행할 수 있게 해준 크레딧이었습니다. S3, SageMaker의 GPU 트레이닝 인스턴스(GPU training instances) 등이 그러합니다.
자신의 커뮤니티에서 이를 시도하려는 다른 빌더에게 해주고 싶은 말
야심 찬 계획보다 더 좁은 범위에서 시작하세요. 출시된 번역기나 TTS (Text-to-Speech, 음성 합성) 모델이 로드맵(roadmap) 항목으로만 남아 있는 거대 언어 모델(LLM)보다 훨씬 가치 있습니다. 엔지니어가 필요하다고 느끼기 전에 엔지니어가 아닌 사람들을 먼저 영입하세요. 언어학자가 명백히 필요하다고 느낄 때쯤이면, 이미 언어적으로 잘못된 결과물을 출시한 상태일 것이기 때문입니다. 낮은 연결성, 자원봉사 시간, 기업용 컴퓨팅 예산의 부재와 같은 제약 사항들을 변명이 아닌 설계 사양(design spec)으로 취급하세요. 이 프로젝트에서 가장 세심하게 이루어진 데이터 위생(data hygiene) 결정들은, 자금력이 더 풍부한 팀처럼 부실한 데이터셋에 컴퓨팅 자원을 쏟아부을 여유가 없었기 때문에 내린 결정들입니다.
다음 단계
TTS 모델과 번역기는 결코 최종 목적지가 아니었습니다. 그것들은 자원봉사 커뮤니티가 더 큰 무언가에 도전할 권리를 얻기 위한 수단이었으며, 그 더 큰 목표는 여전히 유효합니다. 만약 여러분이 빅테크(Big Tech)가 학습 데이터로서 가치가 없다고 판단한 커뮤니티를 위해 언어 기술을 구축하고 있거나, 혹은 이와 유사하게 소외된 지역이나 언어에서 활동하는 AWS 커뮤니티 빌더(AWS Community Builder)라면, 진심으로 서로의 경험을 공유하고 싶습니다. 댓글을 남겨주시거나, AI Bauchi를 찾아 인사를 건네주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기