Falcon-Emirati: LLM이 방언, 문화, 뉘앙스를 학습할 때
요약
본 기사는 현대 표준 아랍어(MSA)와 실제 구어체인 에미레이티 아랍어 사이의 간극을 메우기 위해 Falcon-Emirati-7B 모델을 개발한 과정을 설명합니다. 이 모델은 기존의 강력한 기반 모델인 Falcon-H1-Arabic를 활용하여, 방언 특유의 어휘, 톤, 문화적 맥락에 초점을 맞춰 에미레이티 아랍어 이해도를 높였습니다.
핵심 포인트
- MSA만으로는 실제 대화의 의미 포착이 어려움.
- Falcon-Emirati-7B는 Falcon-H1-Arabic 기반으로 구축됨.
- Mamba와 Transformer를 결합한 하이브리드 구조가 장거리 의존성을 유지함.
- 7B 파라미터 크기가 품질과 비용 면에서 가장 균형 잡힌 선택임.

아랍어는 사실 하나의 이름 아래 살아가는 언어들의 가족입니다. 현대 표준 아랍어(Modern Standard Arabic)는 뉴스나 교과서에서 접하는 형태이지만, 사람들이 실제로 대화하는 방식과는 거리가 멉니다. UAE에서는 일상적인 대화, 유머, 협상, 스토리텔링이 에미레이티 아랍어(Emirati Arabic)로 이루어지는데, 이는 고유한 어휘, 리듬, 그리고 그 주변에 단단하게 감긴 문화가 있는 걸프 방언입니다. 특히 나바티 시(nabati poetry) 같은 에미레이티 시는 속담이나 짧은 일화와 함께 의미를 담고 있으며, 이를 단순히 단어별로 직역하는 것만으로는 그 의미를 포착하기 어렵습니다. MSA만을 아는 모델로는 에미레이티 문장의 모든 단어를 번역하더라도 실제 의미를 놓칠 수 있습니다.
Falcon-Emirati-7B는 바로 이 간극을 메우기 위해 구축되었습니다. 이는 Falcon-H1-Arabic 위에 올라탄 방언 특화 모델로, 원어민이 에미레이티 아랍어를 이해하고 생성하는 방식—즉, 그 뒤에 숨겨진 어휘, 톤, 그리고 문화적 맥락—을 파악하는 것을 목표로 합니다.
저희는 처음부터 시작하지 않았습니다. Falcon-Emirati-7B는 올해 초 이미 해당 언어의 새로운 기준점(benchmark)을 제시했던 저희 아랍어 모델군인 Falcon-H1-Arabic를 기반으로 구축되었습니다. Falcon-H1-Arabic는 Falcon-H1 하이브리드 아키텍처를 사용합니다: State Space Models (Mamba)와 Transformer attention이 각 블록 내부에서 병렬로 작동하며, 그 출력이 각 블록의 투영(projection) 전에 융합됩니다. 이 조합은 Mamba가 긴 시퀀스에서 제공하는 선형 시간 효율성을 유지하면서도, 아랍어처럼 형태론적으로 풍부한 언어에 중요한 장거리 의존성(long-range dependencies)을 위해 attention이 가진 정밀도를 지켜줍니다. 이 모델군은 3B, 7B, 34B 파라미터의 세 가지 규모를 아우르며 최대 128K 및 256K 토큰의 컨텍스트 창(context window)을 갖추고 있으며, 이미 MSA와 방언 아랍어(걸프, 레반트, 이집트, 마그레브)는 물론 영어 및 다국어 데이터가 혼합된 광범위한 데이터로 훈련되었습니다.
이러한 배경을 바탕으로 우리는 강력한 출발점을 얻었습니다. 즉, 이미 아랍어를 광범위하게 이해하고, 긴 컨텍스트를 잘 처리하며, 어느 정도 방언 노출까지 갖춘 모델입니다. Falcon-Emirati-7B는 이러한 기반 위에 올라가서, 일반적인 아랍어 모델이 아무리 뛰어나더라도 스스로 습득하지 못하는 에미레이트 방언(Emirati dialect)의 어휘, 문법, 그리고 문화적 지식에 초점을 맞춰 특화시킵니다.
우리는 이 7B 변형 모델을 기반으로 Falcon-Emirati-7B를 구축했습니다. 이는 패밀리 내에서 가장 이상적인 지점입니다. 방언 적응이 필요로 하는 미묘한 뉘앙스를 유지하기에 충분히 크면서도, 학습과 추론 비용 모두 실용적으로 유지할 수 있는 크기입니다. 34B 모델은 품질을 조금 더 끌어올릴 수는 있겠지만, 방언 특화된 채팅 모델에게는 경제성이 없는 수준의 학습 및 서비스 비용이 발생합니다. 반면, 3B 모델은 우리가 목표로 했던 문화적, 언어적 이해의 깊이를 담기에는 충분한 여유 공간을 남기지 못합니다. 결국 7B가 품질 대비 학습 및 추론 비용 면에서 가장 균형 잡힌 선택이었습니다.
일반 아랍어 모델을 에미레이트 방언 전문가로 변환하는 작업은 사실 기본 모델 자체를 구축하는 것보다 쉬워 보입니다. 하지만 그렇지 않습니다. 몇 가지 요소 때문에 이 과정은 정말 어렵습니다:
에미레이트는 주로 구어체 방언입니다. 온라인에서 쓰이는 글자로는 MSA나 다른 걸프 및 레반트 방언에 비해 훨씬 적게 나타납니다. 따라서 학습할 원본 텍스트 자체가 충분하지 않습니다.
의미가 종종 비유적입니다. 관용구, 속담, 시적인 언급은 표면적인 어휘보다는 공유된 문화적 맥락에 의존합니다.
정립된 가이드라인이 없습니다. 어느 정도의 방언 데이터가 충분한지, 이를 MSA 및 일반 아랍어와 어떻게 혼합해야 하는지, 또는 어떤 학습 단계(계속 사전 훈련 (continued pre-training), SFT, 또는 선호도 최적화 (preference optimization))가 방언 습득에 가장 중요한지에 대한 잘 문서화된 방법론이 없습니다.
이전 지점에서 언급된 점은 우리가 작업 방식을 결정하는 데 영향을 미쳤습니다. Falcon-Emirati-7B를 구축한 과정은 시행착오의 연속이었습니다. 다양한 데이터 혼합, 훈련 단계, 감독 전략을 테스트하고, 인간의 판단과 벤치마크 점수를 모두 활용하여 실제로 어떤 요소가 성능 향상에 기여하는지 파악했습니다.
저희는 Falcon-H1-Arabic의 사전 학습 위에 에미레이트 전용 데이터 파이프라인을 구축했으며, 세 가지 보완적인 출처를 활용했습니다.
첫째, 저희는 에미레이트 현지 방언으로 작성된 웹사이트와 포럼 콘텐츠를 크롤링하고 큐레이션 했습니다. 이 내용은 표준 아랍어(MSA)에서 번역되거나 음차되지 않은 원본 형태였습니다. 여기서 저희는 '진실 데이터(ground truth)'를 얻었습니다. 즉, 에미레이트 사람들이 온라인에서 실제로 어떻게 글을 쓰고 말하는지, 일상적인 표현, 구어체 표현, 그리고 실제 사용에서 나타나는 에미레이트 방언과 MSA 사이의 자연스러운 주고받음입니다.
방언 텍스트와 더불어, 저희는 에미레이트 문화, 유산, 언어에 특화된 MSA 자료를 가져왔습니다. 지역 관습, 가치관, 역사, 사회 규범 등에 대한 기사 및 참고 자료가 포함되어 있으며, 여기에는 에미레이트 사람들이 어떻게 인식되고 고정관념화되는지에 대한 내용도 담겨 있습니다. 이것은 모델에게 방언으로 글을 쓰도록 가르치는 것이 아니라, 에미레이트 관련 주제(유산, 예절 등)가 나올 때 모델이 무엇에 대해 이야기하고 있는지—원어민만이 아는 맥락 같은 것들—를 가르칩니다.
오직 실제 방언 텍스트만으로는 채팅 모델이 일상적으로 처리해야 하는 다양한 주제 범위를 충족하기에는 충분하지 않았습니다. 그래서 저희는 부족한 부분을 채우기 위해 대량의 합성 에미레이트 방언 데이터를 생성했습니다. 저희는 단순히 생성 모델이 '걸프식' 아랍어로 즉흥적으로 상상하게 두지 않았습니다. 대신, 에미레이트 어휘와 문법에 특화된 엄격한 규칙과 용어집, 사전으로 이를 제약했습니다. 이러한 가드레일(guardrails) 덕분에 합성 결과물이 실제로 에미레이트처럼 읽히는지, 아니면 문법적으로는 완벽하지만 실제 방언 사용자에게는 부자연스럽게 들리는 결과물인지 차이가 생겼습니다.
MSA(Modern Standard Arabic)에서 방언으로 적응시키는 표준 레시피가 없었기 때문에, 저희는 훈련 전략 자체를 실험적으로 알아내야 할 무언가로 간주했습니다. 어느 정도의 방언 데이터를 주입할지, 그리고 어떤 훈련 단계에서 주입할지, 실제 크롤링된 데이터와 모델이 합성 패턴에 과적합되지 않도록 합성 데이터를 어떻게 균형 있게 맞출지, 그리고 단순히 표면적으로 유창한 것을 넘어 문화적으로 근거를 유지하는 데 실제로 어느 정도의 MSA 문화적 맥락이 필요한지에 대해 제거 실험(ablation)을 수행했습니다. 각 단계에서 저희는 자동 점수화와 원어민 검토를 혼합하여 활용했는데, 이는 자동 측정 지표만으로는 자연스러움, 톤, 또는 문화적 적합성을 충분히 포착할 수 없어 단독으로 신뢰하기 어렵기 때문입니다.
저희는 두 가지 보완적인 접근 방식을 통해 훈련 전반의 진행 상황을 추적했습니다:
- 에미레이트 원어민 검토: 모델 출력물을 직접 검토하며, 단순히 답변이 맞는지 여부뿐만 아니라 적절하게 들리는지(자연스러움, 톤, 문화적 적합성)를 판단했습니다. 이는 벤치마크 점수가 알려주지 못하지만 원어민의 귀가 즉시 포착하는 것들입니다.
- 정량적 추적: 저희와 커뮤니티가 아랍어 LLM에서 에미레이트 방언 능력을 평가하기 위해 특별히 출시한 벤치마크인 Alyah(الياه,
Falcon-Emirati-7B는 Alyah에서 **84.83%**의 점수를 기록하며, 크기가 훨씬 큰 여러 모델을 포함하여 비교한 모든 다른 아랍어 및 다국어 모델보다 앞섰습니다. 아래 차트는 이 모델이 Alyah 리더보드의 대표적인 최신 지침 조정(instruction-tuned) 모델들과 비교했을 때 어느 위치에 놓이는지를 보여줍니다.
Alyah 정확도(%), 지침 조정 모델들. Falcon-H1-Arabic 계열 모델들은 Falcon-Emirati-7B가 이들을 기반으로 구축되었기 때문에 이 비교에서 제외되었습니다.
이 비교를 통해 몇 가지 주목할 만한 점들이 눈에 띕니다. 크기만으로는 방언 역량을 보장할 수 없습니다. 여기에 있는 가장 큰 다국어 모델들 중 일부는 더 작고 방언 인식 능력이 뛰어난 모델들보다 낮은 점수를 기록하는데, 이는 에미레이트어 숙련도가 규모의 부작용으로 얻어지는 것이 아니라 의도적으로 훈련되어야 함을 시사합니다. 가장 좋은 성과를 보이는 모델들은 또한 애초에 아랍어 원어민이거나 아랍어에 초점을 맞춘 경우가 많았는데, 이는 저희가 자체적으로 수행한 제거 실험(ablation)에서 관찰된 내용과 일치합니다. 즉, 일반적인 아랍어 및 방언 커버리지는 필수적인 출발점이지만, 특히 시(poetry), 문화유산 지식(heritage knowledge), 그리고 언어-방언 범주 자체와 같이 Alyah의 가장 어려운 부분들을 메우기 위해서는 여전히 목표화되고 방언에 특화된 작업이 필요합니다.
이는 또한 Alyah 벤치마크 공개를 통해 더 광범위하게 나타난 내용과도 일치합니다. 심지어 강력한 모델들조차 진정으로 방언적이고 문화적으로 내재된 콘텐츠로 넘어가면 실제 성능 저하를 보입니다. 이 격차는 단순히 모델을 크게 만든다고 해서 스스로 좁혀지지 않습니다. 해당 방언에 특화되어 구축된 데이터와 평가가 필요합니다.
객관식 정확도는 모델이 네 가지 선택지 중에서 정답을 인식할 수 있는지를 알려줍니다. 하지만 누군가 단순히 모델에게 말을 걸었을 때, 실제로 에미라티 아랍어(Emirati Arabic)를 생성해낼 수 있는지는 말해주지 않습니다. 따라서 Alyah와 함께 두 번째 평가를 진행했습니다. 이 평가는 동일한 1,173개의 Alyah 질문에 대한 개방형 생성(open-ended generation)이었으며, LLM 심사위원(Gemini 3.7 Flash)이 다섯 가지 모델—Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat, 그리고 Alyah 리더보드에서 가장 강력한 경쟁 모델로 선택된 Fanar-2-27B-Instruct—을 대상으로 점수를 매겼습니다.
심사위원은 각 답변에 대해 두 가지 별도의 차원에서 점수를 매겼습니다. 첫째는 내용의 정확성(whether the content was correct)이었고, 둘째는 독립적으로 그 답변이 MSA(Modern Standard Arabic)가 아닌 에미라티 방언으로 실제로 돌아왔는지 여부였습니다. 저희는 부분 점수(partial-credit score, 심사위원이 평가한 등급)와 더 엄격한 합격/불합격 버전 모두를 보고했으며, 각 모델이 답변하는 대신 기권(abstained)한 횟수도 함께 제시했습니다.
1,173개 Alyah 질문에 대한 LLM 판정 정확성, 개방형 생성, 심사위원은 Gemini 3.7 사용.
동일 질문에 대한 LLM 판정 방언 충실도(dialect fidelity): 답변이 실제로 에미라티로 돌아오는지, 아니면 모델이 기본적으로 MSA를 사용하는지?
Falcon-Emirati-7B가 정확성 면에서 선두를 차지했지만, 진짜 격차는 두 번째 차트에서 나타납니다. 방언 충실도 측면에서 Falcon-Emirati-7B는 0.52점(부분 점수)을 기록한 반면, ALLaM은 0.05점, gemma-3-27b-it은 0.03점, Jais-2-8B-Chat은 0.02점, 그리고 Fanar-2-27B-Instruct는 사실상 0.00점을 기록했습니다. 이는 작은 격차가 아니라 낮은 쪽에서 두 자릿수(two orders of magnitude)에 가까운 차이입니다. 실제로는 이것이 다른 모델들이 정답을 알고 있지만, 에미라티어로 직접 질문받았을 때조차 기본적으로 MSA로 말한다는 것을 의미합니다. Falcon-Emirati-7B만이 질문받은 방언으로 신뢰성 있게 답변하는 다섯 모델 중 유일한 경우입니다.
Fanar-2-27B-Instruct는 또 다른 이유로 두드러집니다. 이 모델은 다른 어떤 모델보다 훨씬 많이 답변을 거부하는데, 비교된 모든 모델이 5% 미만인 것에 비해 무려 26.2%의 시간 동안 답변하지 않으려고 합니다. 이러한 높은 거부율에 더해, 다섯 모델 중 가장 낮은 0.27점(부분 점수)이라는 정확도 점수는 이 모델이 단순히 잘못된 레지스터로 답변하는 것이 아니라, 에미레이트 특정 콘텐츠와 상호작용할 의지가 적고 능력도 떨어진다는 것을 시사합니다.
Alyah 카테고리별 방언 충실도(Dialect fidelity), 부분 점수. Falcon-Emirati-7B만이 일관되게 에미레이트로 전환하는 유일한 모델이며, 다른 모델들은 거의 모든 카테고리에서 MSA를 유지합니다.
카테고리별로 방언 충실도를 세분화하면 패턴이 더욱 명확해집니다. 이는 일상 인사부터 시에 이르기까지 Alyah의 모든 카테고리에 걸쳐 나타나며, 이 현상이 소수의 질문 유형을 위해 학습된 좁은 트릭이 아님을 시사합니다. 모델이 에미레이트를 기대하는 레지스터일 때 기본적으로 전환되는 일반적인 경향입니다. 경쟁 모델들이 상대적으로 더 잘하는 유일한 영역인 인사 및 일상 표현(Greetings & Daily Expressions) 역시 에미레이트와 MSA가 가장 많이 겹치는 카테고리이므로, 일반적인 아랍어 모델이 우연히 올바르게 들릴 수 있는 가장 쉬운 장소입니다.
같은 질문에 대한 세 번째 분석으로, 우리는 일대일 쌍별 평가(head-to-head pairwise judging)를 수행했습니다. 모든 Alyah 질문에 대해 심사위원(Gemini 3.7 Flash)에게 Falcon-Emirati-7B의 답변과 경쟁 모델의 답변을 나란히 보여주었으며, 어느 것이 무엇인지 알지 못한 상태에서 더 나은 것을 고르도록 요청했습니다. 아래 레이더 차트는 세 가지 경쟁 모델인 Jais-2-8B-Chat, ALLaM-7B-Instruct-preview, Fanar-2-27B-Instruct에 대한 카테고리별 승률을 보여줍니다.
Alyah 카테고리별 쌍별 승률(Pairwise win rate), Falcon-Emirati-7B 대 Jais-2-8B-Chat, ALLaM-7B-Instruct-preview 및 Fanar-2-27B-Instruct를 Gemini 3.7이 직접 평가함.
AI 자동 생성 콘텐츠
본 콘텐츠는 HuggingFace Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기