Falcon-ASR 소개
요약
Falcon-ASR은 아랍어 음성 인식(ASR) 모델로, 특히 에미레이트 방언에 초점을 맞추었습니다. 16억 개 파라미터 규모의 이 모델은 영어, 프랑스어 등 다국어를 지원하며, 공식 리더보드에서 낮은 단어 오류율(WER)을 기록했습니다. 또한, 전사된 단어에 대한 시간 스탬프를 제공하여 오디오 위치와 연결할 수 있는 기능을 갖추고 있습니다.
핵심 포인트
- 아랍어 음성 인식 모델 Falcon-ASR 소개
- 16억 파라미터 규모로 에미레이트 방언에 특화됨
- 공개 벤치마크에서 낮은 WER(20.92%) 기록
- 단어 수준 타임스탬프 지원으로 전사 정확도 향상

English · العربية
아랍어 WER: 20.92% · 파라미터: 1.6B · 에미레이트 WER (TII 평가): 22.73%
저희는 아랍어를 위한 16억 개 파라미터 음성 인식 모델인 Falcon-ASR을 소개합니다. 특히 에미레이트 방언에 중점을 두었습니다. Abu Dhabi의 Technology Innovation Institute (TII)에서 개발되었으며, 영어, 프랑스어, 스페인어, 포르투갈어도 지원합니다.
평가 결과, Falcon-ASR은 6개의 아랍어 테스트 세트를 거쳐 평균 단어 오류율(WER) 20.92%를 달성했습니다. 이는 저희가 사용한 리더보드 스냅샷의 최고 공개 기록인 23.17%와 비교됩니다. 내부 에미레이트 평가에서는 비교 대상 시스템 중 가장 낮은 단어 및 문자 오류율을 기록했습니다.
또한, 전사(transcription)에 대해 단어 수준 타임스탬프를 지원하여 각 전사된 단어를 오디오의 위치와 연결할 수 있습니다.
Hugging Face Demo에서 Falcon-ASR을 사용해 보실 수 있습니다.
음성 아랍어 인식하기
아랍어 말하는 방식은 지역, 화자, 환경에 따라 다릅니다. 공식 뉴스 방송을 처리하는 모델이라도 에미레이트 대화나 전화선으로 녹음된 음성은 어려움을 겪을 수 있습니다. 또한 방언 아랍어는 현대 표준 아랍어(MSA)보다 전사된 자료가 적어 학습과 평가가 더 어렵습니다.
저희는 Falcon-ASR을 에미레이트어, MSA, 기타 걸프 및 아랍어 방언, 그리고 영어로 훈련했습니다. 저희의 목표는 방언 형태와 언어 간 변화를 포함하여 사람들이 일상 대화에서 사용하는 단어를 전사하는 것입니다.
아랍어 벤치마크 결과
ELM Research Center가 유지 관리하는 Open Universal Arabic ASR Leaderboard는 6개의 테스트 세트에 걸친 등가 가중 평균 WER로 시스템을 순위 매깁니다. 또한 문자 오류율(CER)도 보고합니다. 두 지표 모두 값이 낮을수록 좋습니다. 저희 Falcon-ASR 평가는 이 프로토콜을 따릅니다.
| Model | Parameters | Avg WER (%) | Avg CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER은 Word Error Rate(단어 오류율)이며, CER은 Character Error Rate(문자 오류율)입니다. 이 수치가 낮을수록 성능이 좋다는 것을 의미합니다.
저희는 리더보드에 고정된 매니페스트를 사용하여 동일한 여섯 가지 벤치마크에서 Falcon-ASR을 평가했습니다. 경쟁 모델의 수치는 2026년 9월 30일에 확인된 공개 리더보드 평균값입니다. Falcon-ASR의 평균 WER은 해당 스냅샷에서 발표된 최고 결과보다 2.25 퍼센트 포인트 더 우수합니다.
에미레이트어(Emirati) 음성 평가
공개 평가 데이터에는 이미 에미레이트어가 포함되어 있습니다: 카사블랑카는 UAE 서브셋을 가지고 있습니다. 저희는 공개된 UAE 서브셋을 넘어선 전사 정확도를 평가하기 위해, 내부적으로 추가적인 에미레이트어 및 걸프 음성을 보유한 녹음 파일과 인간이 검증한 스크립트를 사용하여 보완합니다.
내부 에미레이트어 평가에서 Falcon-ASR은 22.73%의 WER과 10.19%의 CER을 달성했습니다:
| 모델 | 파라미터 | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (활성 3.0B) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
Falcon-ASR은 여기서 비교된 시스템 중 가장 낮은 WER과 CER을 기록했습니다. 그 WER은 다음으로 우수한 결과인 Qwen3-Omni보다 4.07 퍼센트 포인트 낮습니다. 이 결과는 단어 수준과 문자 수준 모두에서 개선된 전사 정확도를 보여줍니다.
다양한 녹음 환경에 대한 학습
저희는 배경 소음, 중첩 음성(overlapping speech), 음악, 실내 잔향(room reverberation) 및 전화 통신 효과를 포함하여 속도와 피치의 변화까지 포함했습니다. 저희는 에미레이트어 녹음에도 동일한 처리를 적용하여, 모델이 회의, 통화 및 기타 일상적인 녹음에서 마주칠 수 있는 다양한 조건에 노출시켰습니다.
영어 및 기타 언어
Falcon-ASR은 동일한 모델 가중치로 영어도 전사합니다. Hugging Face Open ASR Leaderboard에서 사용된 7개의 공개 영어 테스트 세트를 이용한 평가에서, 평균 WER 5.74%를 달성했습니다.
| 테스트 세트 | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
이 모델은 또한 프랑스어, 스페인어, 포르투갈어를 지원합니다. 다섯 개 언어 모두 언어 플래그를 요구하지 않고 동일한 가중치를 사용합니다. 출력은 구사된 언어로 된 전사본입니다.
모델 기반 (Model foundation)
Falcon-ASR는 저희의 Falcon3-Audio 작업을 기반으로 구축되었습니다. Falcon3-Audio의 아키텍처와 훈련 접근 방식은 Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data에서 설명합니다.
Falcon ASR 사용해 보기 (Try Falcon ASR)
저희 Hugging Face Demo Space를 이용하면 Falcon-ASR을 직접 사용해 보고 전사(transcription) 기능을 탐색할 수 있습니다. API 접근 및 네이티브 애플리케이션은 계획 중입니다. 여러분의 녹음 파일을 가지고 데모를 사용해 보시길 권장합니다.
نقدّم Falcon ASR
Falcon-ASR을 소개합니다. 16억 개의 매개변수를 가진 아랍어 음성 인식(Speech Recognition) 모델이며, 특히 에미레이트 방언에 중점을 두었습니다. 이 모델은 아부다비의 기술 혁신 연구소(TII)에서 개발되었으며, 영어, 프랑스어, 스페인어, 포르투갈어도 지원합니다.
저희 평가에서 Falcon-ASR은 6개의 아랍어 테스트 세트를 거쳐 평균 워드 오류율(WER) 20.92%를 달성했습니다. 이는 저희가 사용한 리더보드 버전의 최고 기록인 23.17%와 비교했을 때의 수치입니다. 또한, 에미레이트 방언에 대한 내부 평가에서 이 모델은 우리가 비교한 시스템들 중 가장 낮은 워드 및 문자 오류율을 기록했습니다.
저희는 음성 전사 과정에서 단어 단위 타임스탬프(timestamps)를 지원하여, 각 단어가 오디오 녹음의 위치와 연결되도록 합니다.
Hugging Face 데모를 통해 Falcon-ASR을 사용해 보실 수 있습니다.
구어체 아랍어 음성 인식 (Speech Recognition of Spoken Arabic)
아랍어 구어체는 지역, 화자 및 녹음 조건에 따라 다릅니다. 따라서 어떤 모델은 공식 뉴스 방송 전사는 성공할 수 있지만, 에미레이트 방언의 대화나 전화 통화를 전사하는 데 어려움을 겪을 수 있습니다. 또한, 아랍어 방언에 대한 전사된 음성 자료는 표준 아랍어(Modern Standard Arabic)로 사용 가능한 자료보다 적기 때문에, 학습과 평가가 더욱 어렵습니다.
Falcon-ASR을 이집트어 및 표준 아랍어(Modern Standard Arabic)와 다른 걸프 지역 및 아랍어 방언과 영어에 맞춰 훈련했습니다. 우리의 목표는 사람들이 일상 대화에서 사용하는 단어, 즉 방언적 표현이나 언어 간 전환까지 모두 기록하는 것입니다.
아랍어 테스트 결과
ELM 연구 센터가 운영하는 포괄적인 아랍어 음성 인식(ASR) 리더보드에서는 6개 테스트 세트의 평균 단어 오류율(WER)을 기준으로 시스템 순위를 매깁니다. 각 세트는 동일한 가중치를 갖습니다. 또한 문자 오류율(CER)도 표시됩니다. 두 지표 값 중 어느 것이 낮을수록 성능이 더 좋습니다. 저희는 이 프로토콜에 따라 모델을 평가했습니다.
| Model | Parameters | Avg WER (%) | Avg CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER은 단어 오류율이며, CER은 문자 오류율입니다. 값이 낮을수록 성능이 더 좋습니다.
저희는 리더보드에 고정된 샘플 목록을 사용하여 동일한 6개 테스트 세트에서 Falcon-ASR을 평가했습니다. 경쟁 모델의 수치는 해당 버전인 2026년 9월 30일에 게시된 평균값입니다. 이 당시 최고의 기록보다 단어 오류율이 2.25% 더 좋았습니다.
에미레이트 방언 평가
에미레이트 방언을 평가하기 위한 공개 데이터가 이미 존재하며, Casablanca 세트는 에미레이트에 대한 별도의 섹션을 포함하고 있습니다. 저희는 이 커버리지를 추가적인 에미레이트 및 걸프 지역어 음성 녹음 자료를 사용하여 내부적으로 보완했습니다. 테스트용으로 특별히 녹음된 자료와 인간 검토를 거친 참조 텍스트를 활용하여, 일반 에미레이트 데이터 외의 추가 자료에 대한 전사 정확도를 평가합니다.
Falcon-ASR은 자체 에미레이트 내부 평가에서 단어 오류율 22.73%와 문자 오류율 10.19%를 달성했습니다:
| Model | Parameters | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B active) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
Falcon-ASR은 비교 대상 시스템 중 가장 낮은 단어 및 문자 오류율을 기록했습니다. 단어 오류율은 다음 결과를 보인 Qwen3-Omni보다 4.07% 포인트 낮았습니다. 이 결과는 이번 평가에서 단어 및 문자에 걸친 전사(transcription) 정확도가 향상되었음을 보여줍니다.
다양한 녹음 조건에서의 학습
훈련 데이터에는 배경 소음, 음성 중첩(overlapping speech), 음악, 잔향(reverberation), 전화 통신 효과와 같은 요소들이 포함되었으며, 말하기 속도 및 음성 강도의 변화도 반영되었습니다. 우리는 이와 동일한 처리를 아랍에미리트 녹음물에도 적용하여, 모델이 회의, 통화, 기타 일상적인 녹음 등에서 마주칠 수 있는 다양한 조건들을 처리할 수 있도록 준비했습니다.
영어 및 기타 언어
Falcon-ASR은 동일한 모델 가중치(weights)를 사용하여 영어 음성을 전사합니다. Hugging Face 공개 음성 인식 벤치마크에 사용된 7개의 일반 영어 테스트 세트를 평가했을 때, 평균 단어 오류율(Word Error Rate, WER)은 5.74%였습니다.
| Test set | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
이 모델은 또한 프랑스어, 스페인어, 포르투갈어를 지원합니다. 이 다섯 개 언어는 별도의 언어 지정 없이 단일 가중치를 사용하며, 출력 결과는 발화된 언어로 된 텍스트 전사본입니다.
모델의 기반
Falcon-ASR은 Falcon3-Audio의 연구를 기반으로 합니다. 'Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data' 논문에서 Falcon3-Audio의 아키텍처와 훈련 접근 방식을 소개했습니다.
Falcon ASR 체험
Hugging Face에서의 데모는 사용자가 Falcon-ASR을 사용하여 음성 전사 능력을 탐색할 수 있게 합니다. API 인터페이스 및 네이티브 애플리케이션을 통한 접근은 계획 중입니다. 여러분의 녹음물을 사용하여 모델을 테스트해 보시길 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기