Open ASR Leaderboard, 인도 지역의 첫 언어 추가
요약
Open ASR Leaderboard가 힌디어 및 인도 영어에 대한 개방형 ASR 평가를 시작하며, 이는 인도 지역 언어 지원의 중요한 진전을 의미합니다. 기존 리더보드는 인종적/성별/연령 등 화자 특성에 따른 성능 격차(Bias)를 포착하지 못하는 한계가 있었습니다. 새로운 Monsoon 세트는 지리, 연령, 성별 등 9가지 축을 따라 변화하도록 설계되어 보다 현실적인 평가 환경을 제공합니다.
핵심 포인트
- 힌디어 및 인도 영어에 대한 개방형 ASR 평가 시작 (Monsoon en-IN/hi-IN).
- 기존 리더보드는 화자 특성(인종, 성별 등)에 따른 성능 편향을 측정하지 못함.
- 새로운 Monsoon 세트는 지리, 연령, 성별 등 9가지 축으로 설계되어 현실적 평가를 강화함.
- 화자 분리형 데이터와 다양한 속성을 포함하여 모델의 견고성 검증에 초점.
Voice Arena와 Hugging Face가 힌디어 및 인도 영어에 대한 개방형 ASR 평가를 시작합니다.
벤치마크는 무엇이 구축될지 결정합니다. Open ASR Leaderboard에서 높은 점수를 받은 모델은 채택되고 반복 개선되는 반면, 리더보드가 측정하지 않는 기능들은 개선되지 않는 경향이 있습니다. 최근 리더보드에 대한 작업 중 상당 부분은 평가 지표를 더욱 신뢰할 수 있게 만드는 데 집중되었습니다:
- 홀드아웃(Held-out) 비공개 스플릿.
- 모델이 오디오만으로 전사하는 것이 아니라 참조 전사본을 얼마나 재현하고 있는지 정량화하기 위한 벤치마크 적합성 분석(Benchmark-fitting analysis).
- 정확한 예측/변형이 패널티를 받지 않도록 정규화기(normalisers)의 격차를 메우는 작업.
이 모든 것이 하나의 숫자(WER)를 조작하기 어렵게 만듭니다. 여전히 단 하나의 숫자입니다. 오랜 연구 결과에 따르면 ASR 오류율은 사용자에 따라 고르게 분포되어 있지 않습니다. 자동 음성 인식에서 발견된 인종적 격차는 상용 시스템이 흑인 화자에게 백인 화자보다 약 두 배 나쁜 성능을 보였으며, 자동 음성 인식의 편향 정량화(Quantifying Bias in Automatic Speech Recognition) 연구에서는 성별, 연령, 억양에 따른 추가적인 차이를 발견했습니다. 이 중 어느 것도 리더보드에서 눈에 띄지 않는데, 이는 리더보드가 숨기고 있기 때문이 아닙니다. 테스트 세트는 누가 말했는지에 대해서는 거의 아무것도 기록하지 않고 무엇이 말해졌는지만을 기록합니다.
이 격차를 해소하기 위해, 저희는 Open ASR Leaderboard에 두 가지 평가 세트인 Monsoon en-IN과 Monsoon hi-IN을 도입합니다. 힌디어는 5억 명 이상의 사람들이 사용하는 언어로, 현재 유럽 언어만 다루는 다국어 탭에서 최초의 인도 지역(Indic) 언어입니다. 각 세트는 자체 점수 계산이 가능한 공개 스플릿으로 출시되며, 벤치마크 특정 최적화를 제한하기 위해 비공개 스플릿도 함께 제공됩니다. 네 가지 스플릿은 화자 분리형(speaker-disjoint)이며, 각각 4,888명의 화자를 포함하고 각 화자에 대해 12가지의 속성이 기록되어 있습니다.
테스트 세트는 자신이 변화하는 축을 따라 실패 모드를 노출시킬 수 있습니다. 대부분의 벤치마크는 쉽게 구할 수 있는 오디오를 기반으로 구축됩니다. Monsoon은 아홉 가지 축(지리, 연령, 성별, 어휘, 기기, 음향 환경, 말하기 유형, 말 속도, 동일한 오디오에 대한 여러 유효 전사본의 존재 여부)을 따라 변화하도록 설계되었습니다. 각 축은 전체 WER(Word Error Rate)이 평균적으로는 맞지만 특정 인구 집단에게는 틀릴 수 있는 방식을 의미합니다.
수집 방법 또한 이와 같은 맥락입니다.
**지리(Geography)**는 소수의 장소에서 긴 세션을 녹음하는 대신 수백 개의 지역을 아우르는 곳에서 모집하여 얻어졌습니다. **기기 및 음향 조건(Devices and acoustic conditions)**은 조용한 방에 제공된 하드웨어 대신 기여자들이 자신의 휴대폰과 연결을 사용하여 실내외에서 기록했기 때문에 확보되었습니다. **어휘, 말하기 유형 및 말 속도(Vocabulary, speech type and speech rate)**는 프롬프트에서 비롯됩니다. 이 프롬프트들은 기여자들을 의견 제시, 불일치 주장, 서술, 회상으로 이끌며, 이때 고유명사, 숫자, 즉흥적인 구절이 나타납니다. **연령 및 성별(Age and gender)**은 화자별로 기록되고 검증되었습니다. **여러 유효 전사본(Multiple valid transcripts)**은 오디오가 아닌 참조 데이터의 속성이며, 이후 섹션에서 다룰 주제입니다.
하나의 파이프라인을 통해 수집된 네 가지 분할 세트와 두 개의 언어입니다.
| Set | Language | Duration | Speakers | Clip length (mean / median) | M/F | Districts | States/UTs | Devices | Style | Transcription |
|---|---|---|---|---|---|---|---|---|---|---|
| Monsoon en-IN public | Indian English | 5.62 h | 1,444 | 9.6s / 10.4s | 50/50 | 428 | 24/6 | 556 | Conversational, spontaneous | Normalised, disfluencies |
| ... | ||||||||||
| 데이터는 비계획적인 양방향 즉흥 대화에서 가져왔으며, 클립은 단일 채널에서 분할되어 각 클립이 한 명의 화자를 담고 있습니다. 표에 보고된 필드 외에도, 각 클립은 직업, 학력, 결혼 상태, 소득 구간, 휴대폰 브랜드, 현재 거주 도시 및 현 지역 체류 연도를 기록합니다. |
각 메타데이터를 지닌 공용 인도 영어 분할 세트의 다섯 개 클립입니다:
29세 여성, West Tripura(웨스트 트리푸라), Tripura(트리푸라). 학생, samsung SM-G781B.
32세 여성, Satna(사트나), Madhya Pradesh(마디아 프라데시). 실업자, samsung SM-E146B.
22세 남성, Rohtas(로타스), Bihar(비하르). 학생, motorola moto g54 5G.
27세 여성, Warangal(와랑갈), Telangana(텔랑가나). 실업자, vivo V2247.
57세 남성, Puducherry(푸두체리). 사기업 직장인, Xiaomi M2006C3LI.
영어 세트는 표준 문자열 참조를 사용하며, 리더보드의 정규화기(normaliser)는 대부분의 철자 변형을 통합합니다. 힌디어는 훨씬 더 많은 변형을 가지며, 이 변형들은 두 관습 간의 고정된 매핑이 아니기 때문에 어떤 정규화기도 이를 해결할 수 없습니다. 따라서 힌디어 세트는 격자(lattice)를 전송합니다: 녹취록의 각 구간에 대해 허용되는 철자의 목록입니다.
몬순(Monsoon)은 시간 단위로는 작게, 화자 단위로는 크게 측정됩니다. 이것이 설계이며, 대부분의 가치가 여기에 있습니다.
위 필드를 넘어서는 화자 집중도 및 다양성.
| Monsoon hi-IN public | Monsoon hi-IN private | Monsoon en-IN public | Monsoon en-IN private | |
|---|---|---|---|---|
| 화자당 세그먼트 수 (평균) | 1.61 | 1.56 | 1.46 | 1.48 |
| ... | ||||
| 세 가지 속성이 이어지며, 각각은 양(volume)보다는 분산(variance)에 대한 주장입니다. |
특정 목소리가 점수를 좌우하지 않습니다: 상위 10개 기여자가 전체 길이의 2.8%에서 6.8%를 차지하며, 모든 화자 중 절반 이상이 정확히 한 번만 등장합니다. Monsoon에서의 결과는 오랜 시간 동안 녹음된 소수의 화자에 대한 것이 아니라 수백 개의 개별 목소리에 대한 평균입니다. 비교 가능한 기간을 가진 테스트 세트는 보통 반대로 구성됩니다.특정 지역이나 기기 또한 그렇지 않습니다: 인도 영어 공개 세트는 30개 주와 연방 직할구에 걸친 428개의 원주민 지구에서 가져왔으며, 힌디어 세트는 힌디 벨트 언어의 특성상 더 밀집되어 있지만 여전히 202개 및 295개의 지구에 걸쳐 있습니다. 녹음은 315개에서 582개의 개별 장치 모델에서 나오며, 단일 모델이 어떤 하위 세트에서도 세그먼트의 2.1%를 초과하지 않습니다. 표준화된 하드웨어에서 수집된 코퍼스는 하나의 마이크 응답에 과적합될 수 있습니다. 이는 불가능합니다.인도 영어는 하나의 억양이 아닙니다: 이것은 특정 지역의 영어가 아니라 국가 전역에서 사용되는 영어입니다. 여섯 개 구역 모두가 대표됩니다: 공개 세트에서 남부 화자가 35%, 동부가 18%, 중부가 18%, 북부가 16%, 서부가 11%를 기여했습니다. 이러한 확산에 따른 억양 변화는 단언되기보다는 메타데이터에 기록되어 있습니다.
Monsoon은 세그먼트당 18개의 열을 제공하며, 그중 12개는 메타데이터입니다. 대부분의 공개 ASR 테스트 세트는 식별자(identifier), 전사(transcript) 및 길이(duration)를 제공합니다. 인구통계학적 필드는 완전하거나 거의 완전합니다. 기여자들이 이러한 사용에 동의했습니다.
| 그룹 | 필드 |
|---|---|
| Segment | id , audio , audio_length_s , language |
| ... | |
| 두 언어는 서로 다른 지리적 형태를 가지며, 이 형태 자체가 정보가 됩니다. 힌디어 세트는 우타르 프라데시(Uttar Pradesh)가 화자의 약 40%를 차지하며 힌디 벨트에 집중되어 있어, 인구 기반으로 샘플링된 힌디 코퍼스가 보여야 할 모습입니다. 인도 영어 세트는 훨씬 더 평평합니다: 어떤 주도 13%를 초과하지 않으며, 화자 중 3분의 1은 가장 큰 8개 지역 외에서 나옵니다. 공개 부분과 비공개 부분이 둘 다 유사하게 일치합니다. |
인도 주의 경계는 언어적 경계를 따라 그어졌기 때문에, 지역(district)과 주(state)는 실제 억양 신호(accent signal)를 담고 있습니다. 이것이 바로 이 필드들이 요약되어 제거되는 것이 아니라 공개된 이유입니다. 인도 ASR에 대한 이러한 종류의 분석은 대규모로 보고되었는데, 지역별 오류율(error rates)은 약 4%에서 44%까지 분포하며, 과소대표된 지역들은 힌디어 벨트나 대도시권보다 훨씬 뒤처집니다. 게다가 오디오 품질, 말하는 속도(speaking rate), 발화 지속 시간(utterance duration), 성별, 나이, 장치별로 세분화하여 분석했습니다. 이 테스트는 비공개 벤치마크(closed benchmark)에서 수행되었습니다. 모니즌(Monsoon)은 공개 리더보드 테스트 세트에서도 동일한 종류의 분석을 가능하게 했습니다.
광범위한 지리적 범위는 소수의 화자로부터 긴 세션을 확보하는 것보다 수백 개의 지역에 걸친 모집이 필요하며, 이 규모에서의 분산된 모집은 더 작은 규모의 수집에서는 직면하지 않는 실패 모드(failure modes)를 도입합니다. 예를 들어, 기여자들의 과제 조작(gaming the task), 실시간 음성이 아닌 재생된 오디오 제출, 그리고 부주의한 주석 작업 등이 있습니다. 각 문제는 명시적인 검사를 통해 해결했습니다.
모집 및 녹음: 기여자들은 Voice Arena 커뮤니티를 통해 모집되었는데, 이곳은 말뭉치(speech corpora)가 거의 다루지 않는 농촌 및 준도시 지역까지 도달하는 글로벌 디지털 플랫폼입니다. 이후 참여자들은 동료 간 인터페이스(peer-to-peer interface)에서 이중 채널로 지정된 일상 주제에 대한 2인 대화를 녹음했습니다. 기여자들은 자신의 휴대폰과 연결을 사용했습니다. 그중 다수는 불안정한 대역폭의 저가형 장치였기 때문에, 이러한 조건이 필터링되어 제외되는 것이 아니라 공개된 오디오에 포함되어 있습니다. 잠재적 기여자들은 녹음 접근 권한을 부여받기 전에 언어 능력 심사(language proficiency screening)를 완료했으며, 보상을 받았고, 훈련 및 배포 사용에 대한 정보에 입각한 동의(informed consent)를 제공했습니다.
화자별 길이 제한(per-speaker duration cap)을 설정하여 해당 언어의 화자 인구 규모와 지리적 분포에 맞춰 조정했으며, 소수의 생산적인 기여자들(prolific contributors)이 특정 언어나 지역을 독점하는 것을 방지했습니다. 이 세트의 화자 중 절반 이상은 정확히 하나의 세그먼트를 제공합니다.정보 수집(Elicitation): 대규모로 자발적 발화를 유도하는 것은 그 자체로 어려움이 따릅니다. 기여자들은 구조화된 안내 없이 짧고 드문 응답을 하는 경향이 있기 때문입니다. 따라서 각 대화는 개방형 내러티브 단서(open-ended narrative cue)로 시작되었으며, 여행, 의료, 농업, 교육 및 디지털 서비스 등 다양한 영역에 걸쳐 후속 질문들이 점진적으로 공개되어, 스크립트에 의존하지 않으면서도 확장된 설명으로 대화를 이끌었습니다. 후보 주제들은 거대 언어 모델(large language models)을 사용하여 생성되었고, 이후 원어민 언어학자들에 의해 검토 및 현지화되었습니다.품질 관리(Quality control): 모든 녹음은 전사(transcription) 전에 일련의 게이팅 체크(gating checks)를 통과했습니다. 음성 언어는 30개 이상의 언어에 걸쳐 인간 주석 처리된 데이터로 훈련된 언어 식별 모델(language identification models)을 사용하여 할당된 언어와 비교 검증되었습니다. 화자 성별은 전용 분류기(dedicated classifier)를 사용하여 자체 보고 레이블과 대조하여 확인되었으며, 이는 대체 수단이라기보다는 자체 보고에 대한 보강 자료로 사용되었습니다. 또한 추가 모델이 진정한 자발적 대화와 사전 녹음되거나 재생된 오디오를 구별했습니다. 신호 대 잡음비(Signal-to-noise ratio) 추정은 명료성을 넘어선 수준으로 저하된 녹음을 제거했으며, 야외 환경의 음향적 현실성(acoustic realism of in-the-wild speech)을 유지하기 위해 자연적인 주변 배경 소음은 의도적으로 보존되었습니다. 이러한 검사를 통과한 녹음은 음성 활동 감지(voice activity detection)를 통해 세그먼트화되었고, 2초의 연속된 침묵 또는 다음으로 감지되는 침묵에서 끊어지는 15초의 소프트 상한선으로 분할되었습니다. 세그멘테이션은 채널별로 독립적으로 적용되어 모든 세그먼트는 단일 화자 및 단일 채널입니다. 이후 세그먼트들은 DNSMOS P.808 검사를 통과했습니다.전사(Transcription): 참고 전사본은 사람이 작업한 것입니다.
초안은 도메인 데이터로 학습된 내부 ASR 모델이 생성했으며, 이 중 어느 것도 공개 리더보드에 등재되어 있지 않아 해당 세트에서 평가된 어떤 시스템도 참조 값(references)에 기여하지 않았습니다. 이후 모든 단계는 5단계 프로토콜을 따른 원어민 언어학자에 의해 수행되었으며, 이는 엄격한 노동 분리(separation of labour)를 기반으로 합니다. 이 과정에서 각 교정 라운드 다음에는 다른 주석 작성자가 독립적으로 검증하는 검증 라운드가 이어지므로, 어떤 언어학자도 자신의 결과물을 감사하지 않습니다. 먼저 언어학자는 음성 신호에 맞춰 초안을 세그먼트별로 교정하고, 두 번째 언어학자가 이를 재검증하며 남아있는 불일치점을 표시합니다. 이후 단계에서는 새로운 주석 작성자들이 이 사이클을 반복하여 모호한 음성적 실현(phonetic realisations), 코드 스위칭 경계(code-switching boundaries), 고유 명사(named entities), 그리고 철자 변형에 걸친 표기 일관성을 점진적으로 해결합니다. 숫자는 단어로 작성되어 전사본이 발화된 내용과 직접적으로 일치하도록 합니다. 최종 단계에서도 여전히 플래그가 지정된 세그먼트는 승인되기 전에 재전사를 위해 반환되었습니다. 주석 작성자의 행동은 전체적으로 자동으로 모니터링되었으며, 대상 스크립트 외의 문자를 포함하거나, 부자연스러운 문자 또는 단어 반복, 그리고 비정상적으로 낮거나 높은 편집 횟수를 포함하는 제출물을 플래그 지정했습니다.
다음은 메타데이터가 어떤 종류의 평가를 가능하게 하는지 보여주기 위해 공개 인도 영어(Indian English) 분할 세트로 실행된 한 가지 예시입니다. 이 세트들이 존재하여 제공하려는 발견 자체가 아니라, 모든 클립에 화자 정보가 포함될 때 무엇이 답변 가능한지가 대한 설명입니다.
리더보드의 8개 모델이 이 세트에서 4.81과 4.99 사이의 WER(Word Error Rate)을 기록했습니다. 이는 최고점에서 최저점까지 0.18 포인트 차이이며, 5시간 안에 해결할 수 있는 범위 내에 있습니다. 코퍼스별로 순위를 매기면, 이들은 동일한 모델입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기