음성 인식 벤치마크 최적화 측정
요약
본 연구는 기존 음성 인식 벤치마크가 실제 환경의 복잡한 조건을 간과하는 문제를 지적하며, 'benchmaxxing' 현상을 정량화하기 위한 세 가지 새로운 테스트를 제안합니다. 이 테스트들은 모델이 오디오 내용보다 벤치마크 스크립트를 재현하거나 음향 단서에 의존하여 점수를 과대평가하는 경향을 밝혀냅니다.
핵심 포인트
- 전통적 ASR 벤치마크는 실제 환경의 복잡성을 간과함.
- 모델들이 오디오 내용보다 벤치마크 스크립트를 재현하는 'benchmaxxing' 현상 발견.
- 합의 불일치 프로브를 통해 모델이 오류에 직면했을 때의 전사 능력을 테스트함.
- 새로운 환경에서는 모델들이 오디오에 충실한 전사본으로 돌아오는 경향을 보임.
한 가지 이유는 전통적인 벤치마크가 음성 시스템을 실제 환경에서 신뢰할 수 있고, 자연스럽고, 문맥에 적절하며 효과적으로 만드는 많은 조건과 특성을 간과하기 때문입니다. 그래서 저희는 실사용에서 중요한 것을 더 많이 측정하기 위해 Real World VoiceEQ, Open-ASR Leaderboard, Far-field ASR Leaderboard에 홀드아웃 세트(held-out sets)를 도입했습니다.
하지만 단순히 측정 범위를 넓히는 것만으로는 문제를 해결할 수 없습니다. 이 현상은 때때로 벤치마크 최적화 또는 'benchmaxxing'이라고 불리며 머신러닝 전반에서 논의되지만, 음성 인식 분야에서는 측정하기 어려웠습니다.
저희의 최신 연구는 이를 정량화하는 데 도움을 주는 세 가지 테스트를 소개합니다. 저희는 널리 사용되는 11개의 오픈소스 ASR 모델을 평가했고, 최고 점수를 받은 여러 시스템들이 VoxPopuli English 및 LibriSpeech (clean, other) 데이터셋에서 벤치마크 스크립트를 재현하는 것을 발견했습니다. 심지어 오디오가 그 내용과 모순되거나, 관련 단어가 침묵 처리되었거나, 오디오가 두 가지 다른 서면 형태를 동등하게 지지할 때도 그러했습니다.
어떤 경우에는 모델들이 실제로 말한 내용뿐만 아니라, 어떤 벤치마크로 테스트되고 있는지를 나타내는 미묘한 음향 단서에 의존하는 것처럼 보였습니다. 그 결과, 이들의 점수는 일반적인 음성 전사 능력을 과대평가하게 만들었습니다.
VoxPopuli는 높은 수의 전사 오류를 포함하는 것으로 알려져 있습니다 (이것이 Artificial Analysis에서 정리된 버전을 출시한 이유입니다). 저희의 합의 불일치 프로브(consensus disagreement probe)는 주요 ASR 모델들이 이러한 오류에 직면했을 때 어떤 일이 발생하는지 테스트합니다: 오디오가 말하는 것을 정확하게 전사할까요, 아니면 벤치마크의 잘못된 참조 스크립트를 재현할까요?
이것을 대규모로 테스트하기 위해, 우리는 낮은 음소 오류율(PER)로 선정된 독립 모델들의 앙상블을 사용합니다. PER은 작성된 전사본이 오디오의 소리와 얼마나 가깝게 일치하는지를 측정하며, 이는 모델이 들리는 것을 얼마나 충실하게 전사하는지에 대한 유용한 대리 지표가 됩니다. 이 앙상블 결과를 사용하여, 여러 모델들이 기준(benchmark)의 참고 전사본과 만장일치로 의견을 달리하는 사례를 표시할 수 있습니다. 그런 다음 우리는 이러한 플래그 지정된 사례 중 일부를 인간 주석과 비교하여 수정된 전사본을 검증합니다.
예를 들어, VoxPopuli 클립 하나는 음성으로 "Thank you, Mr. President"라는 구절을 포함하고 있지만, 참고 전사본에서는 "Thank you"가 생략되어 있습니다. 우리가 테스트한 11개 모델 중 6개가 기준의 오류가 있는 전사본을 재현했는데, 이는 오디오와 모순됨에도 불구하고 "예상되는" 답변을 제공하는 경우였습니다. 실제 클립에서도 동일한 패턴이 나타납니다. 즉, "Thank you"를 생략하는 모델들은 또한 기준의 구두점 스타일을 재현하여 마침표 없이 "Mr"이라고 작성하는 반면, 들리는 구절을 포함하는 모델들은 마침표가 있는 "Mr."로 작성하는 경향을 보입니다.
우리가 EU 의회 녹음에서 새로 수집된 목소리나 일반적인 음성으로 동일한 콘텐츠를 제시할 때, 이러한 행동은 종종 약해지거나 사라집니다. 아래 샘플들에서는 단 하나의 모델을 제외하고 모든 모델이 새로운 의회 녹음의 클론에 대해 오디오에 충실한 전사본으로 되돌아갑니다. 이는 모델들이 기준 멤버십을 식별하는 데 도움이 되는 음향적 단서(acoustic cues)에 반응하여, 비록 그것이 오디오와 모순되더라도 예상되는 전사본을 생성한다는 것을 시사합니다.
이 클립의 기준 전사(reference transcript)는 "Mr President, I have another complaint about this procedure, which is that it is not secret."라고 읽습니다. 아래 세 클립의 오디오는 모두 동일한 내용을 말하고 있으며, 그 앞에는 들리는 "Thank you,"가 붙어 있습니다. 즉, 이 복제본(clones)들은 해당 문장 전체를 텍스트-음성 변환(text-to-speech)으로 구현한 것이므로, 예의 표현이 세 클립 모두에서 들립니다. 녹색 하이라이트와 ✅ 표시는 들리는 "Thank you,"가 포함된 전사본을 나타내며; 빨간색 하이라이트와 ❌ 표시는 벤치마크의 잘못된 누락을 재현한 전사본을 나타냅니다. 모든 전사본은 어떤 정규화(normalization) 처리도 거치지 않은 원시 모델 출력이며, 대소문자와 구두점은 생성된 대로 정확하게 보존됩니다.
Original VoxPopuli 녹음
동일 화자 음성 복제본
모든 모델의 학습 차단 시점 이후에 녹음된 의회 연설가 복제본
| Model | Real clip | Same-speaker clone | ep-fresh clone |
|---|---|---|---|
| CohereLabs/cohere-transcribe-03-2026 | ❌ Mr President… | ❌ Mr President… | ✅ Thank you, Mr President… |
| ... | 예의 표현을 누락함 (❌) | ||
| 6 | |||
| 5 | |||
| 1 |
Parakeet은 실제 클립에서 벤치마크를 재현하는 것과 동일 화자 복제본에서 정확하게 처리하는 것 사이를 오가는 유일한 모델입니다. Phi-4는 여전히 ep-fresh 복제본에서 예의 표현을 누락하는 유일한 모델입니다. 대신, 이 문장을 어떤 의회 녹음과도 연결되지 않은 일반적인 TTS 음성으로 재합성(resynthesize)했을 때, 모든 11개 모델이 예의 표현을 복원합니다.
이 결과는 이 문제가 광범위하고 의미가 있음을 시사합니다. 저희 방법론은 분석한 VoxPopuli 테스트 클립의 40%에서 잠재적인 기준 오류를 감지했으며, 이는 전체 기준 단어의 약 3%에 영향을 미쳤습니다.
벤치마크 최적화 행동을 보이는 모델들은 참고 전사본(reference transcripts)에서 오류를 낸 비율이 18–30%에 달했습니다. 아래 산점도(scatterplot)는 x축의 VoxPopuli 단어 오류율(Word Error Rate, WER)과 각 모델이 합의된 수정 사항 대신 벤치마크의 부정확한 참고 전사본을 재현하는 비율을 비교합니다. WER이 가장 낮은—따라서 보고된 벤치마크 성능이 가장 강력한—모델들이 이러한 오류를 재현할 가능성도 가장 높았습니다.

합의 불일치 탐지(consensus disagreement probe)를 확장하기 위해, 우리는 테스트 데이터셋 오디오 샘플에서 숫자를 의도적으로 제거하고 모델들에게 들리는 것을 전사하도록 요청했습니다. 해당 숫자는 오디오에서 문자 그대로 부재하므로, 모델들은 어떤 숫자도 출력해서는 안 되며, 하물며 텍스트에 정확한 숫자를 출력해서는 안 됩니다.
이러한 숫자들 중 일부는 반(半)예측 가능하지만 (비록 모델이 예측하기는 어려울지라도), 다른 일부는 상당히 놀랍습니다. 다음 클립은 두 가지 탐지 방식을 결합하여, 부정확한 숫자를 포함한 참고 전사본 오류를 모델들이 어떻게 재현하는지 보여주며, 심지어 한 모델은 제거되었음에도 불구하고 비교적 무작위적인 연도(2011)까지 자동 완성합니다. 아래 각 모델의 행에서:
- 취소선이 그어진 녹색 하이라이팅은 모델이 올바르게 재현하지 않은 참고 전사본 단어 (오디오 충실);
- 밑줄 친 녹색 하이라이팅은 참고 전사본의 오류가 있는 표현 대신 오디오에 충실한 정확한 삽입을 의미합니다;
- 빨간색 하이라이팅(일반 텍스트)은 참고 전사본의 오류가 있고 오디오를 뒷받침하지 않는 내용을 재현하는 것을 의미합니다:
복구율은 공개 벤치마크에서 가장 높았고, 보류되거나 새로 수집된 오디오(아래 ep-fresh 및 libri-fresh)에서는 더 낮았습니다. LibriSpeech의 경우, 일부 강력한 벤치마크 성능 모델들은 해당 숫자가 제거되었음에도 불구하고 약 30~40%의 예시에서 마스킹된 숫자를 재현했습니다. 이 효과는 여러 모델에 대해 새로 수집된 데이터에서 약해졌는데, 이는 단순히 텍스트 자동 완성이 아니라 주변의 벤치마크 관련 오디오가 모델이 참조(reference)를 복구하는 데 도움을 주었음을 시사합니다.

우리의 철자 전환 탐지기(orthographic switching probe)는 오디오에서 명확하지 않더라도 모델이 벤치마크의 참조 전사본에 사용된 정확한 철자를 재현하는지 테스트합니다. 철자 변형어(Orthographic variants)란 의미론적 및 음성적으로 동일하지만 다르게 철자될 수 있는 단어들입니다(1 vs one, Mr. vs mister, John vs Jon, Honor vs Honour 등). 이론적으로 모델은 한 철자를 다른 철자보다 일관되게 선호하거나, 그 사이를 대략 무작위 비율로 번갈아 사용해야 합니다. 만약 모델이 각 벤치마크의 참조 전사본에 있는 내용과 일치하도록 체계적으로 전환한다면, 이는 모델이 테스트가 기대하는 철자가 무엇인지 파악하고 있음을 시사합니다.
**전사:
LibriSpeech 내에서 우리는 오래된 간격 표기법과 관련된 *데이터셋 내부 전환(intra-dataset switch)*을 테스트합니다. 일부 참고 스크립트는 "any one"을 사용하고, 다른 스크립트는 "anyone"을 사용합니다. 우리는 주어진 변형에 대한 최소 정확도를 측정하며, 이를 "전환율(switch rate)"이라고 부릅니다. 만약 모델이 하나의 변형만 사용한다면 전환율은 0%가 될 것이고, 무작위로 선택하는 모델은 50%의 전환율을 가질 것으로 예상됩니다. 모든 테스트 샘플에서 어떤 변형을 사용해야 하는지 아는 모델은 100%의 전환율을 얻게 됩니다.

두 번째 프로브에서는 *데이터셋 간 전환(inter-dataset switch)*을 테스트하는데, 이 경우 각 벤치마크가 자체 테스트 코퍼스 전반에 걸쳐 다른 철자 표기법을 사용합니다. 예를 들어, VoxPopuli는 약어 "Mr.,"를 사용하는 반면 LibriSpeech는 "Mister."라고 풀어서 씁니다.
여러 모델이 50%의 무작위 선택 기준선을 초과했으며, 일부는 약 90%의 전환 정확도에 도달했습니다. 이는 모델들이 오디오 샘플이 어느 데이터셋에서 왔는지 식별하고, 두 형태 모두 소리가 동일하더라도 해당 벤치마크가 기대하는 철자 표기법을 선택할 수 있음을 시사합니다.

이러한 행동이 공개된 벤치마크를 넘어 일반화되는지 테스트하기 위해, 우리는 또한 모델의 학습 차단 이후에 동일한 소스 도메인에서 새로운 데이터를 수집했습니다. VoxPopuli를 위한 최근 유럽 의회 녹음과 LibriSpeech를 위한 새로 활동하는 LibriVox 내레이터들의 녹음을 사용했습니다. 그러나 같은 도메인에서 최근에 수집된 데이터가 제시되었을 때, 많은 모델들이 참고 스크립트 일치를 멈추고 오디오 충실도가 높은 전사(transcriptions)로 되돌아갑니다.
다른 개입(interventions)들 역시 같은 결론을 가리킨다. 오디오에는 존재하지만 참조 전사본(reference transcript)에서는 누락된 구절들은 모델에게 오디오를 번역하도록 요청하거나 주의(attention)가 관련 프레임에 제한될 때 다시 나타날 수 있다. 주변 벤치마크 컨텍스트를 잘라내거나, 일반적인 대화형 오디오를 추가하는 것 역시 충실한 전사본을 복원할 수 있다. VoxPopuli 오디오를 추가하는 것은 반대의 효과를 가져와, 그렇지 않으면 충실했던 합성(synthetic) 또는 마이닝된 샘플들이 벤치마크 참조와 더 잘 일치하도록 만들 수 있다.

종합적으로 볼 때, 이러한 결과들은 모델들이 말로 된 단어들을 충실하게 전사할 수는 있지만, 오디오를 따라야 할지 아니면 벤치마크 특정 전사 정책을 따라야 할지를 결정하기 위해 주변 음향 컨텍스트(acoustic context)를 사용하고 있음을 시사한다.
우리의 발견은 두 개의 주요 오픈소스 데이터셋에서 일부 모델들이 데이터셋과 관련된 음향 단서(acoustic cues)를 감지하고 그에 맞춰 전사 행동을 조정한다는 것을 보여준다. 구체적으로, 모델들은 오디오에는 없지만 참조 전사본에는 존재하는 단어들을 재현하거나, 침묵했던 숫자들을 높은 비율로 복구하거나, 주변 음향 컨텍스트를 사용하여 특정 벤치마크가 기대하는 서면 변형(written variant)을 선택할 수 있다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기