
【문과생도 3분 만에 이해】 G검정 「음성 인식·음성 처리」 공략|MFCC·HMM·CTC·WaveNet을 처리 흐름에 따라 정리
요약
G검정 대비를 위해 음성 인식 및 처리의 핵심 개념을 처리 흐름에 따라 정리한 가이드입니다. 디지털화부터 특징 추출, 음소 인식, 문자열 변환까지의 과정을 MFCC, HMM, CTC 등의 주요 용어와 함께 설명합니다.
핵심 포인트
- 음성 인식의 4단계 흐름: 디지털화 → 특징 추출 → 최소 단위 인식 → 문자열 변환
- MFCC는 인간의 청각 특성을 고려한 대표적인 음성 특징량임
- CTC는 입력과 출력의 길이가 다른 시계열 데이터를 대응시키는 핵심 메커니즘임
- HMM은 딥러닝 등장 이전 음성 인식의 표준 모델로 활용됨
안녕하세요. 2026년 1월 G검정에 합격한, 문과 출신 엔지니어입니다.
G검정 실라버스(Syllabus) 중에서 의외로 간과하기 쉬운 분야가 바로 음성 인식·음성 처리 분야입니다. "MFCC", "포먼트 (Formant)", "CTC", "WaveNet"…… 이미지나 자연어 처리(NLP)에 비해 친숙하지 않아, 문과인 저는 처음에 "주문인가?"라고 생각했습니다.
하지만 안심하세요. 음성 처리 용어는 **「소리가 텍스트가 되기까지의 처리 흐름」**에 따라 나열하기만 하면 단번에 깔끔하게 정리할 수 있습니다. 이 기사에서는 G검정에서 다뤄지는 포인트에 집중하여 해설합니다.
주의: 이 기사는 JDLA 인증 공식 콘텐츠가 아닙니다. 필자 개인의 학습 경험에 기반한 비공식 정보 공유입니다. 최신 실라버스는 JDLA 공식 사이트에서 확인하시기 바랍니다.
음성 인식 (Speech-to-Text)은 대략 다음과 같은 4단계 릴레이입니다.
소리를 디지털화하기 (A-D 변환) -
주파수의 특징 추출하기 (푸리에 변환 (Fourier Transform)・MFCC) -
소리의 최소 단위 인식하기 (음소 (Phoneme)・음운 (Phonology)) -
문자열로 변환하기 (HMM・CTC)
이 흐름을 머릿속에 넣고 개별 용어를 보면, "저 공정의 이야기구나"라고 연결됩니다.
소리는 공기의 진동(아날로그 신호)이므로, 먼저 컴퓨터가 다룰 수 있는 수치(디지털 신호)로 변환합니다. 이것이 A-D 변환입니다.
| 용어 | 대략적인 의미 |
|---|---|
| 표본화 (Sampling) | 소리의 파형을 일정 간격으로 나누어 기록함 |
| ... | |
| 비유: 연속된 소리의 파형을 「플립북 (Flip book)」으로 만드는 이미지입니다. 프레임 수(샘플링 주파수)가 많을수록 원래의 움직임을 충실하게 재현할 수 있습니다. |
디지털화된 소리의 파형은 그대로 두면 정보가 너무 많기 때문에, "어느 높이의 소리가 얼마나 포함되어 있는가"라는 주파수의 특징으로 변환합니다.
고속 푸리에 변환 (FFT): 시간별 파형을 주파수별 성분으로 분해하는 수법. 「소리의 프리즘」 이미지로, 섞인 소리를 성분별로 나눕니다 -
스펙트럼 포락선 (Spectral Envelope): 주파수 성분의 완만한 윤곽. 목소리의 특징이 나타납니다 -
포먼트 (Formant): 스펙트럼 포락선에 나타나는 산(Peak). 「아」「이」 등의 모음 식별에 중요합니다 -
멜 주파수 케프스트럼 계수 (MFCC): 인간의 청각 특성(낮은 음의 차이에는 민감하고, 높은 음에는 둔감함)을 고려한 특징량. 음성 인식의 입력으로서 가장 대표적이며, G검정 빈출 항목입니다
시험 포인트: "MFCC = 인간의 청각 특성을 고려한 음성 특징량"이라는 대응 관계를 파악해 두면, 선택지를 좁힐 수 있는 문제가 많습니다.
음소 (Phoneme): 단어의 의미를 구별하는 소리의 최소 단위 (예: 「카키」와 「사키」를 구분하는 /k/와 /s/) -
음운 (Phonology): 언어마다 정의되는 소리의 덩어리
음성 인식 모델은 이 작은 단위를 인식한 후 단어·문장으로 조합해 나갑니다.
딥러닝 (Deep Learning) 이전 음성 인식의 주역입니다. "직전의 상태로부터 다음 상태를 확률로 예측하는" 모델로, 음소의 나열을 확률적으로 추정합니다. **「딥러닝 등장 전 음성 인식의 표준 수법」**이라고 기억해 둡시다.
딥러닝 시대의 수법으로, G검정 빈출 항목입니다.
음성은 말하는 속도가 사람마다 다르기 때문에 "소리의 길이"와 "글자 수"가 일치하지 않습니다 (예: 「아ーー이」도 「아이」도 똑같은 2글자). CTC는 공백 문자 (Blank)를 도입하여 연속되는 동일한 출력을 하나로 묶음으로써, 길이가 다른 음성과 문자열을 대응시킵니다.
시험 포인트: "CTC = 입력과 출력의 길이가 다른 시계열 데이터를 대응시키는 메커니즘 (음성 인식에서 사용)"이라고 파악하면 OK입니다.
역방향인 「텍스트→음성」(음성 합성)에서 파악해야 할 것은 WaveNet입니다.
- DeepMind (Google 계열)가 2016년에 발표한 음성 생성 모델
- CNN 기반 (Dilated Causal Convolution)으로, 소리의 파형을 직접 생성함 -
- 기존의 기계적인 합성 음성에 비해 인간에 가까운 자연스러운 음성을 실현. Google 어시스턴트 등에 채택되었습니다.
"WaveNet = RNN이 아니라 CNN을 사용한 음성 합성"이라는 점이 함정 문제로 나오기 쉬우므로 주의가 필요합니다.
| 공정 | 키워드 |
|---|---|
| 디지털화 | A-D 변환, 표본화, 양자화, PCM |
| 특징 추출 | 고속 푸리에 변환, 스펙트럼 포락선, 포먼트, MFCC |
| 소리의 단위 | 음소, 음운 |
| 문자열화 | HMM, CTC |
| 음성 합성 | WaveNet (CNN 기반) |
음성 분야는 출제 수는 많지 않지만, 용어 대응만 외워두면 확실하게 득점할 수 있는 '가성비 좋은' 분야입니다. 처리 흐름과 함께 머릿속에 넣어두도록 합시다.
음성 인식(Speech Recognition)을 포함한 빈출 분야를 체계적으로 복습하고 싶은 분들에게는, 웹상에서 무료로 사용할 수 있는 학습 사이트인 AI 자격 대책 닷넷(AI資格対策ドットネット)을 추천합니다. 분야별 연습 문제로 자투리 시간에 지식을 확인할 수 있어, 저도 시험 직전 기간에 활용했습니다.
끝까지 읽어주셔서 감사합니다. 이 기사가 여러분의 합격에 도움이 된다면 기쁘겠습니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기