노이즈 제거를 통해 소리를 깨끗하게 하면 이상 감지 성능이 좋아질까? — DCASE 2026에서 고찰
요약
본 기사는 녹음된 소리에서 노이즈 제거가 이상 감지 성능에 미치는 영향을 다룹니다. 근접/원거리 마이크 데이터를 활용하여 4가지 조건(B0, B1, W1, SS)을 비교하며, 노이즈 제거를 먼저 수행하는 방식도 높은 성능을 보임을 분석합니다.
핵심 포인트
- 노이즈 제거가 이상 감지 성능에 미치는 영향을 다각도로 검증함.
- 단순히 마이크 녹음을 빼는 것만으로는 잡음 제거가 어려움.
- 노이즈 제거를 먼저 수행하는 방식도 높은 평가를 받았습니다.
서론
본 기사에서는 동기화된 근접 마이크와 원거리 마이크의 녹음을 사용하여, 근접 조건만(B0), 원거리 조건만(B1), 복소수 감산(W1), 스펙트럼 감산(SS)의 4가지 조건을 비교합니다. 후단 검지기는 고정하고 정상 참조 또한 각 조건에 맞게 재구성하여, 노이즈 제거가 이상 감지 성능에 어떤 영향을 미치는지 확인해 보겠습니다. 처리 방식, 검출 점수, 동일한 실제 녹음의 그림 순서로 살펴보겠습니다.
지난 기사에서는 작동 중인 기계 소리에서 변화를 발견하는 이상 음 감지와 DCASE 2026 Task 2의 2마이크 설정을 소개했습니다. 1위를 차지한 MERL 기술 보고는 잡음을 제거한 소리를 만들지 않고, 이상을 찾기 위한 특징을 직접 추출하는 방식이었습니다.
설비 상태 모니터링에서는 이상을 발견한 후에 소리를 다시 들어보고 무엇이 변했는지 조사하고 싶어집니다. 그래서 이번에는 판정 전에 노이즈 제거를 수행하여 재생 가능한 파형을 남기는 방법을 시도합니다.
본 기사의 재현 코드와 marimo 앱
본 기사 실험용으로 필자가 asd-experiments를 공개했습니다. 본 기사의 처리 비교 조건과 실행할 코드를, 저장 결과, marimo 앱을 모아 놓았습니다.
- 결과와 그림을 보고 소리를 비교하기: marimo 앱. 브라우저에서 저장된 4가지 조건의 결과와 그림을 읽고 전체 길이 6초의 음성을 재생할 수 있습니다. 설치나 데이터 취득은 필요하지 않습니다. - 계산 실행하기: 리포지토리의 README에서 실행 절차로 이동할 수 있습니다. 공식 배포 데이터와 이상 감지 재추론에는 BEATs_iter3 가중치가 필요합니다(입력 획득). - 설정 및 결과 확인하기: 고정 조건, 검증 범위, 종합 점수 CSV.
원거리 마이크의 소리를 그대로 빼기는 어렵다
근접 마이크에는 대상 기계의 소리가 비교적 강하게 들어옵니다. 원거리 마이크에서는 주변 잡음의 비율이 상대적으로 커집니다.
그렇다면, 근접 마이크 녹음에서 원거리 마이크 녹음을 빼면 잡음만 제거할 수 있을 것 같습니다.
하지만 같은 소리라도 2개의 마이크에 도달하기까지 거리가 다릅니다. 소리의 크기뿐만 아니라, 도착의 지연이나 반사의 영향도 달라집니다. 파동의 봉우리와 골짜기의 위치가 어긋나 있다면, 그대로 빼더라도 상쇄시키기는 어렵습니다.

그림은 하나의 높이의 소리만으로 만든 설명용 합성 신호입니다. 하단에서는 조정된 원거리 쪽 파형이 근접 쪽에 겹치고, 빼기 후 남은 것이 거의 0이 됩니다.
게다가, 원거리 마이크에도 대상 기계의 소리가 들어 있습니다.
즉, 빼기 전에 조정이 필요하며, 뺀 성분이 모두 잡음이 되는 것은 아닙니다.
노이즈 제거를 먼저 수행하는 방법도 상위권에 있었다
DCASE 2026 Task 2는 주변 잡음이 있는 녹음에서도 이상을 발견할 수 있는지 묻는 과제입니다.
다른 기법들을 살펴보면, 먼저 노이즈 제거를 수행하고 그 소리에서 이상을 찾는 시스템도 상위권에 있습니다.
1회차에서 소개한 1위 MERL과, 먼저 노이즈 제거를 하는 2위 Wu_CUMT, 4위 Qian_nivic을 비교합니다. 순위는 각 팀의 최고 제출 시스템을 하나씩 비교한 것입니다.
**Evaluation(평가용)**은 대회 순위를 결정한 5개 기종, **Development(개발용)**은 기법 검토에 사용된 다른 7개 기종입니다.
표의 AUC는 정상 소리와 이상 소리를 구별하는 성적이고, pAUC는 오경보를 적게 억제한 범위에서의 성적입니다. 둘 다 100배 한 값으로 표시되며, 높을수록 좋은 성적입니다.
| 팀별 순위 | 제출 시스템 (노이즈 대응) | Evaluation 공식 점수 | Evaluation AUC / pAUC 평균 | Development AUC / pAUC 평균 |
|---|---|---|---|---|
| 1위 | Fujimura_MERL_task2_3 (노이즈에 강한 특징을 직접 생성) | 70.241 | 73.95 / 65.43 | 73.09 / 62.23 |
| 2위 | Wu_CUMT_task2_4 (시간에 따라 빼는 방식을 업데이트) | 65.462 | 70.38 / 59.82 | 73.02 / 58.65 |
| 4위 | Qian_nivic_task2_2 (음의 높이별로 강도를 빼기) | 64.428 | 69.06 / 61.36 | 70.69 / 56.72 |
DCASE 2026 Task 2 Results의 기종별 AUC・pAUC를 각 데이터 내에서 단순 평균하여 오른쪽 두 열에 표시했습니다. 순위를 결정하는 공식 점수와는 집계 방법이 다릅니다. 또한, Evaluation과 Development에서는 기종이 다르므로 양쪽 수치를 직접 비교할 수 없습니다.
이 3개 팀 중에서 MERL이 두 데이터셋의 AUC 및 pAUC 모두에서 가장 높은 결과를 보였습니다. 한편, Evaluation의 pAUC에서는 4위인 Qian_nivic의 61.36점이 2위인 Wu_CUMT의 59.82점을 능가합니다. 어떤 지표를 보느냐에 따라 팀 간 성적 순서도 달라집니다.
Wu_CUMT는 멀리 있는 마이크 소리를 단서로 삼아, 가까운 마이크에 들어온 노이즈를 추정하여 뺍니다. 노이즈가 전달되는 방식의 변화를 고려하여 빼는 방식을 시간에 따라 업데이트하는 **칼만 필터(Kalman Filter)**를 사용합니다. (Wu_CUMT 기술 보고서)
Qian_nivic은 소리를 주파수별 성분으로 나누고, 먼 쪽 성분의 세기를 가까운 쪽에서 빼는 **스펙트럼 감산(Spectral Subtraction)**을 사용합니다. 너무 많이 뺄 경우, 가까운 쪽 성분을 약간 남겨둡니다. (Qian_nivic 기술 보고서)
Qian_nivic의 수식: 성분의 세기를 빼기
녹음을 짧은 시간 단위로 나누어 소리의 높이(주파수)별 성분으로 나눕니다. 각 성분의 크기와 파동의 마루와 골 위치 차이(위상)를 하나의 값으로 다룰 수 있는 것이 **복소수(Complex Number)**입니다.
기술 보고서에서는 가까운 마이크의 성분을 크기로, 0 이상의 실수로 표현합니다.
보고된 노이즈 제거 수식은 다음과 같습니다.

여기서 빼는 것은 복소수의 크기입니다. 파형으로 되돌릴 때는 가까운 마이크 성분의 진동 차이(위상)를 그대로 사용합니다.
이번 SS는 수식 (1)의 감산을 16 kHz, 창 길이 512, 이동 폭 256 샘플로 사용하여 가까운 쪽의 위상으로 파형을 되돌립니다. Qian_nivic의 EAT 등 시스템 전체를 재현하는 것은 아닙니다.
둘 다 노이즈와 추정된 성분을 빼고, 성분별 수치에서 재생할 수 있는 파형으로 되돌립니다. 그 후, 학습된 음향 모델로 특징을 추출하여 이상을 판정합니다.
즉, 미리 노이즈 제거를 수행하는 방법 역시 이상 탐지(Anomaly Detection)의 유력한 선택지가 되고 있습니다.
다만, 대회 순위는 노이즈 제거와 그 이후의 특징 추출 방식 및 판정 방법을 종합한 결과입니다. 순위만으로는 노이즈 제거가 얼마나 효과적이었는지 알 수 없습니다.
그래서 이번에는 이상을 판정하는 쪽은 동일하게 하고, 전달되는 소리를 바꿨을 때의 차이를 조사합니다.
주파수별로 빼는 방식을 조정하기
이번에 사용한 것은 멀리 있는 마이크 소리의 크기와 파동의 차이를 조정하여 가까운 마이크 소리에서 빼는 **선형 감산(Linear Subtraction)**입니다. 실험 내에서는 W1로 표기합니다.
먼저, 녹음을 짧은 시간 단위로 나누어 낮은 웅웅거리는 소리, 높은 소리 같은 성분으로 나눕니다. 이 소리의 높이에 해당하는 것이 **주파수(Frequency)**입니다.
다음으로, 높이별로 먼 쪽 성분을 가까운 쪽 성분에 가깝게 만드는 조정값을 구합니다. 소리의 크기에 더해 진동의 차이도 조정한 후 뺍니다.
이 크기와 진동의 차이(위상)를 하나의 값으로 다루기 위해 계산에는 복소수를 사용합니다.
이를 수식으로 나타내면 다음과 같습니다.

복소수를 화살표로 그리면, 길이가 성분의 크기, 방향이 위상에 해당합니다. 가로 방향의 값이 실수부(Real Part), 세로 방향의 값이 허수부(Imaginary Part)입니다. 그림은 조정값을 하나 임시로 선택한 예이며, 검은색 화살표는 조정된 먼 쪽과 가까운 쪽 사이에 남은 차이를 나타냅니다.
그렇다면, 그
이것을 사용해서 양쪽에 들어온 주변 소음을 줄이는 것이 목표입니다.
노이즈만 골라서 작게 만드는 것은 아닙니다. 먼 마이크에도 기계음이 들어가기 때문에, 남기고 싶은 기계음까지 깎아낼 가능성이 있습니다.
계산에서는 남은 성분의 크기를 제곱하고, 녹음 전체에 걸쳐 더한 값을 가능한 한 작게 만듭니다.
복소수입니다. 0 이상의 실수가 됩니다.
이 값이 작아지는 후보
이 처리를 위해 대량의 소리를 모아 모델을 학습시킬 필요는 없습니다.
이 빼기는 기존 신호 처리 기반 방법입니다. 같은 형태의 선형 감산은 Ozeki 기술 보고서에서도 사용되었습니다.
이번에는 이 방법으로 노이즈 제거를 가했을 때, 이상을 찾기 쉬워졌는지 측정합니다.
W1의 조정값을 구하는 수식
W1로 조정값을 계산하는 수식
2채널을 단시간 푸리에 변환(STFT)하여 주파수별 계수를 구합니다. 수식 (3)의 제곱합을 최소화하는 복소 최소 제곱해를 기반으로, 값을 안정화시키는 항을 더하여 수식 (2)에서 사용하는
**복소 켤레(Complex Conjugate)**는 소리의 크기와 진동의 차이(위상)를 함께 다루기 위해 사용합니다. 분자는 복소수이고, 분모는 실수입니다. 양의 실수이며, 구현에서는
W1의 입력은 동기화된 근접/원거리 2채널입니다. 16 kHz, 창 길이(window length) 1,024, 이동 폭(hop size) 512 샘플로, 녹음 전체에서 식 (4)의 계수를 구합니다. 정규화(normalization), 끝 처리(end processing), 파형 복원(waveform reconstruction) 등의 자세한 내용은 상기 리포지토리의 고정 조건에 정리되어 있습니다.
검출기를 통일하여 노이즈 제거 효과를 확인하기
이번 이상 감지는 다음 흐름으로 진행됩니다.
음의 특징을 수치로 변환하는 부분에는 학습된 음향 모델 BEATs를 사용합니다. 소리를 짧은 시간과 높이별 영역으로 나누고, 각각의 특징을 추출합니다.
그 후에는 MERL 기술 보고서를 참고하여 다음 3가지 처리를 사용했습니다. 채택한 것은 특징의 집약(aggregation), 비교(comparison), 보정(correction)이며, MERL 시스템 전체를 재현하는 것은 아닙니다.
- 짧은 시간 동안만 나타나는 특징도 남기기 (RDP). RDP 논문에서 제안된 처리입니다. 음의 높이별로 시간 방향의 특징을 모읍니다. 녹음 내 평균적인 특징에서 벗어난 구간을 가중치 있게 다루어, 짧은 시간 동안만 나타나는 변화가 단순한 평균에 묻히지 않도록 합니다. - 음의 높이별로 정상 음과 비교하기 (BEAM). 정상 음의 특징을 높이별로 저장하고, 조사하는 녹음의 특징과 각각의 정상 음과의 거리를 계산합니다. 높이별로 비교하므로, 낮은 음과 높은 음에서 다른 정상 녹음을 참조할 수도 있습니다. - 정상 음으로 인해 발생하는 점수 편차 보정하기 (VarMin). 정상적인 녹음에서도 녹음 및 운전 조건에 따라 거리의 크기에 편차가 발생합니다. 그 편차를 정상 음 데이터로부터 보정합니다. 보정된 거리가 가장 작은 정상 음을 높이별로 선택하고, 그 값을 평균하여 하나의 이상 점수를 만듭니다.
이번 비교에서는 BEATs_iter3의 가중치를 고정하고, frequency RDP (γ=4), BEAM, VarMin (근접 수 4, train_all / per_band)을 공통으로 사용합니다. 특징 추출 모델에 추가 학습은 진행하지 않습니다.
바꾸는 것은 그곳으로 전달되는 소리입니다.
| 조건 | 전달하는 소리 | 확인하고자 하는 것 |
|---|---|---|
| 근접 마이크만 (B0) | 원본 녹음 | 노이즈 제거를 하지 않은 경우의 기준 |
| ... | ||
| SS는 Qian_nivic의 식 (1), W1은 Ozeki 기술 보고서와 동일한 형태의 복소 뺄셈을 사용한 비교 조건입니다. 둘 다 후단은 상기 공통 검출기를 사용합니다. |
노이즈 제거 방법과 이상 판정 방법을 동시에 바꾸면, 어느 것이 효과가 있었는지 알 수 없습니다. 우선, 입력을 변경하는 것만으로 개선되는지를 확인합니다.
각 조건에서 정상 음의 특징을 추출하여 비교 기준이 되는 정상 참조를 다시 만듭니다. W1과 SS에서는 정상 음에도 테스트 음과 같은 노이즈 제거를 수행합니다. 노이즈 제거한 녹음을 원본 정상 음과 비교하면, 그 처리에 의한 소리 변화를 이상으로 판단할 가능성이 있기 때문입니다.
평가 대상은 Evaluation의 5개 기종입니다. 대회 종료 후 공개된 데이터를 사용하여 B0・B1・W1・SS는 각 기종에 대해, 정상 기준을 만드는 녹음 1,000건과 성능을 측정하는 테스트용 녹음 200건으로 검증했습니다. 테스트 음은 정상 기준 만들기에 사용하지 않습니다.
테스트용 녹음에는 정상 음과 이상 음이 포함됩니다. 검출기는 정답을 보지 않고 '정상 음으로부터의 벗어남'을 부여하고, 채점 시 정답과 대조합니다. 정상 음만으로 기준을 만들고, 이상 음까지 포함하여 성능을 측정하는 방식입니다.
W1에서 종합 점수가 오르고, SS에서는 내려갔다
아래는 본 실험의 종합 점수 CSV에 저장된 결과입니다.
앞서 언급한 대회 결과표는 각 팀의 특징 모델이나 판정 방법을 포함한 시스템 전체의 성적입니다. MERL은 NA-BEATs를 사용하고, 이번 검출기는 고정 BEATs_iter3를 사용하여, 여기서 비교하는 것은 같은 검출기에 전달되는 소리를 바꿨을 때의 차이입니다. 대회 후에 공개된 정답을 사용한 검증이므로, 공식 대회 순위와는 분리하여 다룹니다.
| 조건 | 이번 검증 점수 | 근접 마이크만과의 차이 |
|---|---|---|
| B0: 근접 마이크 | 62.841 | — |
| ... | +3.994 포인트 |
스펙트럼 뺄셈(SS)은 62.325로, B0보다 0.516 포인트 낮은 결과였습니다. 이 비교에서는 성분의 크기만 빼는 SS보다 진폭과 위상을 맞추는 W1의 성적이 더 높았습니다.
종합 점수는 5개 기종의 source AUC・target AUC・pAUC, 총 15개 지표의 조화 평균을 100배한 것입니다. 높을수록 좋은 성적이며, 탐지율 그 자체는 아닙니다. 지표와 집계 정의는 DCASE 2026 Task 2 평가기 README를 참조하십시오.
근접 마이크만인 경우에 비해 선형 뺄셈(W1)을 더하자 62.841에서 66.835로, 3.994 포인트 개선되었습니다.
먼 마이크만으로는 가까운 마이크보다 낮은 결과였습니다. 하지만, 그 녹음을 빼는 단서로 사용하자 성적이 올랐습니다. 먼 쪽은 가까운 쪽을 보조하는 정보로서 역할한 형태입니다.
다만, 전체 성적만으로는 특정 기종에서 악화되었는지 알아보기 어렵습니다. 그래서, 기종별 결과도 확인했습니다.
기종별로 가까운 마이크 단독(B0)에 뺀 값(W1)을 더했을 때의 개선을 살펴봅니다. 여기서는 오경보를 적게 줄인 범위의 탐지 성과인 pAUC를 비교합니다. 현장에서는 정상 설비에 대한 경보가 너무 많으면 확인 작업이 늘어나기 때문입니다.
| 기종 | 가까운 마이크 단독(B0) | 뺀 값 적용 후(W1) | 스펙트럼 감산(SS) |
|---|---|---|---|
| 집진기 (BlowerDustCollector) | 72.000 | 73.158 | 73.474 |
| ... | |||
| 표는 pAUC를 100배한 값으로, 높을수록 좋은 성적입니다. W1은 이번의 5개 기종 모두 상승했습니다. 다만, 개선 폭에는 차이가 있습니다. SS는 B0에 비해 집진기・연마기에서 오르고, 재봉틀・전동 칫솔・소형 드론에서는 하락했습니다. 2개 기종에서 상승하고, 3개 기종에서 하락하여, 전체적으로는 개선되지 않았습니다. |
이 결과는 이번의 5개 기종과 고정된 탐지기・설정에서의 비교입니다. 다른 기종이나 녹음 환경에서의 효과는 향후 검증 과제입니다.
같은 실녹음을 스펙트로그램으로 비교하기
여기서는 합성 신호 그림이 아니라, 전동 칫솔의 정상 녹음 6초를 사용한 실제 예시입니다. 서두에서 소개한 marimo 앱의 저장된 그림을 게재합니다.
각 그림의 중앙은 스펙트로그램이며, 가로축은 시간, 세로축은 주파수, 색상은 성분의 강도(dB)를 나타냅니다. 4가지 조건 모두 전체 길이 6초・08,000 Hz・−1000 dB의 같은 표시 척도로 개별적으로 정규화하지 않았습니다. 표시용 STFT는 창 크기 2,048・이동 폭 512 샘플입니다.
B0: 근접 마이크

처리 전의 기준입니다. 기계음과 환경음이 섞여 있습니다.
B1: 원거리 마이크

동시 시점의 원거리 쪽입니다. 기계음을 포함하므로, 잡음만의 참조는 아닙니다.
W1: 복소 감산

녹음 전체에서 구한 주파수별 복소 계수로, 원거리에 공통하는 성분을 근접에서 뺀 출력입니다.
SS: 스펙트럼 감산

원거리의 크기를 근접에서 빼고, 근접의 위상으로 되돌린 출력입니다.
이 녹음에는 기계음만의 정답 파형이 없습니다. 그림으로부터 소리 성분의 변화는 관찰할 수 있지만, 기계음을 얼마나 남겼는지, 또한 이상 탐지 성능이 개선되었는지는 이 모습만으로는 판단할 수 없습니다. 앞 절의 성적은 데이터셋 전체의 평가입니다.
실녹음 유래 그림・청취 음성 출처: Nishida 외, DCASE 2026 Additional Training Dataset v1. 근접・원거리 선택, W1・SS 가공, 작도・PCM16 음성화 등을 진행했습니다. CC BY-NC-SA 4.0 (저자・출처 상세).
남은 과제와 다음에 확인하고 싶은 것
그렇다면, 기계음이 듣기 쉬워졌을까요?
거기는 이번의 평가 스코어만으로는 알 수 없습니다. 소리를 재생할 수 있는 형태로 보존한 것과 사람이 듣기 쉬워진 것은, 나누어 확인할 필요가 있습니다.
이번 W1에는 다음 3가지 제약이 있습니다.
- 남기고 싶은 기계음도 깎아낼 가능성. 먼 마이크에도 기계음이 들어가므로, 두 녹음에 공통하는 성분으로 이상 단서까지 약화시킬 가능성이 있습니다. -
여러 소음을 하나의 조정값으로는 맞추지 못할 때가 있다. 같은 높이의 소리라도, 소음원의 방향이 다르면, 2개의 마이크에 도달하는 크기나 위상의 관계가 다릅니다. 그러한 소음이 겹치면, 하나의 조정값으로 모두 상쇄하기는 어렵습니다. -
녹음 중 전달 방식의 변화를 따라가지 못한다. W1은, 소리 높이별로 구한 조정값을 하나의 녹음 안에서는 고정합니다. 소음원이 움직이는 등 중간에 전달 방식이 바뀌면, 빼기가 맞지 않게 됩니다.
이것들은 W1의 구조에서 알 수 있는 제약입니다. 각각이 탐지 성적에 미치는 영향은, 앞으로 분리하고 싶은 부분입니다.
다음번에는, BEATs를 파인튜닝(fine-tuning)하면 이상 탐지 성능이 어떻게 변하는지를 확인하겠습니다. 이번에 사용한 BEATs_iter3을 기준으로 데이터 분할과 평가 조건을 맞추어, 파인튜닝 전후를 비교합니다.
참고 자료
- Takuya Fujimura 외, The MERL Systems for DCASE 2026 Challenge Task 2 (MERL 기술 보고), 2026.
Hao Wu 외, Unsupervised Anomalous Sound Detection via EAT and Kalman-Filtered Near- and Far-Field Dual-Channel Data (Wu_CUMT 기술 보고서), 2026.
Fan Chu와 Mengui Qian, Dual-Channel Spectral Subtraction 및 Efficient Audio Transformer를 사용한 DCASE 2026 Task 2용 이상 음향 감지 시스템 (Qian_nivic 기술 보고서), 2026.
Kosei Ozeki 외, 간단한 노이즈 제거를 이용한 이상 음향 감지 방법 (Ozeki 기술 보고서), 2026.
Kevin Wilkinghoff, Sarthak Yadav 및 Zheng-Hua Tan, Self-Supervised Audio Embeddings를 사용한 학습 불필요(Training-Free) 이상 음향 감지를 위한 시간적 풀링 전략 (RDP 논문), 2026.
설명용 스펙트로그램은 Wandas로 작성했습니다.
토론

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기