오디오 소수샷 학습을 위한 샘플 조건부 표현 선택
요약
본 논문은 오디오 소수샷 분류기의 표현 이동 문제를 해결하기 위해 SAMPLESELECT를 제안합니다. 이 방법은 입력마다 고정 예산의 특징 마스크를 예측하여, 전경과 배경 간의 상관관계 변화에 강인한 학습을 수행합니다. 실험 결과, SAMPLESELECT는 OOD 정확도와 전체 표현 제어 측면에서 기존 방법 대비 우수한 성능을 보였습니다.
핵심 포인트
- SAMPLESELECT는 오디오 소수샷 분류기의 표현 이동 문제를 해결하는 새로운 접근법입니다.
- 각 입력에 대해 고정 예산의 특징 마스크를 예측하여 강인한 학습이 가능합니다.
- OOD 정확도 및 전체 표현 제어에서 기존 방법 대비 성능 향상을 입증했습니다.
소수샷 오디오 분류기는 전경-배경 동시 발생(co-occurrences)에 의존할 수 있으며, 이러한 상관관계가 변화하면 실패할 수 있습니다. SpurAudio 데이터셋에서 발생하는 결과적인 표현 이동은 집중적이며 클래스에 따라 다릅니다: ResNet12의 경우, 상위 10% 채널이 무효화된(null-corrected) 이동 기여도의 82.80%를 설명합니다. 우리는 SAMPLESELECT를 제안하며, 이는 인코더와 소스 분류기를 고정한 상태에서 각 입력에 대해 독립적으로 고정 예산의 특징 마스크(feature mask)를 예측합니다. 학습에는 전경 분류 및 교차 배경 대조 손실(cross-background contrastive losses)을 사용한 미분 가능한 Gumbel Top-k 선택이 사용되며, 추론 시에는 결정론적 Top-k 마스크와 지원만 이용하는 선형 적응(support-only linear adaptation)을 사용합니다. 5-way 1-shot 및 5-shot 평가에서 ResNet12와 Conv64를 사용하여, SAMPLESELECT는 비교된 방법 중 가장 우수한 OOD(Out-of-Distribution) 정확도를 제공하며 매칭된 전체 표현 제어(full-representation control)를 4.90~8.38 퍼센트 포인트 향상시킵니다. 제거 분석 및 표현 분석은 학습된 선택 메커니즘을 추가로 뒷받침합니다. 코드는 https://github.com/Cross-Innovation-Lab/SAMPLESELECT/에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기