EEG를 통해 뇌가 두 개의 음성 스트림을 동시에 인코딩할 수 있음을 확인
요약
EEG를 통해 인간의 뇌가 주의를 전환하는 과정에서 두 개의 음성 스트림을 일시적으로 동시에 인코딩할 수 있음을 입증했습니다. 연구는 주의 전환 시 발생하는 비대칭적 과정과 어휘 문맥 업데이트 메커니즘을 규명했습니다.
핵심 포인트
- 주의 전환 시 새로운 스트림의 신경 추적이 이전 스트림 이탈 전 나타남
- 주의 전환 과정은 EEG 알파 파워 감소와 밀접하게 연관됨
- LLM 기반 문맥 축적 전략을 통해 어휘 문맥 재설정 가능성 확인
- 복잡한 청취 환경에서의 뇌의 유연한 언어 처리 능력 규명
Figures
Abstract
다중 화자 시나리오에서 성공적인 언어 소통을 위해서는 지속적인 주의 (sustained attention)와 신속한 주의 전환 (rapid attention switching)의 숙련된 조합이 필요합니다. 신경생리학 문헌은 지속적인 주의의 신경학적 기초에 대한 상세한 통찰을 제공하지만, 주의 전환이 어떻게 일어나는지에 대해서는 여전히 상당한 불확실성이 남아 있습니다. 본 연구에서는 몰입형 다중 화자 환경에 있는 정상 청력을 가진 성인으로부터 얻은 EEG 기록을 사용하여, 배경 소음 (background babble) 속에서 두 개의 경쟁하는 음성 스트림 (speech streams)에 대한 신경 인코딩 (neural encoding)을 측정했습니다. 참가자들은 15~30초마다 스트림 사이에서 주의를 전환하도록 유도되었습니다. 신경 추적 (Neural tracking)은 시간 응답 함수 (Temporal Response Functions, TRF)를 통해 평가되었으며, 주의 집중 (attentional focus)의 신뢰할 수 있는 디코딩 (decoding)을 확인했습니다. 우리의 결과는 주의 전환 중에 비대칭적인 이탈 (disengagement) 및 참여 (engagement) 과정이 있음을 나타내며, 여기서 새로운 대상 스트림의 신경 추적이 이전 대상으로부터 이탈하기 전에 나타남으로써 두 개의 음성 스트림이 일시적으로 동시에 인코딩됨을 보여줍니다. 이러한 전환은 EEG 알파 파워 (alpha power)의 감소와 밀접하게 반영되었으며, 이는 주의 전환의 서로 다른 단계 동안의 인지적 노력 (cognitive effort)에 대한 정보를 제공합니다. 그런 다음 우리는 어휘 예측 메커니즘 (lexical prediction mechanisms)을 반영하는 피질 활동을 분리하여 주의 전환 후 어휘 문맥 (lexical context)이 어떻게 업데이트되는지 결정하였으며, 거대 언어 모델 (Large Language Models, LLMs)을 사용하여 구축된 네 가지 문맥 축적 전략을 비교했습니다. 우리의 연구 결과는 청각적 주의 전환의 기저에 있는 시간적 및 문맥적 메커니즘을 규명하며, 청자가 주의를 전환한 후 어휘 문맥을 재설정 (reset)할 가능성을 시사합니다. 동적인 주의 재할당 (attentional reallocation)에 초점을 맞춤으로써, 본 연구는 복잡한 청취 환경에서 유연한 언어 처리를 수행하는 뇌의 능력에 대한 통찰을 제공합니다.
인용 (Citation): Carta S, Aličković E, Zaar J, López Valdés A, Di Liberto GM (2026) Competing speech streams are simultaneously represented in the human cortex during attention switching. PLoS Biol 24(7): e3003876.
학술 편집자 (Academic Editor): Manuel S. Malmierca, Universidad de Salamanca, SPAIN
접수일 (Received): 2025년 7월 3일; 승인일 (Accepted): 2026년 6월 12일; 게재일 (Published): 2026년 7월 16일
저작권 (Copyright): © 2026 Carta et al. 본 논문은 크리에이티브 커먼즈 저작자표시 라이선스(Creative Commons Attribution License) 조건 하에 배포되는 오픈 액세스 기사로, 원저자와 출처만 명시된다면 모든 매체에서 제한 없이 사용, 배포 및 복제가 가능합니다.
데이터 이용 가능성 (Data Availability): 본 원고에서 보고된 연구 결과를 뒷받침하는 모든 데이터는 제한 없이 자유롭게 접근할 수 있습니다. EEG 전처리 데이터셋, 결과 분석 파일, 그리고 분석 코드는 오픈 리포지토리 Zenodo(https://zenodo.org/records/20569817)에 공개되어 있습니다. EEG 기록은 Continuous-event Neural Data (CND) 형식 표준을 따릅니다. 관련 음성 자극 또한 동일한 리포지토리의 STIMULI 폴더에서 찾을 수 있습니다.
연구비 지원 (Funding): S.C., A.L.V., 및 G.D.L.은 William Demant Fonden(https://www.williamdemantfonden.dk/)으로부터 보조금 21-0628 및 22-0552를 통해, 그리고 Taighde Éireann – Research Ireland(https://www.researchireland.ie/)로부터 지원금 No. 18/CRT/6223을 통해 지원받았습니다. G.D.L.은 추가적으로 Trinity College Dublin의 ADAPT (Research Ireland Centre for AI-Driven Digital Content Technology, https://www.adaptcentre.ie/)에서 연구 지원을 받아 이 연구를 수행했습니다 [지원금 13/RC/2106_P2]. 자금 지원 기관들은 연구 설계, 데이터 수집 및 분석, 출판 결정 또는 원고 준비에 관여하지 않았습니다.
이해 상충 (Competing interests): 저자들은 이해 상충되는 부분이 없음을 선언했습니다.
약어:
EEG, 뇌전도 (electroencephalography);
EOG, 안전도 (electro-oculography);
EMG, 근전도 (electro-myography);
ERSP, 사건 관련 스펙트럼 섭동 (event-related spectral perturbation);
iEEG, 침습적 뇌전도 (intra-cranial electroencephalography);
FDR, 허위 발견율 (false discovery rate);
fMRI, 기능적 자기공명영상 (functional magnetic resonance imaging);
ICA, 독립 성분 분석 (Independent Component Analysis);
IQR, 사분위수 범위 (interquartile range);
LLM, 거대 언어 모델 (large language model);
MEG, 뇌자도 (magnetoencephalography);
PSD, 전력 스펙트럼 밀도 (power spectral density);
RMS, 제곱 평균 제곱근 (root-mean-squared);
SE, 표준 오차 (standard error);
SEM, 평균의 표준 오차 (standard error of the mean);
SNR, 신호 대 잡음비 (signal-to-noise ratio);
SPL, 음압 레벨 (sound pressure level);
TRF, 시간 응답 함수 (Temporal Response Functions)
서론 (Introduction)
다중 화자 환경에서 언어를 이해하기 위해, 청자는 경쟁하는 음성 스트림으로부터 목표 화자를 식별해냅니다 [1–3]. 이러한 선택적 주의 (selective attention) 과정의 신경생리학은 시뮬레이션된 칵테일 파티 (cocktail-party) 시나리오를 통해 널리 연구되어 왔으며 [4,5], 우리의 뇌가 어떻게 목표 스트림을 경쟁하는 음성 스트림으로부터 분리하고, 목표 음성을 언어적 의미로 변환하는지에 대해 밝혀왔습니다. 마스커 (masker, 방해) 음성 스트림이 어느 정도까지 처리되는지에 대해서는 여전히 논쟁의 여지가 많지만 [6–8], 비침습적 뇌전도 (EEG) [1,9], 침습적 뇌전도 (iEEG) [10], 뇌자도 (MEG) [3,11], 그리고 기능적 자기공명영상 (fMRI) [12,13]와 같은 다양한 기술로 측정된 바와 같이, 목표 음성과 마스커 음성의 처리 사이에는 상당한 차이가 있다는 점은 의심의 여지가 없습니다. 해당 연구들은 이러한 분리가 발생하는 청각 피질 영역의 정확한 위치를 특정할 수 있었으며 [14], 마스커 음성에 대한 언어적 처리의 상당한 (하지만 완전하지는 않은) 억제를 측정할 수 있었습니다 [1,15–17]. 그러나 이 분야의 신경생리학 문헌은 거의 전적으로 지속적 주의 (sustained attention) 과제에 집중해 왔으며 [2,10], 주의 전환 (attention switching)의 신경학적 기반에 대해서는 상당한 불확실성을 남겨두었습니다.
동적 전환 패러다임 (Dynamic switching paradigms)은 인지적 유연성 (cognitive flexibility)과 인지적 안정성 (cognitive stability)을 조사하기 위해 인지 제어 연구 분야에서 널리 사용되어 왔습니다 [18]. 이러한 실험에서 참가자들은 종종 새로운 지침에 따라 행동 반응을 유연하게 조정하여 과제 전환 (task-switch)을 시작하도록 요구받습니다 [19–21]. 예를 들어, 단일 숫자가 주어졌을 때, 참가자들은 그것이 홀수인지 짝수인지에 따른 홀짝성 (parity), 또는 숫자가 5보다 큰지 작은지에 따른 상대적 크기 (relative magnitude)를 기준으로 분류해야 합니다 [22]. 이러한 패러다임에서 전환 비용 (switch-cost)은 한 과제에서 다른 과제로 전환할 때 발생하는 반응 시간 (reaction time)의 증가 또는 오류율 (error rate)의 증가를 의미합니다. 유사한 행동 패러다임은 다중 화자 환경 (multi-talker settings)에서 단순한 음성 자극을 포함하기도 했습니다 [23–25]. 그러나 이러한 엄격하게 통제된 실험들의 주요 관심사는, 자연스러운 다중 화자 시나리오에서의 주의 재할당 (attention re-allocation) 자체의 동적인 측면에 집중하기보다는, 표적 음성 선택 (target speech selection) 과정을 과제 전환 문제의 한 가지 특정한 사례로 모델링하는 것이었습니다. 즉, 표적 스트림 선택 (target stream selection)이 공간적 위치 (spatial location) 또는 목소리 정체성 (voice identity)에 따라 달라질 수 있다는 점에 주목했습니다 [23]. 따라서 주의의 유연한 재지향 (reorienting)이 연속적으로 경쟁하는 스트림의 음성 처리 (speech processing)에 어떤 영향을 미칠 수 있는지에 대해서는 알려진 바가 거의 없습니다.
최근의 음성 신경생리학 (speech neurophysiology) 연구에서는 주의력 해독 (attention decoding) 분야의 맞춤형 EEG/MEG 방법론적 발전을 위한 도구로서 주의력 전환 (switches of attention)을 실험 패러다임에 포함시키기 시작했거나 [26,27], 움직이는 청각 객체에 대해 지속적인 음성 주의력 (sustained speech attention)이 어떻게 전개되는지 조사하기 시작했습니다 [28]. 그러나 우리가 알고 있는 바로는, 다중 화자 시나리오에서의 주의력 전환 신경생리학에 구체적으로 초점을 맞춘 이전 연구는 단 하나뿐이며, 해당 연구는 주의력 재지향 (attentional re-orienting) 중의 음성 신경 인코딩 (neural encoding)을 EEG 알파 활동 (alpha activity) 및 동공 확장 역학 (pupil dilation dynamics)과 연관시켰습니다 [29]. 이러한 발견은 주의력 전환의 신경생리학이 비침습적으로 연구될 수 있음을 증명했습니다. 해당 연구를 바탕으로, 본 연구는 이전의 대상 스트림에서 이탈(disengaging)하는 동시에 새로운 스트림에 몰입(engaging)하며 두 개의 경쟁하는 음성 스트림 사이에서 주의력을 조종하는 것을 뒷받침하는 정확한 신경 역학 (neural dynamics)을 밝힙니다.
본 연구에서 우리는 청자가 한 화자에서 다른 화자로 주의력을 전환함에 따라, 다양한 인코딩 창 길이 (encoding window lengths)를 사용하여 음성의 신경 인코딩을 측정합니다. 우리는 새로운 음성 스트림에 대한 몰입이 이전 대상으로부터의 이탈이 완료되기 전에 시작되어, 두 스트림을 동시에 추적하는 짧은 기간이 발생하는지 테스트합니다. 이러한 이탈-몰입 과정의 비대칭성(asymmetry)은 비록 일시적일지라도, 주어진 스트림에 대한 주의력을 유지하면서 동시에 대안적인 청각 스트림을 탐색하는 능력을 지원할 수 있습니다 [30].
언어의 신경 인코딩 (neural encoding)은 몰입형 다중 화자 청취 태스크 (immersive multi-talker listening task) 동안 EEG를 사용하여 정상 청력을 가진 성인 참가자들로부터 측정되었습니다. 참가자들은 두 개의 전면 스피커를 통해 제시되는 TED 강연의 두 가지 경쟁적인 음성 스트림에 노출되었으며, 동시에 16명의 화자가 섞인 음성 소음 (speech babble)이 후면 스피커에서 재생되었습니다 (Fig 1A). 화면상의 화살표는 참가자들에게 두 음성 스트림 중 하나에 주의를 기울이도록 유도하였으며, 화살표의 방향이 약 10~30초마다 바뀔 때마다 주의를 빠르게 전환하도록 했습니다 (Fig 1B). 타겟 음성과 마스커 (masker) 음성의 신경 추적 (neural tracking)은 각 음성 스트림과 신경 반응 사이의 선형 관계를 설명하는 시간 응답 함수 (Temporal Response Function, TRF)를 사용하여 정량화되었습니다. 초기 검증으로서, 우리는 지속적 주의 (sustained attention)에 관한 광범위한 문헌 [9,10,31]과 일치하게, 주의를 기울인 스트림이 EEG로부터 안정적으로 디코딩 (decoded)될 수 있음을 확인했습니다. 이는 본 실험에서의 EEG 반응이 타겟 음성과 마스커 음성의 차별적 인코딩 (differential encoding)을 반영함을 확인시켜 줍니다 (Fig 1C).
(A) 참가자들은 자신들 앞에 60°의 간격(왼쪽 30°, 오른쪽 30°)으로 배치된 두 개의 스피커를 통해 나오는 음성을 들었으며, 동시에 16명의 화자가 포함된 배경 소음 (B1–B4)이 제공되었습니다. 각 시행(trial)에서 화면에는 타겟 음성 스트림을 가리키는 화살표가 표시되었습니다. 참가자들은 시각적 단서(visual cue)의 방향이 바뀌는 즉시 주의(attention)를 전환하도록 지시받았습니다. (B) 하나의 실험 시행에 대한 도식도(Schematic diagram). 검은색 영역은 왼쪽(L) 또는 오른쪽(R) 전방 스트림에 대한 주의 블록(blocks of attention)을 나타냅니다. 빨간색 화살표는 주의 단서가 방향을 전환하는 순간(시행당 6회)을 나타냅니다. 블록 지속 시간은 무작위로 설정되었으며 항상 15초에서 30초 사이였고, 전체 시행은 3분 동안 지속되었습니다. (C) 주의 디코딩 분석(attention decoding analysis)을 실행하여 EEG 데이터 검증을 수행했습니다. 점진적으로 더 긴 디코딩 윈도우(decoding windows)를 고려했습니다 (더 큰 윈도우는 더 많은 데이터를 사용하여 일반적으로 더 정확한 디코딩 점수로 이어집니다). 이진 분류(Binary classification) 점수는 타겟 스트림과 마스커(masker) 스트림 사이를 판별하는 방식으로 보고되었습니다. 점선은 분류 라벨을 무작위화하여 계산된 무작위 분포의 95번째 백분위수(95th percentile)를 나타냅니다. 고려된 모든 디코딩 윈도우에서 통계적으로 유의미한 주의 디코딩 분류 점수가 측정되었으며, 수치적 결과는 선택적 주의(selective attention)에 관한 이전 연구들 [31,34,35]과 유사했습니다. 이 그림을 뒷받침하는 데이터는 다음에서 확인할 수 있습니다: https://zenodo.org/records/20569817.
다음으로 우리는 자연스러운 청취 (naturalistic listening) 상황에서 주의 전환 (attention switching)의 기저에 있는 신경 메커니즘에 관한 두 가지 근본적인 질문을 다루었습니다. 첫째, 새로운 음성 스트림 (speech stream)에 관여하는 과정과 이전 스트림에서 벗어나는 과정이 대칭적으로 전개되는지 질문했습니다 (그림 2 및 3). 이를 테스트하기 위해, 우리는 EEG 데이터에 인코딩 TRF (Temporal Response Function) 모델을 적합시켜, 시간에 따른 두 경쟁 음성 스트림의 신경 추적 (neural tracking)을 측정했습니다. 이를 통해 주의 전환을 둘러싼 평균적인 인코딩 역학 (encoding dynamics)을 특징짓고, 이탈 (disengagement) 과정과 관여 (engagement) 과정을 비교할 수 있었습니다. 두 번째 목표는 주의를 전환할 때 우리의 뇌가 어휘적 문맥 (lexical context)을 어떻게 업데이트하고 사용하는지 이해하는 것이었습니다 (그림 4). 언어 이해가 문맥적 예측 (contextual predictions)에 의해 지원된다는 이전 연구 [32,33]를 바탕으로, 우리는 주의 전환 과정에서 언어적 문맥이 어떻게 보존, 재설정 또는 선택적으로 업데이트되는지에 대한 서로 다른 가정을 반영하는 네 가지 경쟁 가설을 수립했습니다. 최첨단 대규모 언어 모델 (LLM)을 사용하여 각 가설에 대한 정량적 예측을 도출하였으며, 그 결과 어휘적 놀람도 (lexical surprisal)와 엔트로피 (entropy)에 대한 네 가지 회귀 변수 (regressors)를 각각 얻었습니다. 이 변수들은 이전 문맥에 대한 민감도와 전환 발생에 대한 민감도 측면에서 서로 다릅니다. 그런 다음 각 가설에 대해 인코딩 TRF 모델을 적합시켜, 대안적인 문맥 축적 전략 (context-accumulation strategies)을 비교하고 관찰된 신경 반응과 가장 일치하는 모델을 식별했습니다. 본 연구는 음성 추상화 (speech abstraction)의 저수준 및 고수준 모두를 아우르며, 주의 전환을 안내하는 시간적 전개와 문맥적 메커니즘에 대한 실질적인 새로운 통찰을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기