동적 시스템 재구성을 위한 순환 신경망의 시간 병렬 훈련
요약
본 논문은 동적 시스템(DS) 재구성을 위해 순환 신경망(RNN)을 훈련하는 효율적인 방법을 제시합니다. DEER와 일반화된 교사 강제(GTF)를 결합하여 혼돈계의 긴 시계열 데이터에 대한 RNN 훈련 속도를 100배 이상 향상시켰습니다. 이 방법은 기존 모델 대비 시간 병렬성을 확보하고 노출 편향을 줄여 극도로 긴 시계열 학습이 가능하게 합니다.
핵심 포인트
- DEER와 GTF 결합으로 RNN 훈련 효율성 대폭 개선
- 혼돈 시스템의 장기 시계열 데이터 처리가 가능해짐
- 시간 병렬성을 확보하여 O[T]에서 O[(log T)²]로 확장
- Mamba 등 기존 상태 공간 모델 대비 우수한 성능 기대
비선형 RNN의 훈련을 효율적으로 병렬화하여, 혼돈계(chaotic systems)에서 나오는 매우 긴 시계열에서도 빠른 수렴을 보장할 수 있을까요? 저희가 #NeurIPS2026 스포트라이트를 통해 발표하는 '동적 시스템(DS) 재구성을 위한 순환 신경망의 시간 병렬 훈련 (Parallel-in-Time Training of Recurrent Neural Networks for Dynamical Systems (DS) Reconstruction (DSR))' (preprint: https://arxiv.org/abs/2605.12683)에서는 DEER(https://openreview.net/forum?id=E34AlVLN0v)와 일반화된 교사 강제(generalized teacher forcing, GTF)를 결합하여 혼돈 DS의 시계열에 대한 비선형 RNN 훈련 속도를 2자릿수 이상 (>100배) 향상시켰습니다. DEER는 전체 시퀀스 길이 T에 걸쳐 뉴턴 유형 고정점 반복(Newton-type fixed point iterations)을 통해 RNN 순방향 계산(forward pass)을 해결함으로써, 효율적인 GPU 병렬화를 가능하게 하여 O[T] 대신 O[(log T)²]로 확장할 수 있게 합니다. 그러나 혼돈 역학 하에서는 DEER가 작동하지 않아 실행 시간이 OT log T로 저하됩니다. GTF(https://proceedings.mlr.press/v202/hess23a.html)를 사용하면 혼돈 역학으로 인한 발산을 방지하여 DEER를 안정화하고, 상태 공간 모델 훈련에 사용되는 전통적인 교사 강제 대비 노출 편향(exposure bias)을 줄일 수 있습니다. 이 두 메커니즘을 결합함으로써, 극도로 긴 시계열 (T>10⁶)에 대한 효율적인 시간 병렬 및 안정적인 훈련이 가능해지며, DSR 설정에서 Mamba 및 다른 상태 공간 모델들을 크게 능가합니다. submitted by /u/DangerousFunny1371 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기