SPEAR: 대규모 PDE 사전 학습을 위한 지식 안내 전문가 집계 기능을 갖춘 스펙트럼 분리형 MoE 신경 연산자
요약
본 논문은 대규모 편미분방정식(PDE) 사전 학습 시 발생하는 지식 간섭 및 전문가 중복성 문제를 해결하기 위해 SPEAR라는 스펙트럼 분리형 MoE 신경 연산자를 제안합니다. SPEAR는 잠재 특징을 저주파/고주파로 분리하여 전이 가능한 동역학 공유와 전문화된 학습을 동시에 수행할 수 있습니다. 또한, 지식 안내 전문가 집계 전략으로 모델 효율성과 일반화 성능을 모두 개선했습니다.
핵심 포인트
- SPEAR: 대규모 PDE 사전 학습을 위한 스펙트럼 분리형 MoE 신경 연산자.
- 잠재 특징을 저주파/고주파로 분리하여 동역학 공유와 전문화를 동시에 달성.
- 지식 안내 전문가 집계 전략으로 중복성을 해결하고 모델 효율성을 높임.
- 12개 PDE 데이터셋 및 다운스트림 벤치마크에서 우수한 성능 입증.
대규모 사전 학습은 다양한 편미분방정식(PDE)에 걸쳐 신경 연산자의 일반화 성능을 향상시켰습니다. 하지만 기존의 PDE 기반 모델들은 공유 표현 방식이 지식 간섭(knowledge interference)을 일으킬 수 있는 이질적인 동역학(heterogeneous dynamics) 문제에 여전히 어려움을 겪고 있으며, 혼합 전문가(MoE: Mixture-of-Experts) 아키텍처는 증가하는 전문가 중복성(expert redundancy) 문제를 안고 있습니다. 본 논문에서는 대규모 PDE 사전 학습을 위해 지식 안내 전문가 집계 기능을 갖춘 스펙트럼 분리형 MoE 신경 연산자인 SPEAR를 제안합니다. SPEAR는 잠재 특징(latent features)을 저주파 및 고주파 성분으로 분리하여, 전이 가능한 동역학의 공유 모델링과 PDE 특이 패턴의 전문화된 학습을 가능하게 합니다. 전문가 중복성 문제를 해결하기 위해, 데이터셋별로 학습된 지식과 라우팅 선호도(routing preferences)를 측정하는 지식 안내 전문가 집계 전략을 설계하여, 유사한 전문가들을 식별하고 통합할 수 있게 했습니다. 12개의 PDE 데이터셋 및 여러 다운스트림 벤치마크에서의 실험 결과는 사전 학습, 미세 조정(fine-tuning), 그리고 전이 학습에서 우수한 성능을 입증했습니다. 나아가, 저희의 집계 전략은 예측 정확도를 유지하거나 향상시키면서 전문가 수를 50% 줄여, PDE 기반 모델의 모델 효율성과 일반화 능력 사이의 균형을 달성했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기