Matrix AdaGrad: 행별 및 열별 적응형 준경사법 (Adaptive Subgradient Methods)
요약
본 연구는 행렬 값 매개변수에 대한 적응형 근접 함수를 갖춘 온라인 미러 디센트 프레임워크를 개발했습니다. 이를 통해 행별 및 열별 Matrix AdaGrad(Row/Column-AdaGrad)라는 새로운 원칙적인 접근 방식을 제시합니다. 이 방법은 누적된 행별 또는 열별 그래디언트 노름에 기반하여 적응형 스케일링을 수행하며, 기존의 entry-wise AdaGrad보다 더 타이트한 후회 보장을 제공함을 입증했습니다.
핵심 포인트
- 행렬 값 매개변수에 특화된 온라인 미러 디센트 프레임워크 제시
- Row-AdaGrad와 Column-AdaGrad를 도출하여 행/열별 적응형 스케일링 구현
- 구조화된 그래디언트 하에서 기존 AdaGrad보다 엄격한 후회 보장 제공
AdaGrad나 Adam과 같은 적응형 최적화 방법은 현대 신경망 훈련에서 광범위하게 사용되지만, 이들의 적응형 스케일링은 주로 벡터 값 매개변수에 맞춰 설계되었으며 행렬 구조를 명시적으로 활용하지는 않습니다. 최근의 행렬 인식(matrix-aware) 옵티마이저는 구조화된 최적화의 이점을 보여주지만, AdaGrad와 비교할 수 있는 일반적인 이론적 틀을 마련하여 행렬 인식 적응성을 도출하는 것은 여전히 부족합니다. 본 연구에서는 매트릭스 값 매개변수에 대한 적응형 근접 함수(adaptive proximal functions)를 갖춘 일반적인 온라인 미러 디센트(Online Mirror Descent) 프레임워크를 개발하여, 온라인 후회 최소화(online regret minimization)를 통해 행렬 인식 적응 최적화를 도출하는 원칙적인 접근 방식을 제공합니다. 행별 및 열별 매트릭스 근접 함수를 도입하고 결과적인 후회 상충 관계(regret trade-off)를 분석함으로써, 우리는 행별 Matrix AdaGrad (Row-AdaGrad)와 열별 Matrix AdaGrad (Column-AdaGrad)를 도출하며, 적응형 스케일링은 누적된 행별 또는 열별 그래디언트 노름에 의해 결정됩니다. 우리는 후회 보장(regret guarantees)을 확립하고 이러한 행렬 인식 경계가 구조화된 그래디언트 하에서 entry-wise AdaGrad의 경계보다 엄격하게 더 타이트할 수 있음을 보여줍니다. 매트릭스 분해 및 심층 신경망 훈련에 대한 실험은 적응형 스케일링을 행렬 구조와 정렬하는 것이 어떻게 개선된 최적화 안정성 및 더 큰 학습률과 네트워크 깊이에서의 훈련 가능성을 포함하여 이점을 제공하는지 추가로 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기