Sharpness-Aware Minimization과 Muon: 스펙트럼 노름(Spectral Norm) 하에서의 강건성
요약
SAM의 일반화 성능을 높이기 위해 행렬 인식 기하학을 도입한 새로운 최적화 방식을 제안합니다. 층별 스펙트럼 내부 섭동과 Muon 옵티마이저를 결합하여 ViT 및 ResNet 모델에서 최고 수준의 검증 정확도를 달성했습니다.
핵심 포인트
- SAM의 섭동 개념을 행렬 구조에 맞게 개선
- 층별 스펙트럼 내부 섭동(layerwise spectral inner perturbation) 도입
- Muon 옵티마이저와 AdamW/SGDW의 결합 연구
- ImageNet-1K 실험을 통해 ViT 및 ResNet 성능 입증
Sharpness-Aware Minimization (SAM)은 작고 최악인 파라미터 섭동(perturbation)에 대한 무감각함을 장려함으로써 일반화(generalization) 성능을 향상시키는 것을 목표로 합니다. 그러나 "작은" 섭동이라는 개념은 본질적으로 기하학적 구조(geometry)에 의존적입니다. 기존의 SAM 변형 모델들이 광범위한 선택지를 탐색해 왔지만, 어떤 기하학적 구조가 실제 환경에서 가장 효과적인지에 대한 명확한 관점은 여전히 모호한 상태로 남아 있습니다. 행렬 인식 최적화(matrix-aware optimization), 특히 Muon 옵티마이저(optimizer)에 관한 최근 연구는 은닉층 가중치(hidden-layer weights)의 행렬 구조를 존중하는 것이 강력한 경험적 성능으로 이어질 수 있음을 시사합니다. 이에 영감을 받아, 우리는 SAM의 두 단계 모두에서 행렬 인식 기하학(matrix-aware geometry)을 연구합니다. 우리는 행렬 값인 은닉층 파라미터(matrix-valued hidden-layer parameters)를 위해 층별 스펙트럼 내부 섭동(layerwise spectral inner perturbation)을 도입하고, 이를 외부 업데이트(outer update) 시 AdamW/SGDW 또는 Muon과 결합합니다. ViT-Small/16 및 ResNet-50에 대한 ImageNet-1K 실험을 통해, 스펙트럼 내부 단계(spectral inner step)와 Muon 외부 단계(Muon outer step)의 결합이 일관되게 강력한 성능을 발휘하며, 평가된 방법들 중 두 모델 모두에서 최고의 검증 정확도(validation accuracy)를 달성함을 확인했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기