MAXIM: 이미지 처리를 위한 다중 축 MLP (Multi-Axis MLP)
요약
본 글은 CVPR 2022 논문 'MAXIM: Multi-Axis MLP for Image Processing'을 소개하며, 이미지 처리를 위한 새로운 아키텍처를 제시합니다. MAXIM은 다중 축 게이팅 MLP와 크로스 게이팅 블록 등 순수 MLP 기반 빌딩 블록으로 구성되어 효율적이고 유연한 비전 백본 역할을 합니다. 이 모델은 노이즈 제거, 디블러링 등 다양한 이미지 처리 작업에서 최고 성능을 입증했습니다.
핵심 포인트
- MAXIM은 다중 축 MLP를 활용하여 이미지 처리를 위한 범용 아키텍처를 제공합니다.
- MLP 기반 구조로 글로벌하고 완전 컨볼루션적 특성을 가지며 효율성이 높습니다.
- 노이즈 제거, 디블러링 등 10개 이상의 벤치마크에서 최고 성능을 달성했습니다.
이 저장소는 [CVPR 2022 Oral] 논문인 "MAXIM: Multi-Axis MLP for Image Processing"를 PyTorch로 재구현한 것입니다. 이 논문의 저자는 Zhengzhong Tu, Hossein Talebi, Han Zhang, Feng Yang, Peyman Milanfar, Alan Bovik, Yinxiao Li입니다.
Google Research, University of Texas at Austin
면책 조항: 본 저장소는 현재 작업 중인 상태입니다. 일정은 보장되지 않습니다.
2022년 4월 12일: MAXIM을 위한 PyTorch 저장소를 초기화했습니다.
2022년 3월 29일: 공식 JAX 코드와 모델이 [google-research/maxim]에서 공개되었습니다.
2022년 3월 29일: MAXIM은 CVPR 2022에서 **구두 발표(ORAL presentation)**로 선정되었습니다. 🎉
2022년 3월 3일: CVPR 2022에 논문이 채택되었습니다.
초록: 트랜스포머(Transformers)와 다층 퍼셉트론(MLP, multi-layer perceptron) 모델의 최근 발전은 컴퓨터 비전 작업에 새로운 네트워크 아키텍처 설계를 제공합니다. 이러한 모델들은 이미지 인식과 같은 많은 비전 작업에서 효과적임이 입증되었지만, 저수준(low-level) 비전에 적용하는 데는 여전히 과제가 남아 있습니다. 고해상도 이미지를 지원하기 위한 유연성 부족과 국소 어텐션(local attention)의 한계가 아마도 주요 병목 현상일 것입니다. 본 연구에서는 MAXIM이라는 다중 축 MLP 기반 아키텍처를 제시하며, 이는 이미지 처리 작업을 위한 효율적이고 유연한 범용 비전 백본(general-purpose vision backbone) 역할을 할 수 있습니다. MAXIM은 UNet 형태의 계층적 구조를 사용하며 공간적으로 게이팅된 MLP에 의해 활성화되는 장거리 상호작용을 지원합니다. 구체적으로, MAXIM은 두 가지 MLP 기반 빌딩 블록을 포함합니다: 국소적 및 전역적 시각 단서(visual cues)의 효율적이고 확장 가능한 공간 혼합(spatial mixing)을 가능하게 하는 다중 축 게이팅 MLP(multi-axis gated MLP), 그리고 교차 어텐션(cross-attention)의 대안으로, 교차 특징 조건화(cross-feature conditioning)를 고려하는 크로스 게이팅 블록(cross-gating block)입니다. 이 두 모듈 모두 전적으로 MLP에 기반하지만, 이미지 처리에 바람직한 속성인 글로벌하고 '완전 컨볼루션적(fully-convolutional)'이라는 특성을 공유한다는 장점도 있습니다.
저희의 광범위한 실험 결과는 제안된 MAXIM 모델이 노이즈 제거(denoising), 블러 제거(deblurring), 비(雨) 제거(deraining), 헤이즈 제거(dehazing), 향상(enhancement)을 포함하는 다양한 이미지 처리 작업을 아우르는 10개 이상의 벤치마크에서 최고 수준의 성능을 달성하며, 경쟁 모델들보다 적거나 유사한 수의 파라미터와 FLOPs를 요구한다는 것을 보여줍니다.
TBD
TBD
만약 이 저장소(repository)가 유용하다고 느끼셨다면, 다음 인용을 고려해 주십시오:
@article{tu2022maxim,
title={MAXIM: Multi-Axis MLP for Image Processing},
author={Tu, Zhengzhong and Talebi, Hossein and Zhang, Han and Yang, Feng and Milanfar, Peyman and Bovik, Alan and Li, Yinxiao},
...
이 저장소는 Restormer를 기반으로 구축되었습니다. 저희의 연구는 또한 HiT, MPRNet, 그리고 HINet에서 영감을 받았습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Coding Assistants의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기