하나의 블록으로 여러 깊이를 구현하는 순환 비전 트랜스포머 (reViT)
요약
reViT는 단일 Transformer 블록을 순환적으로 적용하여 중간 특징 증류 없이도 전체 깊이의 비전 인코더와 유사한 정확도를 달성하는 방법을 제안합니다. 이 모델은 FFN을 공유 전문가 뱅크의 볼록 조합으로 표현하고, 연속적인 깊이 좌표를 통해 변환을 복원하며, 적은 파라미터로 높은 성능을 보여줍니다.
핵심 포인트
- 단일 블록 순환 적용으로 전체 깊이와 유사한 정확도 달성
- FFN을 공유 전문가 뱅크의 볼록 조합으로 표현하여 깊이별 변환 구현
- one-FFN 예산 내에서 가장 강력한 방법은 가중치 공간 병합임을 확인
- 저장 파라미터는 크게 줄이면서 높은 성능 유지 가능
본 연구에서는 단일 Transformer 블록을 순환적으로 적용할 경우, 중간 특징 증류(intermediate feature distillation) 없이도 유사한 추론 FLOPs에서 전체 깊이의 비전 인코더와 동일한 정확도를 달성할 수 있음을 보여줍니다. reViT은 각 순환 깊이에서의 FFN(Feed-Forward Network)을 작은 공유 전문가 뱅크(shared expert bank)의 볼록 조합(convex combination)으로 표현함으로써 깊이별 변환(depth-specific transformations)을 복원합니다. 연속적인 정규화된 깊이 좌표(continuous normalized-depth coordinate)가 이 혼합을 프로그램하며, FFN 파라미터 공간을 통과하는 재샘플링 가능한 궤적(resampleable trajectory)을 정의합니다. 우리는 두 가지 환경에서 이 설계를 평가했습니다: 지도 학습 ImageNet-1k 훈련 및 DINOv2 교사 모델로부터의 증류(distillation). 두 환경 모두에서, 제어된 적응(controlled adaptations)은 동일한 one-FFN 예산(one-FFN budget) 내에서 가장 강력하게 테스트된 MoE(Mixture-of-Experts) 계열인 가중치 공간 병합(weight-space merging)을 식별했으며, 이는 토큰 디스패치(token-dispatch) 및 출력 혼합(output-mixture) 대안보다 앞섰습니다. 처음부터 훈련된 reViT-B/16은 약 70% 적은 저장 파라미터로 DeiT III의 정확도를 달성합니다. 교사 모델의 출력 특징만을 사용하여 증류된 8개 전문가 모델은 DINOv2 교사 모델의 선형 프로브(linear-probe) 정확도의 거의 전부를 유지하며, 분류(classification), 분할(segmentation), 깊이 예측(depth prediction) 전반에 걸쳐 전이됩니다. 탄성 깊이 훈련(Elastic-depth training)을 통해 하나의 체크포인트(훈련된 모델)가 동일한 정규화 좌표 간격을 재샘플링함으로써 여러 테스트 깊이에서 작동할 수 있게 합니다. 고정 깊이 배포(fixed-depth deployment)의 경우, 순환 블록은 기존의 밀집 그래프(conventional dense graph)로 구현될 수 있으며, 온라인 라우팅 및 병합을 제거하면서도 one-FFN-per-depth 계산량은 변경하지 않지만 배포 저장 공간을 확장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기