© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
/api/search?q=검색어
본 논문은 Vision Transformers (ViTs)의 대안적인 빌딩 블록을 제안하며, 기존 ViT가 높은 해상도에서 비용이 많이 드는 $N^2$ 셀프 어텐션을 대체합니다. 대신 코어-주변부 블록 희소 어텐션(core-periphery block-sparse attention) 구조를 가진 백본을 사용하여 계산 효율성을 높였습니다. 이 모델은 다양한 해상도에서 높은 밀집 및 분류 정확도를 유지하며, 코어 토큰 수를 조절하여 어텐션 패턴의 공간적 커버리지와 집중도를 탄력적으로 제어할 수 있다는 장점을 가집니다.