
SenseNova-Vision: SenseTime이 공식 오픈소스로 공개한 이해 및 생성 통합 비전 거대 모델
요약
SenseTime이 이해와 생성이 통합된 비전 거대 모델인 SenseNova-Vision을 오픈소스로 공개했습니다. 단일 모델로 객체 탐지, 이미지 분할, 3D 재구성 등 다양한 비전 태스크를 네이티브하게 수행할 수 있습니다.
핵심 포인트
- 이해와 생성이 통합된 네이티브 비전 거대 모델 공개
- 객체 탐지, 분할, 깊이 예측 등 다양한 태스크 통합 수행
- Google의 Vision Banana를 능가하는 성능 입증
- 5,000만 개의 고품질 비전 지시어 코퍼스 함께 공개
- 단일 모델 활용을 통한 연구 개발 및 배포 비용 절감
며칠 전, SenseTime(商汤)은 이해와 생성이 통합된 비전 거대 모델(Vision Large Model)인 SenseNova-Vision을 공식적으로 오픈소스로 공개했습니다.
기존 업계의 통합 비전(Unified Vision) 방식은 대개 여러 개의 전문가 모델(Expert Models)을 패키징하여 캡슐화한 형태였으며, 본질적으로는 각 모델이 각자의 역할만을 수행했습니다.
이번에 SenseTime은 비전을 거대 모델의 네이티브 능력(Native Capability)으로 만들어, 객체 탐지(Object Detection), 이미지 분할(Image Segmentation), 깊이 예측(Depth Prediction), 3D 재구성(3D Reconstruction) 등 다양한 비전 태스크를 수행할 수 있도록 했습니다.
여러 권위 있는 평가에서 각 분야의 전용 전문가 모델들과 어깨를 나란히 했으며, 대다수의 지표에서 Google의 Vision Banana를 능가했습니다.
- 모델 가중치(Weights) 다운로드: https://t.co/Kis4rLcsXr
- GitHub: https://t.co/zBzYSzxekq
- ModelScope(魔搭社区): https://t.co/l7NNm743aZ
모델과 함께 오픈소스로 공개된 것은 5,000만 개의 고품질 샘플을 포함한 비전 지시어 코퍼스(Vision Instruction Corpus)입니다.
앞으로는 서로 다른 비전 태스크를 위해 여러 개의 모델을 유지 관리할 필요 없이, 단일 모델만으로 빈도가 높은 비전 요구사항을 모두 충족할 수 있어 연구 개발 및 배포 비용을 크게 낮출 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @github_daily (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기