SenseNova의 7B 멀티모달 비전 모델 가이드
요약
SenseNova-Vision-7B-MoT는 단일 아키텍처로 텍스트, 이미지, 혼합 출력을 생성하는 통합 멀티모달 모델입니다. 별도의 작업별 헤드 없이 자연어 지시문과 시각적 프롬프트를 통해 탐지, 세그멘테이션, 깊이 추정 등 다양한 비전 작업을 수행합니다.
핵심 포인트
- 단일 아키텍처로 텍스트, 이미지, 밀집 예측을 모두 처리하는 통합 멀티모달 구조
- 작업별 예측 헤드 없이 고유한 입출력 공간을 통해 이질적인 작업 수행
- SenseNova-Vision Corpus를 활용한 지시어-응답 학습 방식 채택
- COCO, HierText 등 주요 벤치마크에서 특화 모델과 대등하거나 우수한 성능 달성
개요 (Overview)
SenseNova-Vision-7B-MoT
는 sensenova가 개발한 컴퓨터 비전(computer vision)을 위한 통합 멀티모달 모델(unified multimodal model)로, 다양한 시각적 인지 작업을 단일 아키텍처 내에서 텍스트 생성(text generation), 이미지 생성(image generation), 또는 혼합 텍스트-이미지 생성(mixed text-image generation)으로 재구성합니다. 탐지(detection), 세그멘테이션(segmentation), 깊이 추정(depth estimation), 표면 법선 예측(surface normal prediction), 또는 3D 기하학(3D geometry)을 위해 작업별 예측 헤드(task-specific prediction heads)를 사용하는 대신, 이 모델은 모든 이질적인 작업들을 통합 멀티모달 모델의 고유한 입출력 공간(native input-output spaces)을 통해 표현합니다. 7B 파라미터 모델은 자연어 지시문(natural-language instructions)과 선택적인 시각적 프롬프트(visual prompts)를 받아 작업, 대상 영역, 출력 스키마(output schema), 디코딩 컨벤션(decoding conventions)을 지정하며, 그 후 적절한 출력을 생성합니다. 즉, 탐지(detection)나 OCR과 같은 기호적 작업(symbolic tasks)을 위한 구조화된 텍스트(structured text), 깊이 지도(depth maps)와 같은 공간적 예측(spatial predictions)을 위한 밀집 이미지(dense images), 또는 구성적 작업(compositional tasks)을 위한 혼합 텍스트-이미지 출력(mixed text-image outputs)을 생성합니다. 이 모델은 아키텍처 수정 없이 이를 달성하며, 다양한 비전 주석(vision annotations)으로부터 변환된 디코딩 가능한 텍스트, 이미지, 혼합 타겟 예시를 포함하는 대규모 컴퓨터 비전 데이터셋인 SenseNova-Vision Corpus에 대한 지시어-응답 학습(instruction-response training)에 의존합니다. 공식 추론(inference)을 위해서는 bash 스크립트와 conda를 통한 환경 설정과 함께 https://github.com/OpenSenseNova/SenseNova-Vision GitHub 저장소가 필요하며, 모델 가중치(model weights)는 huggingface_hub를 사용하여 Hugging Face에서 다운로드합니다.
전통적인 작업별 시스템(task-specific systems) 대비 결정적인 장점은, 구조화된 시각적 이해(structured visual understanding), 밀집 기하학적 예측(dense geometric prediction), 세그멘테이션(segmentation), 그리고 다중 뷰 시각 기하학(multi-view visual geometry) 작업 전반에서 강력한 성능을 유지하면서도, 출력이 벤치마크 호환 형식(박스(boxes), 포인트(points), OCR 문자열(OCR strings), 마스크(masks), 깊이 지도(depth maps), 법선(normals), 포인트 맵(point maps), 카메라 기록(camera records))으로 다시 디코딩 가능하다는 점입니다.
최적의 사용 사례 (Best use cases)
유연한 카테고리 정의를 통한 탐지 및 로컬라이제이션 (Detection and localization). 이 모델은 COCO에서 56.6 mAP, HierText에서 80.2 F1, ScreenSpot-V2 GUI grounding에서 49.5 mAP를 달성하며, 특화된 탐지 시스템과 대등하거나 이를 능가하는 성능을 보여줍니다. 자연어 지시문 (Natural-language instruction) 입력을 통해 재학습 없이도 카테고리, 영역, 색상 힌트 또는 기타 시각적 속성에 따라 탐지 대상을 지정할 수 있습니다. 이는 사용자 정의 카테고리를 사용하는 동적 객체 탐지 (dynamic object detection), 사용자가 특정 영역을 가리키며 "이것이 무엇인가요"라고 묻는 참조 로컬라이제이션 (referring localization), 그리고 픽셀 단위로 정확한 경계 상자 (bounding boxes)가 의미론적 레이블 (semantic labels)과 매핑되어야 하는 문서 또는 GUI에서의 시각적 그라운딩 (visual grounding) 애플리케이션에 적합합니다.
단일 이미지로부터의 깊이 및 표면 법선 추정 (Depth and surface normal estimation). 이 모델은 NYUv2에서 4.0 AbsRel, KITTI에서 5.9 평균 오차 (mean error)를 기록하며 픽셀 정렬된 이미지 형태로 깊이 예측값을 생성합니다. 이는 DepthAnything V2 및 MoGe-2와 같은 특화된 깊이 모델과 대등하거나 이를 능가하는 수준입니다. 깊이 출력값이 별도의 특화된 디코더를 필요로 하지 않고 이미지로 생성되기 때문에, 동일한 모델이 별도의 아키텍처 없이도 표면 법선 (surface normals, ScanNet에서 12.8 평균 각도 오차), 포인트 맵 (point maps), 이진 마스크 (binary masks)를 처리할 수 있습니다. 특화된 깊이 추정 인프라 없이 조밀한 기하학적 이해 (dense geometric understanding)가 필요한 경우에 이를 사용하십시오.
언어로 정의된 카테고리를 활용한 다중 인스턴스 세그멘테이션 (Multi-instance segmentation). 세그멘테이션 성능은 RefCOCO (참조 세그멘테이션, referring segmentation)에서 81.3 cIoU, ReasoningSeg에서 63.2, 그리고 인터랙티브 세그멘테이션 (interactive segmentation)에서 73.9에 달합니다. 지시문 준수 (instruction-following) 인터페이스를 통해 세그멘테이션할 카테고리를 지정하는 다중 인스턴스 세그멘테이션, 모델이 텍스트 설명과 함께 마스크로 응답하는 근거 기반 대화형 세그멘테이션 (grounded conversation segmentation), 그리고 여러 의미론적 차원을 결합하는 구성적 인지 (compositional perception)가 가능합니다. 이를 통해 세그멘테이션을 더 큰 파이프라인에 통합할 때 별도의 세그멘테이션 헤드 (segmentation heads)나 후처리 (post-processing)가 필요하지 않습니다.
다중 뷰 3D 재구성 (Multi-view 3D reconstruction) 및 카메라 포즈 추정 (camera pose estimation). 이 모델은 여러 개의 입력 이미지를 처리하여 포인트 맵 (point maps)과 카메라 포즈 (camera poses)를 예측하며, 7Scenes 및 ETH3D 데이터셋에서 다중 뷰 재구성 87.9 F1, 카메라 포즈 정확도 72.2를 달성했습니다. 텍스트 출력에는 구조화된 필드로서 정규화된 카메라 파라미터 (normalized camera parameters)가 포함됩니다. 이는 다중 뷰로부터 얻은 기하학적 이해를 구조화된 포즈 데이터를 기대하는 다운스트림 시스템 (downstream systems)에 전달해야 하는 로보틱스 (robotics) 애플리케이션, SLAM 시스템 또는 3D 스캐닝 워크플로우에 매우 유용합니다.
지시어 정의 태스크 변형 (Instruction-defined task variants) 및 커스텀 비전 문제. 고정된 스키마 (fixed-schema)를 가진 모델과 달리, 자연어 지시어를 통해 추론 (inference) 시점에 카테고리, 색상, 영역 및 출력 형식을 결합한 태스크 변형을 정의할 수 있습니다. 파인튜닝 (fine-tuning) 없이도 "이미지 왼쪽 1/3 지점에 있는 빨간색 차량" 또는 "사람 영역에 마스킹된 깊이 맵 (depth map)" 등을 요청할 수 있어, 연구 프로토타입, 맞춤형 산업 검사, 그리고 태스크 정의가 빈번하게 변경되는 애플리케이션에 적합합니다.
한계점 (Limitations)
상업적 이용에 대한 라이선스 제한. 이 모델은 CC-BY-NC-4.0 라이선스 하에 배포되며, 이는 출처 표기 시 비상업적 이용은 허용하지만 SenseNova의 명시적인 허가 없이는 상업적 배포를 금지합니다. 이는 수익을 창출하는 모든 제품이나 서비스에 있어 엄격한 제약 사항입니다.
명시되지 않은 해상도 및 입력 제약 사항. README에는 최대 입력 이미지 해상도, 지시어를 위한 토큰 제한 (token limits), 또는 지원되는 종횡비 (aspect ratios)에 대한 문서화가 되어 있지 않습니다. 추론 예시(examples/images/2.jpg 등)를 통해 일반적인 이미지 크기를 짐작할 수 있으나 명시적인 사양은 부족합니다. 실제 사용 사례를 직접 테스트하거나 GitHub 리포지토리의 코드를 참조해야 합니다.
필요한 추론 인프라 (Inference infrastructure). 이 모델은 bash 스크립트, conda를 통한 환경 설정, 그리고 공식 래퍼(wrapper)를 포함한 전체 GitHub 리포지토리 인프라를 필요로 합니다. 이는 단순한 Transformers 라이브러리 통합 모델과 비교했을 때 배포 오버헤드 (deployment overhead)를 발생시킵니다. 추론 지연 시간 (Inference latency) 및 배치 처리 (batch processing) 능력은 문서화되어 있지 않습니다.
밀집 예측 (Dense prediction) 벤치마크가 전문 모델에 비해 뒤처짐. 탐지 (detection) 및 세그멘테이션 (segmentation)은 경쟁력이 있는 수준이지만, 깊이 추정 (depth estimation)은 NYUv2 데이터셋에서 MoGe-2의 전문적인 3.5 AbsRel과 비교하여 4.0 AbsRel을 기록했으며, 표면 법선 (surface normal) 예측도 전문적인 방법론에 비해 뒤처집니다. 기하학적 예측에서 최고 성능을 요구하는 작업의 경우, 전문화된 단일 작업 (single-task) 모델이 더 선호될 수 있습니다.
출력 디코딩 복잡성 (Output decoding complexity). 출력은 텍스트 또는 이미지로 생성되며, 이는 벤치마크 호환 형식으로 파싱 (parsing)되어야 합니다. 형식이 잘못되었거나 모호한 출력은 후처리 (post-processing) 또는 에러 핸들링 (error handling)을 필요로 할 수 있습니다. README에는 구조화된 텍스트를 박스(boxes)나 카메라 파라미터 (camera parameters)로 다시 디코딩할 때의 실패율에 대한 기록이 없습니다.
미세 조정 (Fine-tuning)에 관한 제한된 정보. 문서는 추론 (inference)에 집중되어 있습니다. 제공된 자료에는 미세 조정 절차, 데이터셋 준비 형식, 그리고 적응 전략 (adaptation strategies)이 포함되어 있지 않아, 니치 (niche) 작업에 대한 확장성이 제한됩니다.
적당한 모델 크기. 7B 파라미터 규모로, 소비자용 GPU에서 추론을 수행하려면 충분한 VRAM이 필요합니다. 구체적인 요구 사항은 문서화되어 있지 않지만, 멀티모달 (multimodal) 특성을 고려할 때 일반적인 추론에는 16GB 이상의 GPU 메모리가 필요할 것으로 보입니다.
비교 분석
SenseNova-U1-8B-MoT-SFT는 NEO-unify 아키텍처를 통해 이해와 생성을 통합한 8B 파라미터 규모의 최신 SenseNova 모델이며 지도 미세 조정 (supervised fine-tuning)을 거쳤습니다. 시각 작업 전반에 걸쳐 검증된 벤치마크 결과를 갖춘 더 작고 즉시 배포 가능한 (production-ready) 모델이 필요하다면 SenseNova-Vision-7B-MoT를 선택하십시오. 최신 아키텍처 개선 사항과 더 큰 용량이 필요하다면 SenseNova-U1-8B를 선택하십시오. 다만, 후자는 발표된 벤치마크가 더 적을 수 있습니다.
SenseNova-U1-8B-MoT-Infographic는 인포그래픽 이해 및 시각적 문서 분석 (visual document analysis)에 최적화된 변형 모델입니다. 이는 문서 중심의 작업에 특화되어 있습니다. 인포그래픽이 주요 사용 사례가 아니라면 일반적인 비전 작업을 위해 SenseNova-Vision-7B-MoT를 사용하십시오.
SenseNova-U1-8B-MoT는 순수 비전을 넘어 더 넓은 멀티모달 (multimodal) 능력을 제공하는 기본 SenseNova-U1 모델입니다. 비전 전용으로 충분하고 모델 크기가 중요하다면 SenseNova-Vision-7B-MoT를 사용하십시오. 더 많은 파라미터 (parameters)를 감수하더라도 더 긴밀한 언어-비전 통합 (language-vision integration)이 필요하다면 SenseNova-U1-8B-MoT를 사용하십시오.
NexaAIDev의 omnivision-968M은 9배의 토큰 감소 (token reduction)와 환각 (hallucinations) 감소를 위한 DPO 학습을 통해 엣지 디바이스 (edge devices)에 최적화된 10억 개 미만의 파라미터를 가진 모델입니다. 이는 근본적으로 더 작으며 다른 하드웨어 (엣지 vs. 데이터센터)를 대상으로 하므로, 속도와 리소스 점유율 (omnivision) 대 비전 작업의 폭과 정확도 (SenseNova-Vision) 사이의 트레이드오프 (tradeoff)가 발생합니다.
XiaomiMiMo의 MiMo-VL-7B-SFT는 네이티브 해상도 ViT 인코딩 (ViT encoding) 및 MLP 프로젝션 (MLP projection)을 갖춘 7B 비전-언어 모델입니다. MiMo-VL은 세밀한 디테일 보존을 통한 비전-언어 이해에 집중합니다. 반면 SenseNova-Vision은 다양한 비전 작업 (깊이 (depth), 세그멘테이션 (segmentation), 3D 기하학 (3D geometry))을 생성 (generation)으로서 통합하므로, 범위는 더 넓지만 순수 VQA 또는 캡셔닝 (captioning)에는 덜 특화되어 있을 수 있습니다.
기술 사양 (Technical specifications)
아키텍처 및 학습 (Architecture and training). 이 모델은 기성품인 사전 학습된 통합 멀티모달 모델 기반 위에 구축되었으며, 작업별 헤드 (task-specific heads) 없이 비전 작업을 텍스트 및 이미지 생성 공간으로 투영하도록 수정되었습니다. 학습에는 탐지 (detection), 세그멘테이션 (segmentation), 깊이 (depth), 표면 법선 (surface normals), OCR, 키포인트 (keypoints) 및 3D 기하학 (3D geometry)을 아우르는 다양한 컴퓨터 비전 주석 (computer vision annotations)에서 변환된 대규모 지시어-응답 (instruction-response) 데이터셋인 SenseNova-Vision Corpus를 사용합니다. 보조 멀티모달 데이터는 능력을 보존하는 혼합물 (mixture)로서 학습을 증강합니다.
작업 유형별 출력 형식 (Output formats by task type):
구조화된 텍스트 (Structured text): 정규화된 좌표(normalized coordinates)를 포함한 탐지(Detection) 및 지역화(localization) 출력 텍스트 기록; 좌표 리스트로 출력되는 OCR 및 키포인트(keypoints); 구조화된 텍스트 필드로 출력되는 카메라 파라미터(camera parameters).
밀집 이미지 (Dense images): 공간적 정렬(spatial alignment)을 보존하며 픽셀 정렬 이미지(pixel-aligned images)로 생성되는 깊이 지도(Depth maps), 표면 법선(surface normals), 이진 마스크(binary masks) 및 포인트 맵(point maps).
혼합 텍스트-이미지 (Mixed text-image): 다중 인스턴스 분할(Multi-instance segmentation) 출력은 생성된 마스크와 쌍을 이루는 텍스트 레이블을 제공하며, 그라운디드 대화 분할(grounded conversation segmentation) 출력은 시각적 강조(visual highlights)와 함께 설명 텍스트를 제공합니다.
작업 범주별 벤치마크 성능 (Benchmark performance across task categories):
구조적 시각 이해 (Structured Visual Understanding):
-
COCO detection: 56.6 mAP (Grounding DINO와 일치)
-
HierText OCR: 80.2 F1
-
GUI grounding (ScreenSpot-V2): 31.2 mAP
-
COCO keypoints: 34.6 AP
-
RefCOCO referring: 80.5 F1
밀집 기하학적 예측 (Dense Geometric Prediction):
-
NYUv2 depth: 4.0 AbsRel / 98.1 δ<1.25
-
KITTI depth: 5.9 mean error
-
ScanNet surface normals: 12.8 mean angle error
-
DIODE, ETH3D, iBims-1을 아우르는 다중 벤치마크
분할 (Segmentation):
-
RefCOCO (general): 81.3 cIoU
-
Referring segmentation: 76.0-80.3 F1
-
Reasoning segmentation: 63.2 cIoU
-
Interactive segmentation: 73.9 AP
다중 뷰 기하학 (Multi-View Geometry):
-
Multi-view reconstruction F1: 87.9 (7Scenes/ETH3D)
-
Camera pose accuracy: 7Scenes 및 ETH3D 전반에 걸쳐 72.2
프레임워크 및 의존성 (Framework and dependencies). conda가 포함된 Python 환경, GitHub(https://github.com/OpenSenseNova/SenseNova-Vision)의 공식 추론(inference) 코드, 그리고 모델 다운로드를 위한 huggingface_hub가 필요합니다. 환경 설정 스크립트(bash setup.sh sensenova-vision)가 의존성 설치를 처리합니다.
모델 가용성 (Model availability). 가중치(Weights)는 Hugging Face의 sensenova/SenseNova-Vision-7B-MoT에서 사용할 수 있으며, ModelScope의 SenseNova/SenseNova-Vision-7B-MoT에도 미러링되어 있습니다.
파라미터 수 (Parameter count). 언어 모델 구성 요소에 7B 파라미터가 포함됩니다; 정확한 비전 인코더(vision encoder) 파라미터 및 전체 모델 크기는 문서에 명시되지 않았습니다.
모델 입력 및 출력
입력
이미지 (Images): 지침 (instructions)과 함께 전달되는 단일 또는 다중 이미지; 정확한 해상도 제한은 문서화되지 않았으나 예시에서는 표준 사진 크기를 사용함
자연어 지침 (Natural language instructions): 작업 유형, 대상 카테고리, 영역, 출력 스키마 (output schema) 및 디코딩 컨벤션 (decoding conventions)을 지정하는 텍스트 프롬프트
선택적 시각적 프롬프트 (Optional visual prompts): 작업 실행을 안내하기 위한 포인트 (point) 또는 영역 주석 (예: "이 영역의 사람을 세그멘테이션 (segment) 하세요")
작업별 파라미터 (Task-specific parameters): 탐지 대상, 세그멘테이션 (segmentation) 카테고리, 깊이 (depth) 출력 스케일, 마스크 (mask) 색상 체계 및 포즈 (pose) 출력 형식을 지침에 인코딩함
출력 (Outputs)
구조화된 텍스트 (Structured text): 정규화된 좌표 (예시로부터 유추된 0-1000 스케일), 카테고리 레이블, 신뢰도 점수 (confidence scores), 텍스트 기록으로서의 카메라 내부 파라미터 (camera intrinsics) 및 외부 파라미터 (camera extrinsics)
밀집 이미지 (Dense images): 깊이 (depth), 표면 법선 (surface normals), 포인트 좌표, 이진 마스크 (binary masks) 및 색상 코드로 구분된 시맨틱 마스크 (semantic masks)를 위해 입력 해상도와 일치하는 픽셀 정렬 맵 (pixel-aligned maps)
혼합 텍스트-이미지 (Mixed text-image): 생성된 마스크 이미지 또는 기하학적 맵 (geometric maps)과 쌍을 이루는 텍스트 레이블 또는 캡션
원시 생성물 (Raw generation): 텍스트 및 이미지 출력은 벤치마크 호환 형식(경계 상자 (bounding boxes), 세그멘테이션 마스크 (segmentation masks), 깊이 맵 (depth maps), 카메라 파라미터)으로 변환하기 위해 제공된 디코딩 유틸리티를 통한 파싱 (parsing)이 필요함
시작하기 (Getting started)
리포지토리 (repository)를 클론 (clone)하고 환경을 설정하세요:
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기