Jina의 10.4억 개 매개변수 AI 모델이 네 가지 모달리티를 하나의 벡터 공간으로 통합하다
요약
jinaai가 개발한 jina-embeddings-v5-omni-nano는 텍스트, 이미지, 비디오, 오디오 네 가지 모달리티를 하나의 768차원 벡터 공간에 통합하는 멀티모달 임베딩 모델입니다. 이 공유 벡터 공간 덕분에 별도의 재인덱싱 없이 교차 모달 검색 및 분류가 가능합니다. 이는 생성형 모델이 아닌 순수 임베딩 모델로, 다양한 AI 애플리케이션의 기반 기술을 제공합니다.
핵심 포인트
- 텍스트, 이미지, 비디오, 오디오를 단일 벡터 공간에 통합 (768차원).
- 재인덱싱 없이 교차 모달 검색 및 분류가 가능하여 활용도가 높음.
- 생성형 모델이 아닌 임베딩 전용 모델로, 검색(Retrieval) 기반 애플리케이션에 적합함.
- 최대 8,192 토큰의 긴 시퀀스 입력을 지원하며 다양한 어댑터 제공.
개요
jina-embeddings-v5-omni-nano는 jinaai에서 개발한 약 10.4억 개의 매개변수를 가진 멀티모달 임베딩 모델입니다. 이 모델은 텍스트, 이미지, 비디오, 오디오를 하나의 768차원 벡터 공간에 임베딩하며, 이는 jina-embeddings-v5-text-nano와 정렬됩니다. 이를 통해 콘텐츠를 별도의 공간으로 재인덱싱할 필요 없이 텍스트-투-미디어 및 미디어-투-텍스트 검색을 가능하게 합니다. 아키텍처는 GELATO를 따르며, 고정된(frozen) 텍스트 및 비-텍스트 인코더가 공동 모델 가중치의 0.35%를 차지하는 학습된 구성 요소들을 통해 연결됩니다. 언어 모델은 실질적으로 변경되지 않으므로 텍스트 임베딩이 텍스트 전용 모델과 일치합니다. 핵심적인 실용적 포인트는 이것이 생성형(generative) 모델이 아닌 공유 공간 임베딩 모델이라는 것이며, 검색을 위해서는 질의(query)와 문서(document) 입력을 구분해야 합니다. 기본 저장소에는 검색(retrieval), 분류(classification), 클러스터링(clustering), 텍스트 매칭용 어댑터가 포함되어 있습니다. Transformers 및 PyTorch를 사용하여 실행할 수 있으며, 멀티모달 처리는 Transformers 5.x가 필요하고, 텍스트 전용 사용은 Transformers 4.57 이상을 지원합니다. 모델 카드에는 최대 시퀀스 길이 8,192 토큰과 마지막 토큰 풀링(last-token pooling)이 보고되어 있습니다. 제공된 자료에는 학습 데이터셋 크기, 학습 단계, 벤치마크 점수, VRAM 요구 사항 또는 추론 지연 시간은 명시되어 있지 않습니다.
최적 사용 사례
혼합 컬렉션에 대한 교차 모달 검색(Cross-modal search over a mixed collection). 제품 설명, 제품 사진, 시연 클립 및 음성 설명을 하나의 인덱스에 임베딩한 다음, 텍스트 또는 미디어를 사용하여 해당 인덱스를 검색할 수 있습니다. 공유 벡터 공간이 핵심 설계 특징입니다: 텍스트는 재인덱싱 없이 다른 모달리티로 색인화되고 질의될 수 있습니다. 검색을 위해서는 일반적인 encode() 호출 대신 질의 측(query-side) 및 문서 측(document-side) 인코딩을 사용하십시오.
멀티모달 검색 증강 생성(Multimodal retrieval-augmented generation). 검색 어댑터(retrieval adapter)를 사용하여 사용자 질의에 맞는 텍스트, 이미지, 비디오 또는 오디오 자료를 찾은 다음, 검색된 자료를 별도의 생성 시스템으로 전달합니다. 이 모델은 답변이나 캡션, 요약이 아닌 정규화된 임베딩(normalized embeddings)을 생성합니다. 최대 8,192 토큰의 시퀀스 길이로 해당 한도 내에서 긴 텍스트 입력을 지원하지만, 제공된 자료에서는 코퍼스 유형별 검색 품질에 대한 보고는 없습니다.
모달리티 전반의 제로샷 또는 퓨샷 분류(Zero-shot or few-shot classification across modalities). 항목의 임베딩을 레이블 또는 예시 임베딩과 비교하여 카테고리를 할당합니다. 예를 들어, 제품 이미지를 카탈로그 클래스로 분류하거나 알려진 레이블별로 오디오 클립을 그룹화할 수 있습니다. 이 분류 어댑터(classification adapter)는 모달리티 전반의 임베딩 유사성 분류를 위해 설계되었습니다. README에는 작업별 정확도 수치가 제공되지 않으므로, 대상 도메인의 레이블링된 예시를 사용하여 검증해야 합니다.
혼합 미디어 클러스터링 및 중복 제거(Clustering and deduplication of mixed media). 주제 발견, 탐색적 분석 또는 근접 중복 검토를 위해 의미적으로 유사한 문서, 이미지, 클립 또는 오디오 항목을 그룹화합니다. 클러스터링 어댑터와 공유 임베딩 공간 덕분에 서로 다른 미디어 유형들을 함께 분석하는 것이 가능해집니다. 유사성 임계값과 클러스터링 품질은 데이터셋에 따라 달라지므로, 제공된 자료에서는 임계값을 규정하고 있지 않습니다.
텍스트 매칭 및 의미적 유사성(Text matching and semantic similarity). 텍스트 매칭 어댑터(text-matching adapter)를 사용하여 의미적 텍스트 유사성(semantic textual similarity), 패러프레이즈 감지, 근접 중복 감지와 같은 대칭적인 쌍별 비교에 활용합니다. 이는 두 측면 모두 동일한 역할을 하는 경우 검색보다 더 적합합니다. 검색을 위해서는 대신 검색 어댑터(retrieval adapter)를 사용해야 하는데, 이 어댑터는 질의(query)와 문서(document) 측면을 구분하기 때문입니다.
한계점 (Limitations)**}{
제공된 자료에는 운영 벤치마크가 발표되지 않았습니다. README는 이미지(MIEB-Lite), 비디오(MMEB-V), 오디오(MAEB) 벤치마크를 아우르는 오픈 웨이트 프론티어를 설명하지만, 수치적 점수, 지연 시간(latency), 처리량(throughput), 또는 하드웨어 측정치를 제공하지 않습니다. 프론티어 그래픽만으로 실제 운영 성능을 추론해서는 안 됩니다.
명시된 VRAM 요구 사항이 없습니다. 이 모델은 약 1.04B 개의 매개변수를 가지고 있으며 기본적으로 bf16 가중치(weights)를 사용하지만, 제공된 정보에는 최소 GPU 메모리 수치나 CPU 성능 추정치가 없습니다. 실제 메모리 사용량은 선택한 모달리티 타워, 입력 크기, 배치 크기, 그리고 런타임에 따라 달라집니다.
멀티모달 설정에는 종속성과 모달리티별 처리가 필요합니다. 이미지, 비디오, 오디오 처리는 Transformers 5.x가 필요합니다. proc(videos=...)를 통한 직접적인 비디오 처리는 torchcodec 또는 torchvision이 필요하며, 오디오 디코딩은 librosa와 soundfile을 사용합니다. 원시 오디오 추론에는 실제 Whisper 프레임 마스크로부터 오디오 토큰 프롬프트를 구성해야 합니다. 이 작업은 sentence-transformers 경로가 처리합니다.
검색(Retrieval) 프롬프트가 중요합니다. 원시 Transformers 경로에서는 검색 텍스트에 Query: 또는 Document: 접두사(prefix)가 필요합니다. 이 구분은 미디어 입력에도 적용됩니다. 적절한 접두사를 미디어 플레이스홀더와 함께 포함하거나, encode_query() 및 encode_document()를 사용해야 합니다. 단순히 encode()만 호출하는 것은 의도된 검색 측면을 식별하지 못합니다.
기본 모델이 모든 작업에 가장 간단한 선택은 아닙니다. 이 모델에는 모든 작업 어댑터(task adapters)가 포함되어 있습니다. 만약 애플리케이션이 오직 검색, 분류(classification), 클러스터링, 또는 텍스트 매칭만을 사용한다면, 해당 전-병합된(pre-merged) 변형을 배포하는 것이 더 쉬울 수 있습니다.
라이선스가 상업적 사용을 제한합니다. 명시된 라이선스는 CC-BY-NC-4.0이며 이는 비상업용입니다. 제공된 자료에는 상업적 사용 예외가 없습니다.
모델 카드 실패 분석이 제공되지 않았습니다. 제공된 README와 설명에는 특정 편향(bias), 안전성(safety) 또는 모달리티별 실패 모드가 문서화되어 있지 않습니다. 보고된 문제가 없다는 것을 증거로 간주하기보다는 대표적인 데이터셋으로 테스트 성능을 확인해야 합니다.파인튜닝 상세 정보가 제한적입니다. 연구 요약에 따르면 GELATO는 백본 텍스트 모델과 추가된 모달리티 인코더를 고정(frozen)하면서 연결 구성 요소들을 학습한다고 되어 있습니다. 하지만 파인튜닝 레시피, 학습 데이터 또는 지원되는 파인튜닝 프레임워크가 제공되지 않습니다.
비교 방법
-
jina-embeddings-v5-omni-small:
jina-embeddings-v5-omni-nano를 선택합니다. 더 작은 모델이 배포 제약 조건에 더 적합하거나, 보고된 오픈 웨이트(open-weight) 프론티어 성능으로 충분할 때 사용합니다. 높은 성능을 위해 더 큰 모델을 감수하는 것이 가치 있을 때는 소형 버전을 선택해야 합니다. 제공된 자료에는 소형 모델의 파라미터 수, 지연 시간(latency), 또는 비용 수치가 없으므로 크기와 속도의 트레이드오프를 정량화할 수 없습니다. -
jina-embeddings-v5-text-nano: 인덱스나 쿼리에 이미지, 비디오 또는 오디오가 포함되거나 교차 모달 검색(cross-modal retrieval)이 필요한 경우에는 omni 모델을 선택합니다. 텍스트 전용 워크로드의 경우 텍스트 전용 모델을 선택해야 합니다. omni 모델은 모달리티 타워와 멀티모달 처리 종속성을 추가하는 반면, 그 텍스트 임베딩은 텍스트 전용 모델과 일치한다고 설명됩니다. 비교 속도나 비용 측정치는 제공되지 않았습니다.
-
jina-embeddings-v5-text-small: 공유된 텍스트-이미지-비디오-오디오 임베딩 공간을 위해서는 omni 모델을 선택합니다. 작업이 텍스트 전용이고 text-nano 버전보다 더 높은 성능이 우선순위인 경우에는 text-small 모델을 선택해야 합니다. 제공된 자료에는 이 두 모델 간의 직접적인 품질, 지연 시간 또는 비용 비교가 없습니다.
-
jina-embeddings-v4: 텍스트, 이미지, 비디오, 오디오에 대한 문서화된 공유 공간이 필요하고 검색(retrieval), 분류(classification), 클러스터링(clustering), 텍스트 매칭을 위한 작업 어댑터가 필요한 경우 omni-nano를 선택하세요. 제공된 정보는 v4가 멀티모달, 다국어 검색 모델임을 식별하지만, 비교 가능한 파라미터 수, 벤치마크 점수, 속도 또는 비용은 제공하지 않으므로, 대상 워크로드를 테스트한 후에만 그들 사이에서 선택하세요.
-
jina-embeddings-v3: 멀티모달 인덱싱 및 크로스모달 검색을 위해 omni-nano를 선택하세요. 요구 사항이 다국어, 다중 작업 텍스트 임베딩인 경우 v3를 선택하세요. 제공된 정보는 v3를 텍스트-이미지-비디오-오디오 공유 공간 모델이 아닌, 작업 LoRA가 적용된 텍스트 임베딩 모델로 설명합니다. 직접적인 성능 또는 비용 비교는 사용할 수 없습니다.
기술 사양 (Technical specifications)
이 모델은 VLM(Vision-Language Model) 스타일 아키텍처를 사용합니다: 비(non)-텍스트 인코더들은 입력값을 언어 모델에 적응시키고, 이 언어 모델이 지원되는 모든 모달리티에 대한 임베딩을 생성합니다. GELATO는 Jina Embeddings v5 Text 모델에 이미지 및 오디오 인코더를 확장했습니다. 텍스트 백본(text backbone)과 추가된 비-텍스트 인코더들은 고정되어 있으며, 연결 구성 요소들만 학습되었고 이는 결합 모델 전체 가중치의 0.35%를 차지합니다. 연구 요약에 따르면 언어 모델은 효과적으로 변경되지 않았으며 Jina Embeddings v5 Text 모델과 동일한 텍스트 임베딩을 생성합니다.
파라미터 (Parameters): 약 1.04B.
임베딩 출력 (Embedding output): 768 차원; model.embed(...)는 L2 정규화된 마지막 토큰(last-token) 임베딩을 반환합니다.
최대 시퀀스 길이 (Maximum sequence length): 8,192.
풀링 (Pooling): last-token.
작업 (Tasks): 검색(retrieval), 분류(classification), 클러스터링(clustering), 및 텍스트 매칭. 기본 저장소에는 네 가지 작업 어댑터가 모두 포함되어 있으며, 사전 병합된 작업별 변형이 사용할 수 있습니다.
모달리티 (Modalities): 텍스트(text), 이미지(image), 비디오(video), 오디오(audio). 이 모델은 또한 지원되는 문서 파일 유형으로 PDF를 나열합니다. PDF 렌더링에는 선택적 종속성이 필요합니다.
기본 정밀도 (Default precision): README에 명시된 대로 bf16 가중치입니다. 양자화 옵션은 지정되지 않았습니다.
프레임워크: Transformers 및 PyTorch; 단일 호출 멀티모달 API를 위해 선택적으로 sentence-transformers 사용. 검증된 고처리량 서비스 경로는 vllm==0.20.1을 사용합니다.
요구사항: torch>=2.5
; 멀티모달 처리를 위한 Transformers 5.x가 필요합니다. 텍스트 전용 사용은 Transformers >=4.57을 지원합니다. README의 설치 섹션에서는 핵심 패키지로 transformers, torch, pillow, 그리고 numpy를 제공합니다.
선택적 패키지: 오디오 디코딩을 위한 librosa와 soundfile; Transformers 프로세서를 통한 직접 비디오 처리를 위한 torchcodec 또는 torchvision; sentence-transformers를 통한 비디오 경로를 위한 av; PDF 렌더링을 위한 pdf2image 및 pypdfium2; SVG 렌더링을 위한 cairosvg 및 pillow; 단일 호출 API를 위한 sentence-transformers. vLLM FP8 커널을 사용하는 H100 배포의 경우 DeepGEMM이 필요할 수도 있습니다.
선택적 로딩: `modality=
. raw 프로세서 예제는 text=""와 함께 이미지를 제공합니다.
. sentence-transformers API는 URL, 로컬 경로, PIL 이미지, NumPy 배열, PyTorch 텐서, 바이트(bytes), 그리고 BytesIO를 허용합니다.
비디오 (Video): 지원되는 확장자는 .mp4, .avi, .mov, .mkv, .webm, .flv, 그리고 .wmv입니다. 직접 Transformers 처리는 proc(videos=...)를 사용하며, torchcodec 또는 torchvision이 필요합니다. sentence-transformers는 av를 사용하여 비디오 경로를 디코딩할 수 있습니다. 메모리 내 NumPy 프레임 배열은 디코더가 필요하지 않습니다.
오디오 (Audio): 지원되는 확장자는 .wav, .mp3, .flac, .ogg, .m4a, 그리고 .opus입니다. raw 예제는 16 kHz로 오디오를 로드하고 128-특징 Whisper 추출기를 사용합니다. 오디오에는 문자열 플레이스홀더가 없으며, raw 추론은 특징 추출기의 어텐션 마스크에서 패딩되지 않은 프레임 수를 사용하여 오디오 토큰을 구성합니다.
문서 (Documents): .pdf가 지원되는 형식으로 나열되어 있습니다. PDF 렌더링에는 pdf2image와 pypdfium2가 필요합니다.
출력물 (Outputs)
임베딩 (Embeddings): 마지막 토큰 풀링(last-token pooling)에서 얻은 768차원, L2 정규화 벡터입니다.
공유 의미 공간 (Shared semantic space): 텍스트, 이미지, 비디오, 오디오 임베딩이 교차 모달 비교 및 검색을 위해 정렬됩니다.
EIS를 통한 차원 축소 (Reduced dimensions through EIS): README는 32차원 출력을 위해 구성된 사용자 정의 엔드포인트를 시연합니다. 이는 로컬 절단(local truncation) 절차에 대해서는 설명하지 않습니다.
시작하기 (Getting started)
이 최소 예제는 검색 어댑터를 로드하고 텍스트와 이미지를 임베딩합니다. Transformers 5.x, PyTorch 2.5 이상, Pillow, 그리고 NumPy를 설치해야 하며, 이미지 처리는 모델의 프로세서 종속성도 필요로 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기