google/embeddinggemma-2 · Hugging Face
요약
Google DeepMind가 개발한 EmbeddingGemma 2는 텍스트, 이미지, 비디오, 오디오 등 다양한 모달리티를 단일 768차원 벡터 공간에 통합하는 개방형 임베딩 모델입니다. 이 모델은 온디바이스 애플리케이션을 위해 설계되었으며, 네이티브 멀티모달리티와 다국어/코드 지원 등의 핵심 기능을 제공합니다.
핵심 포인트
- 4가지 모달리티를 단일 768차원 공간에 통합하는 임베딩 모델입니다.
- 온디바이스 사용에 최적화되어 낮은 지연 시간의 의미론적 표현을 제공합니다.
- Matryoshka Representation Learning(MRL)으로 벡터 저장 비용을 크게 절감할 수 있습니다.
- 텍스트, 이미지, 비디오, 오디오 등 다양한 입력을 처리 가능하며 8K 컨텍스트를 지원합니다.
EmbeddingGemma 2는 Google DeepMind가 구축한 개방형 멀티모달 임베딩 모델로, 텍스트(코드 포함), 이미지, 비디오, 오디오 입력을 그리고 이들의 조합을 단일하고 통합된 768차원 벡터 공간으로 매핑합니다. 이 모델은 총 7억 4천만 개의 파라미터를 가지며, 2억 7천만 개 파라미터의 텍스트 모델과 모듈식 비전(1억 7천만) 및 오디오(3억) 인코더를 결합했습니다. 모바일 장치나 노트북 같은 소비자 하드웨어에서 구동하도록 설계된 EmbeddingGemma 2는 검색, 검색 증강 생성(RAG), 분류, 클러스터링과 같은 온디바이스 애플리케이션을 위한 낮은 지연 시간의 의미론적 표현을 제공합니다. EmbeddingGemma 2는 Gemma 4의 아키텍처 및 기능 발전을 기반으로 하며, 몇 가지 핵심 기능을 제공합니다:
- 네이티브 멀티모달리티(Native multimodality): 단일 공유 768차원 임베딩 공간에서 4가지 모달리티(텍스트, 이미지, 비디오, 오디오)를 통합합니다.
- 다국어 및 코드(Multilinguality and code): EmbeddingGemma 2는 100개 이상의 언어를 이해하며, 이전 모델 대비 코드 작업에서 약 14%의 개선을 달성했습니다.
- 유연한 크기(Flexible footprint): 2억 7천만 개 파라미터의 텍스트 백본(1억 3천만 트랜스포머 + 1억 4천만 임베더)과 선택적으로 로드 가능한 비전(1억 7천만) 및 오디오(3억) 인코더를 결합하여, 개발자가 사용 사례에 필요한 모달리티만 로드할 수 있도록 합니다.
- 매트료시카 표현 학습(Matryoshka Representation Learning, MRL): 128d, 256d, 512d, 768d 전반의 잘린 임베딩에 대한 네이티브 지원을 통해 품질에 미치는 영향은 최소화하면서 벡터 저장 비용을 최대 6배까지 줄일 수 있습니다.
- 컨텍스트 길이(Context length): 8K 토큰 컨텍스트 창을 가지며, 몇 분 분량의 오디오나 비디오를 처리할 수 있습니다.
- 작업 지향 표현(Task-steered representations): 경량의 텍스트 명령어 접두사(text instruction prefixes)를 사용하여 다양한 작업(검색, 분류, 클러스터링, 의미론적 유사성 등)에 맞게 임베딩을 최적화합니다.
GGUF 링크는 여기에 있었으나 Unsloth가 이를 막았기 때문에, 여기 Non-GGUF 모델의 링크를 제공합니다: https://huggingface.co/unsloth/embeddinggemma-2 submitted by /u/jacek2023 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기