EmbeddingGemma 2: 오픈형 경량 멀티모달 임베딩 모델
요약
EmbeddingGemma 2는 Gemma 4 아키텍처 기반의 오픈형 경량 멀티모달 임베딩 모델입니다. 텍스트를 넘어 코드, 이미지, 비디오, 오디오까지 통합하여 단일하고 네이티브한 멀티모달 처리 기능을 제공합니다. 온디바이스 추론에 최적화되었으며, 다양한 벤치마크에서 최고 수준의 성능을 입증했습니다.
핵심 포인트
- 코드, 이미지, 비디오 등 다중 모달리티를 통합하는 임베딩 모델입니다.
- 온디바이스 환경에 최적화되어 낮은 메모리 사용량으로 효율적인 추론이 가능합니다.
- MTEB Code 등 벤치마크에서 높은 성능을 보여주며, 경량성과 고성능을 모두 갖췄습니다.
EmbeddingGemma 2: 오픈형 경량 멀티모달 임베딩 모델

작년, 저희는 고품질 텍스트 임베딩을 위한 경량 옵션을 제공하기 위해 EmbeddingGemma를 소개했습니다. 이는 앱이 소비자 하드웨어에서 정보를 직접 구성하고, 검색하며, 연결하는 데 도움을 주기 위함이었습니다. 개발자 커뮤니티의 반응은 우리의 기대를 훨씬 뛰어넘었습니다. 2천만 회 이상의 다운로드와 함께, 빌더들은 이를 활용하여 더 스마트한 온디바이스 검색 도구와 프라이버시 우선의 검색 증강 생성(RAG) 파이프라인을 구동했습니다.
오늘날, 저희는 EmbeddingGemma 2를 출시하며, 텍스트를 넘어 코드, 이미지, 비디오, 오디오까지 공유 임베딩 공간에서 통합합니다. Gemma 4 아키텍처를 기반으로 하며 상업적으로 허용적인 Apache 2.0 라이선스로 공개된 EmbeddingGemma 2는 7억 4천만 개의 파라미터를 가지고 있어 온디바이스 추론에 최적화되어 있습니다. 이 모델은 음성 메모에서 특정 비디오 클립을 찾거나, 텍스트 질의를 기반으로 수 시간 분량의 오디오 녹음을 검색하는 등, 단일하고 네이티브 멀티모달 모델로 처리할 수 있도록 도움을 줄 수 있습니다.
Gemini Embedding 모델과 동일한 기술로 구축된 EmbeddingGemma 2는 다음과 같습니다:
크기 대비 최고 성능: MTEB (Massive Text Embedding Benchmark) Code 및 MAEB (Massive Audio Embedding Benchmark)와 같은 벤치마크에서 크기(sub-1B)를 가진 멀티모달 임베더 중 선두적인 점수를 달성하며, 텍스트, 비전, 오디오 작업 전반에 걸쳐 더 많은 모델과 비교해도 동등하거나 능가하는 성능을 보여줍니다.설계상 모듈화: 텍스트 전용 워크로드의 경우 단 270M개의 파라미터만 필요하며, 전체 멀티모달 지원을 위해 선택적으로 비전(170M) 및 오디오(300M) 인코더를 사용할 수 있습니다.저장 효율성: Matryoshka Representation Learning (MRL)을 사용하여 개발자는 출력 벡터를 768 차원에서 512, 256 또는 128 차원으로 동적으로 축소할 수 있습니다. 이를 통해 로컬 벡터 데이터베이스와 메모리 사용량을 최대 6배까지 줄일 수 있습니다.온디바이스 성능 최적화: 제한된 리소스 제약 내에서도 효율적으로 실행됩니다. 양자화(quantization)를 적용했을 때, Google Pixel 11 Pro에서 EmbeddingGemma 2는 텍스트 전용 가중치에 대해 약 ~191MB의 활성 RAM만 필요하며, 전체 멀티모달 모델에는 약 ~567MB가 필요합니다.확장된 컨텍스트 준비: 8K 토큰 컨텍스트 창을 특징으로 하며 (EmbeddingGemma 1보다 4배 더 큼), 로컬 하드웨어에서 최대 5.5분 분량의 오디오, 29개 이미지, 58개 비디오 프레임 또는 이들의 혼합 조합을 직접 처리할 수 있습니다.
코드, 비전 및 오디오 분야에서 최고 수준의 품질 달성
EmbeddingGemma 2는 EmbeddingGemma가 보여준 강력한 다국어 텍스트 성능과 동등하며, 코드 성능(MTEB Code 기준, 68.76점에서 78.68점으로)에서는 9.92점의 상당한 개선을 제공하여 로컬 코드베이스 인덱싱, 시맨틱 코드 검색 및 코딩 에이전트 검색에 매우 적합합니다. 이미지, 비디오, 문서 및 오디오 전반에 걸쳐 파라미터당 품질에서 새로운 표준을 제시하며, 크기가 두 배 이상 큰 일부 전문 모델보다도 뛰어난 성능을 보여줍니다.



온디바이스에서 시맨틱 검색, 라우팅 및 검색 활성화
온디바이스에서 시맨틱 검색, 라우팅 및 검색 활성화
EmbeddingGemma 2는 강력한 기능을 에지 하드웨어에 직접 가져옵니다. 로컬로 임베딩을 생성하는 것은 데이터 프라이버시를 보장하고, 파이프라인 지연 시간을 줄이며, 개발자가 완전히 오프라인으로 작동하는 크로스모달 검색 및 검색(retrieval) 시스템을 구축할 수 있도록 지원합니다.
Gemma 4와 같은 생성형 모델과 결합될 때, EmbeddingGemma 2는 복잡한 멀티모달 데이터를 이해하는 온디바이스 RAG (검색 증강 생성) 파이프라인을 가능하게 합니다. EmbeddingGemma 2는 Gemma 4를 기반으로 구축되었으며 텍스트 토크나이저와 오디오 인코더를 공유하므로, 개발자는 두 모델을 더 낮은 통합 총 메모리 사용량으로 단일화된 파이프라인에서 함께 실행할 수 있습니다.
EmbeddingGemma 2 시작하기
EmbeddingGemma 2가 구축하는 모든 환경에서 즉시 작동하도록 다음 파트너들과 긴밀하게 협력했습니다:
모델 다운로드: Hugging Face와 Kaggle에서 모델 가중치를 찾을 수 있으며, Gemini Enterprise Agent Platform Model Garden에서의 사용은 곧 제공될 예정입니다. 온디바이스에 최적화된 모델은 Hugging Face의 LiteRT 커뮤니티를 방문하십시오.온디바이스 배포: 턴키(turnkey) 임베딩, 검색 및 의사 결정 작업을 위해 Google AI Edge MediaPipe로 크로스 플랫폼 앱을 개발하거나 사용자 지정 모델 통합을 위해 LiteRT를 사용하십시오. 브라우저용으로는 transformers.js 또는 WebGPU로 구축할 수 있습니다.선호하는 개발 도구 사용: transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio 등을 사용하여 모델을 효율적으로 서비스하고, Qdrant에 임베딩 벡터를 저장하십시오.파인튜닝(Fine-tuning): Unsloth의 안내에 따라 사용 사례에 맞게 EmbeddingGemma 2를 파인튜닝하는 방법을 따르십시오.
추론 및 파인튜닝을 위한 개발자 가이드, 문서 및 가이드를 살펴보십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기