Google DeepMind가 텍스트, 이미지, 오디오 및 비디오를 함께 검색하는 무료 온디바이스 모델을 출시하다
요약
Google DeepMind는 텍스트, 코드, 이미지, 오디오, 비디오를 단일 벡터 공간에서 검색할 수 있는 오픈 임베딩 모델 EmbeddingGemma 2를 출시했습니다. 이 모델은 Gemma 4 아키텍처 기반이며 모듈식으로 설계되어 온디바이스 RAG 및 로컬 애플리케이션에 최적화되었습니다. 특히 코드 검색 성능과 컨텍스트 창 확장성이 크게 개선되었습니다.
핵심 포인트
- 멀티모달 임베딩을 단일 벡터 공간에서 지원하여 통합 검색이 가능합니다.
- Gemma 4 기반의 모듈식 설계로 온디바이스 환경에 최적화되어 있습니다.
- 코드 검색 성능(MTEB Code)이 크게 향상되어 로컬 코딩 에이전트에 유용합니다.
- 8K 토큰 창과 확장된 컨텍스트를 통해 긴 오디오/비디오 처리가 가능합니다.
Google DeepMind는 EmbeddingGemma 2라는 오픈 임베딩 모델을 출시했습니다. 이 모델은 텍스트, 코드, 이미지, 오디오 및 비디오를 단일 공유 벡터 공간에 매핑하여 함께 검색할 수 있게 합니다. 이는 작년에 출시된 텍스트 전용 EmbeddingGemma의 후속작이며, 해당 모델은 지난 한 해 동안 2천만 건 이상의 다운로고를 기록했다고 회사는 밝혔습니다.
Gemma 4 아키텍처를 기반으로 하며 Apache 2.0 라이선스 하에 공개된 EmbeddingGemma 2는 7억 4천만 개의 파라미터를 가지고 있지만 모듈식입니다. 텍스트 전용 워크로드는 최소 2억 7천만 개의 파라미터가 필요하며, 전체 멀티모달 지원을 위해 선택적으로 1억 7천만 개 파라미터의 비전 인코더와 3억 개 파라미터의 오디오 인코더를 추가할 수 있습니다. Google은 Google Pixel 11 Pro에서 양자화된 모델이 텍스트 전용 사용 시 약 191MB의 활성 RAM을, 전체 멀티모달 버전 사용 시 약 567MB를 필요로 한다고 보고했습니다.
이 모델은 Matryoshka Representation Learning을 사용하여 개발자가 768차원의 출력 벡터를 512, 256 또는 128 차원으로 축소할 수 있게 합니다. Google에 따르면 이는 로컬 벡터 데이터베이스 저장 공간을 최대 6배까지 줄여줍니다. 컨텍스트 창도 확장되었습니다. 원본 EmbeddingGemma보다 네 배나 큰 8K 토큰 창 덕분에 단일 패스로 최대 5.5분 분량의 오디오, 29개의 이미지 또는 58개의 비디오 프레임을 처리할 수 있습니다.
벤치마크에서 Google은 EmbeddingGemma 2가 MTEB Code와 MAEB에서 10억 미만 멀티모달 임베더를 선도하며, 텍스트, 비전 및 오디오 작업에서는 일부 대형 전문 모델과 동등하거나 능가하는 성능을 보인다고 보고했습니다. 코드 검색 분야에서 가장 큰 향상이 나타났는데, MTEB Code에서 68.76에서 78.68로 개선되었으며, Google은 이를 로컬 코드베이스 인덱싱 및 코딩 에이전트 검색 사용 사례에 적합하다고 평가했습니다.
이 모델은 Gemma 4와 토크나이저 및 오디오 인코더를 공유하기 때문에, Google은 이 쌍을 온디바이스 검색 증강 생성(RAG)에 활용할 계획입니다. EmbeddingGemma 2가 로컬에서 관련 텍스트, 이미지 또는 오디오 클립을 찾으면, Gemma 4가 이를 기반으로 추론하며, 이 모든 과정이 네트워크 호출 없이 이루어집니다. Google은 초기 시연 사례로 AI Edge Gallery 앱인 Instant Media Search와 Video Moments Finder, 그리고 Foresight 앱을 언급했으며, 동일한 임베딩을 사용하여 분류 및 라우팅 시스템을 구축할 수 있는 MediaPipe Decision Task API도 함께 제시했습니다.
모델 가중치(Model weights)는 Hugging Face와 Kaggle에서 이용 가능하며, 이미 transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio 및 벡터 스토리지를 위한 Qdrant에 대한 지원이 구축되어 있습니다. Unsloth가 파인튜닝 가이드라인을 발표했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기