EmbeddingGemma 2의 비전 타워를 이용한 이미지-텍스트 검색을 WebGPU 환경의 브라우저에서 실행
요약
EmbeddingGemma 2가 출시되어 이미지와 텍스트를 동일한 768차원 공간에 매핑할 수 있게 되었습니다. 이를 활용하여, WebGPU 기반의 브라우저 환경에서 사진을 설명하는 방식으로 검색이 가능한 작은 갤러리를 구현했습니다.
핵심 포인트
- EmbeddingGemma 2는 이미지와 텍스트를 통합된 768차원 공간에 매핑합니다.
- WebGPU 기반의 ruNNtime 라이브러리로 브라우저 내 GPU에서 추론을 실행했습니다.
- 사진 설명 검색 기능을 구현하여 온디바이스 AI 활용 가능성을 보여줍니다.
EmbeddingGemma 2가 이번 주에 출시되었습니다. 이 모델은 이미지를 텍스트와 하나의 768차원 공간으로 매핑하므로, 사진을 설명하는 방식으로 검색할 수 있습니다. 저는 이 모델의 텍스트 및 비전 타워를 TypeScript 기반의 WebGPU 추론 라이브러리인 ruNNtime에 포팅하여, 검색이 브라우저 내 GPU에서 완전히 실행되는 작은 사진 갤러리를 만들었습니다. ruNNtime은 또한 다른 많은 비전 관련 모델들을 지원하며, 다음 소스에서 인터랙티브 문서(interactive docs)를 통해 사용해 볼 수 있습니다: https://github.com/software-mansion/runntime /u/FinancialAd1961 제출
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기