Google이 EmbeddingGemma 2를 출시하며 온디바이스 AI에 큰 도약을 이루다
요약
Google이 온디바이스 AI를 위한 EmbeddingGemma 2 모델을 출시하며 큰 진전을 이루었습니다. 이 740M 파라미터 모델은 MTEB 코드 벤치마크에서 높은 성능을 보이며, 로컬 RAG 및 시맨틱 코드 검색 분야의 새로운 표준이 될 것으로 기대됩니다.
핵심 포인트
- EmbeddingGemma 2는 온디바이스 AI를 위한 고성능 모델입니다.
- MTEB 코드 벤치마크에서 뛰어난 성능 향상을 입증했습니다.
- Apple Silicon 환경에서 네이티브하게 실행 가능합니다 (Rapid-MLX).
- 사용자 코드가 기기를 벗어나지 않는 프라이버시가 강점입니다.
Google이 EmbeddingGemma 2를 출시했으며, 이는 온디바이스 AI에 있어 거대한 도약입니다. 🚀
MTEB 코드 벤치마크에서 엄청난 성능 향상을 보여준 이 740M 파라미터 모델은 시맨틱 코드 검색(semantic code search), 로컬 RAG(local RAG), 그리고 AI 코딩 에이전트 분야의 새로운 표준이 됩니다.
그리고 이는 이미 Rapid-MLX 0.15.7로 Apple Silicon에서 네이티브하게 실행되고 있습니다. ⚡️
✅ 8K 컨텍스트 창 (context window)
✅ 768D 벡터 (선택적으로 128/256/512D)
✅ 100% 프라이빗—사용자의 코드는 기기를 벗어나지 않습니다.
구축할 준비가 되었습니다.
더 많은 토큰. 더 적은 대기 시간.
Rapid-MLX 0.15.7에는 Apple Silicon의 한계를 끌어올리는 두 가지 새로운 TensorFold 기반 가속 프로파일도 포함되어 있습니다.
⚡️ Nemotron 3.5 Lightning: 151 → 245.5 tok/s (+63% 처리량)
⚡️ Qwen3.8 Flash Next: 25.5 → 112.3 tok/s (4.4배 향상)
놀랍습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: RAG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기