Google, metin, kod, görüntü, video ve ses üzerinde anlamsal aramayı dizüstü bilgisayarlara, telefonlara ve diğer uç cihazlara — veri bir sunucuya gitmeden — taşımak için tasarladığını söylediği açık ağırlıklı çok modlu gömme modeli EmbeddingGemma 2'yi yayımladı.

Gemma 4 mimarisi üzerine kurulu ve Apache 2.0 lisansıyla yayımlanan model kasten küçük: 1 milyar parametrenin altında ve geliştiricilerin yalnızca ihtiyaç duydukları kodlayıcıları yüklemesine izin veren modüler bir tasarıma sahip. Metin ve kod omurgası 270M parametre; görüntü eklenince 440M'ye, ses eklenince 570M'ye çıkıyor; tam çok modlu yapılandırma 740M parametreye ulaşıyor. En önemlisi, her yapılandırma aynı 768 boyutlu vektör uzayına yansıyor; yani yalnızca metinle kurulmuş bir sorgu, tam modelle gömülmüş belgelerle doğrudan eşleştirilebiliyor.

Bu paylaşılan uzay, modaliteler arası erişimi pratik kılıyor: tek bir metin sorgusu bir görüntü, bir video karesi ya da bir ses kaydıyla anlamsal benzerlik üzerinden karşılaştırılabiliyor. Gömmeler sentence-transformers kütüphanesi üzerinden üretiliyor ve Google dört kurulumun da aynı kontrol noktasından yüklendiğini söylüyor; bu da metin tabanlı bir dizinin daha sonra görüntü veya ses gömmeleriyle genişletilirken depolananların yeniden hesaplanmasına gerek olmadığı anlamına geliyor.

Google ayrıca Matryoshka Representation Learning'e dayanıyor; bu yöntem vektörlerin 768 boyuttan 512, 256 veya 128 boyuta kısaltılmasına ve kalitenin büyük bölümünün korunmasına imkân tanıyor. Şirkete göre 256 boyutta metin ve kod kalitesinin çoğu, görüntü, video ve konuşma erişiminde ise yaklaşık yüzde 95 korunuyor ve depolama üçte bire iniyor. 128 boyutta depolama 6 kat azalıyor — bir milyon vektör için 1,5 GB yerine yaklaşık 250 MB — metin ve kodda kalite yaklaşık yüzde 90 kalırken multimedya erişimi yaklaşık yüzde 75'e düşüyor.

Google, EmbeddingGemma 2'nin MTEB kod kıyaslamasında ilk EmbeddingGemma'dan yüzde 14 daha yüksek puan aldığını, önceki modelin çok dilli metin doğruluğunu korurken görüntü, video ve ses erişimini eklediğini belirtiyor. Şirket modeli yazarken arama, videoda an bulma, sıfır atışlı niyet yönlendirme ve kodlama ajanları için yerel kod tabanı indeksleme gibi cihaz üstü kullanımlar için öneriyor. Ağırlıklar Hugging Face'te; Google, CPU, GPU ve NPU hızlandırma için MediaPipe Tasks ve LiteRT'i, yerel sunum için vLLM, Ollama, LM Studio, MLX ve SGLang'i işaret ediyor.