Google hat EmbeddingGemma 2 veröffentlicht — ein offenes multimodales Embedding-Modell, das semantische Suche über Text, Code, Bilder, Video und Audio auf Laptops, Smartphones und andere Edge-Geräte bringen soll, ohne Daten an einen Server zu schicken.
Das Modell basiert auf der Gemma-4-Architektur und steht unter der Apache-2.0-Lizenz; es ist bewusst klein: unter einer Milliarde Parameter, mit einem modularen Aufbau, der Entwickler nur die benötigten Encoder laden lässt. Der Text- und Code-Kern hat 270 Mio. Parameter, mit Vision sind es 440 Mio., mit Audio 570 Mio., und die volle multimodale Konfiguration kommt auf 740 Mio. Entscheidend: Jede Konfiguration projiziert in denselben 768-dimensionalen Vektorraum — eine Anfrage, die mit dem reinen Text-Setup eingebettet wurde, lässt sich also direkt gegen Dokumente matchen, die mit dem Vollmodell eingebettet wurden.
Dieser gemeinsame Raum macht modalitätsübergreifendes Retrieval praktikabel: Eine einzelne Textanfrage kann per semantischer Ähnlichkeit mit einem Bild, einem Videoframe oder einer Audiospur verglichen werden. Die Embeddings entstehen über die Bibliothek sentence-transformers, und laut Google laden alle vier Setups aus demselben Checkpoint — ein reiner Textindex lässt sich später also um Bild- oder Audio-Embeddings erweitern, ohne bereits Gespeichertes neu zu berechnen.
Google setzt zudem auf Matryoshka Representation Learning, mit dem sich Vektoren von 768 auf 512, 256 oder 128 Dimensionen kürzen lassen, ohne viel Qualität zu verlieren. Bei 256 Dimensionen bleiben laut Google für Text und Code fast alle Qualität und für Bild-, Video- und Sprachsuche rund 95 Prozent — bei einem Drittel des Speicherbedarfs. Bei 128 Dimensionen sinkt der Speicherbedarf um Faktor 6 (etwa 250 MB statt 1,5 GB für eine Million Vektoren); Text und Code behalten rund 90 Prozent, Multimedia-Retrieval fällt auf etwa 75 Prozent.
Nach Angaben von Google erzielt EmbeddingGemma 2 im MTEB-Code-Benchmark 14 Prozent mehr als das ursprüngliche EmbeddingGemma und behält dessen mehrsprachige Textgenauigkeit, während Bild-, Video- und Audio-Retrieval hinzukommen. Google positioniert das Modell für On-Device-Anwendungen wie Suche während der Eingabe, das Finden von Szenen in Videos, Zero-Shot-Intent-Routing und lokales Codebasis-Indexing für Coding-Agenten. Die Gewichte sind auf Hugging Face verfügbar; für CPU-, GPU- und NPU-Beschleunigung verweist Google auf MediaPipe Tasks und LiteRT, für lokales Serving auf vLLM, Ollama, LM Studio, MLX und SGLang.




