Google brengt EmbeddingGemma 2 uit, een open model dat tekst, code, beeld, video en audio in één vectorruimte plaatst voor lokaal zoeken, maakte het bedrijf op 6 oktober bekend.
Een Nederlands team kan hiermee een scène in een interne video of een foto uit een lokaal archief vinden zonder bronmedia naar een externe embedding-API te sturen. Verwerking en index kunnen op het apparaat blijven; het team beheert de hardware, opslag, updates en toegang.
Het model verbindt vijf soorten bestanden
Een embeddingmodel maakt van inhoud een vector: een reeks getallen waarmee de zoekfunctie verwante items vindt. Een tekstvraag kan zo ook een foto of videomoment vinden, omdat tekst, code en media dezelfde vectorruimte delen. Het model schrijft geen antwoord. In een RAG-keten op eigen documenten haalt het systeem eerst relevante passages op en laat het daarna een taalmodel antwoorden.
De modulaire opbouw laat ontwikkelaars alleen de benodigde encoders laden. De tekst- en codebasis telt 270 miljoen parameters. Met de beeldencoder erbij wordt dat 440 miljoen; met de audio-encoder in plaats van beeld is dat 570 miljoen. De combinatie van alle vijf modaliteiten telt 740 miljoen. Alle varianten leveren vectoren van 768 dimensies. Google gebruikt Matryoshka Representation Learning om die terug te brengen naar 512, 256 of 128 dimensies. Kortere vectoren nemen minder indexruimte in, met een mogelijke daling van de zoekkwaliteit.
De contextlengte is 8.192 tokens, gedeeld door alle invoer. Google rekent dat om naar maximaal 29 afbeeldingen, 58 videoframes of ongeveer 5,5 minuten audio. Gemengde invoer deelt dat budget. De gewichten staan onder Apache 2.0 op Hugging Face en Kaggle.
Google biedt Gemma voor zoeken en genereren
De oorspronkelijke EmbeddingGemma kwam in september 2025 uit als een model van 308 miljoen parameters voor lokale tekstembeddings. Versie 2 voegt code en drie mediavormen toe. De taak verschuift van tekst begrijpen naar bestanden uit meerdere bronnen vindbaar maken.
Google beschreef met DiffusionGemma lokale tekstgeneratie, met circa 18 GB GPU-geheugen als vereiste voor de beschreven configuratie. EmbeddingGemma 2 genereert geen tekst en heeft een andere rol: het zoekt eerst de relevante passage, afbeelding of opname die een generatief model later kan gebruiken.
Perplexity kiest een andere vorm van zoeken. De MIT-gelicentieerde contextuele preview bewaart de omliggende documentcontext bij elk tekstblok. De modelkaart van Perplexity meldt dat de 8-miljard-parameterpreview alle blokken van een document samen codeert en één vector per blok maakt. Dat richt zich op lange tekstdocumenten; Google combineert verschillende mediatypen in een lokale zoekruimte.
Demonstraties laten zien waar lokaal zoeken begint
Google voegt Instant Media Search en Video Moments Finder toe aan de AI Edge Gallery voor lokaal zoeken in foto’s en video. Instant Media Search laat gebruikers op hun telefoon foto’s zoeken met tekst of een voorbeeldafbeelding; de vectoren komen in een lokale SQLite-database. Video Moments Finder indexeert beeld en audio in videobestanden en zoekt daarna op een beschrijving, zonder eerst spraak naar tekst om te zetten.

Google heeft ook AI Edge Foresight voor Mac uitgebracht, een experimentele vergaderassistent die transcripties en privébestanden lokaal indexeert. De Android-route via ML Kit volgt volgens het bedrijf in de komende weken. De Gallery-app biedt nu een demonstratie; voor een productie-app moeten ontwikkelaars de index, koppelingen en toegangsregels nog in hun eigen omgeving inrichten.
Scores en hardware vragen een eigen test
Volgens Googles modelkaart stijgt de MTEB-Code-score van 68,76 naar 78,68 punten; de meertalige score verandert van 61,15 naar 61,36. Dat is bijna tien punten winst voor code, maar een kleine verschuiving voor meertalige tekst. De modelkaart geeft afzonderlijke cijfers voor beeld, video en audio. EmbeddingGemma haalt 64,64 op MIEB Lite, 50,67 Hit@1 voor videozoekopdrachten en 69,54 MRR@10 voor audiozoekresultaten. Die cijfers komen uit verschillende benchmarks en zijn niet rechtstreeks onderling vergelijkbaar. Het zijn bovendien evaluaties van Google, geen meting op de documenten of opnames van een Nederlands bedrijf.
De ontwikkelaarsblog rapporteert 37,3 milliseconden om één beeld om te zetten naar een vector op de GPU van een MacBook M5 Pro. Op de CPU van een Raspberry Pi 5 is dat 1.761 milliseconden per beeld. Beide metingen gebruiken maximaal 70 visuele tokens per afbeelding. Bij gelijkblijvende snelheid vergt de modelstap voor 10.000 beelden rekenkundig ongeveer zes minuten op de Mac en bijna vijf uur op de Pi. Bestanden lezen en de vectorindex opbouwen kosten daar nog tijd bovenop.

De modelkaart legt filtering van zoekresultaten en controle op vertekening bij de ontwikkelaar. Lokaal verwerken houdt de embeddings van een externe API weg. De modelkeuze regelt geen toegang tot bronbestanden of de opgebouwde index. De uitkomst hangt af van de combinatie van apparaat, bronmateriaal, zoekindex en toegangsregels.
Lokaal zoeken maakt meer soorten bedrijfsmedia doorzoekbaar via één stap. In productie bepalen indexbeheer, toegangsrechten en hardware of de resultaten bruikbaar blijven.
Veelgestelde vragen
Van zoekidee naar toepassing
Ik denk mee welke documenten, beelden of opnames doorzoekbaar moeten worden, ontwerp de aanpak en bouw de toepassing van eerste test tot live systeem. Waar het kan houd ik de verwerking op je eigen infrastructuur, zodat je grip houdt op je data.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
