Iemand houdt een smartphone horizontaal en fotografeert een berglandschap.
Nieuws6 oktober · 22:285 min leestijd

Google brengt EmbeddingGemma 2 uit voor lokaal zoeken

EmbeddingGemma 2 zet tekst, code, beeld, video en audio in één lokale zoekruimte. Google deelt cijfers over geheugen en prestaties, maar de benchmarks zeggen nog niet hoe goed het model zoekt in de eigen bedrijfscollectie.

Google brengt EmbeddingGemma 2 uit, een open model dat tekst, code, beeld, video en audio in één vectorruimte plaatst voor lokaal zoeken, maakte het bedrijf op 6 oktober bekend.

Een Nederlands team kan hiermee een scène in een interne video of een foto uit een lokaal archief vinden zonder bronmedia naar een externe embedding-API te sturen. Verwerking en index kunnen op het apparaat blijven; het team beheert de hardware, opslag, updates en toegang.

Het model verbindt vijf soorten bestanden

Een embeddingmodel maakt van inhoud een vector: een reeks getallen waarmee de zoekfunctie verwante items vindt. Een tekstvraag kan zo ook een foto of videomoment vinden, omdat tekst, code en media dezelfde vectorruimte delen. Het model schrijft geen antwoord. In een RAG-keten op eigen documenten haalt het systeem eerst relevante passages op en laat het daarna een taalmodel antwoorden.

De modulaire opbouw laat ontwikkelaars alleen de benodigde encoders laden. De tekst- en codebasis telt 270 miljoen parameters. Met de beeldencoder erbij wordt dat 440 miljoen; met de audio-encoder in plaats van beeld is dat 570 miljoen. De combinatie van alle vijf modaliteiten telt 740 miljoen. Alle varianten leveren vectoren van 768 dimensies. Google gebruikt Matryoshka Representation Learning om die terug te brengen naar 512, 256 of 128 dimensies. Kortere vectoren nemen minder indexruimte in, met een mogelijke daling van de zoekkwaliteit.

De contextlengte is 8.192 tokens, gedeeld door alle invoer. Google rekent dat om naar maximaal 29 afbeeldingen, 58 videoframes of ongeveer 5,5 minuten audio. Gemengde invoer deelt dat budget. De gewichten staan onder Apache 2.0 op Hugging Face en Kaggle.

Google biedt Gemma voor zoeken en genereren

De oorspronkelijke EmbeddingGemma kwam in september 2025 uit als een model van 308 miljoen parameters voor lokale tekstembeddings. Versie 2 voegt code en drie mediavormen toe. De taak verschuift van tekst begrijpen naar bestanden uit meerdere bronnen vindbaar maken.

Google beschreef met DiffusionGemma lokale tekstgeneratie, met circa 18 GB GPU-geheugen als vereiste voor de beschreven configuratie. EmbeddingGemma 2 genereert geen tekst en heeft een andere rol: het zoekt eerst de relevante passage, afbeelding of opname die een generatief model later kan gebruiken.

Perplexity kiest een andere vorm van zoeken. De MIT-gelicentieerde contextuele preview bewaart de omliggende documentcontext bij elk tekstblok. De modelkaart van Perplexity meldt dat de 8-miljard-parameterpreview alle blokken van een document samen codeert en één vector per blok maakt. Dat richt zich op lange tekstdocumenten; Google combineert verschillende mediatypen in een lokale zoekruimte.

Demonstraties laten zien waar lokaal zoeken begint

Google voegt Instant Media Search en Video Moments Finder toe aan de AI Edge Gallery voor lokaal zoeken in foto’s en video. Instant Media Search laat gebruikers op hun telefoon foto’s zoeken met tekst of een voorbeeldafbeelding; de vectoren komen in een lokale SQLite-database. Video Moments Finder indexeert beeld en audio in videobestanden en zoekt daarna op een beschrijving, zonder eerst spraak naar tekst om te zetten.

Telefoon met resultaten voor de zoekvraag “Swing the bat” en drie gevonden videomomenten met tijdcodes, bron: Google AI Edge Team
Telefoon met resultaten voor de zoekvraag “Swing the bat” en drie gevonden videomomenten met tijdcodes, bron: Google AI Edge Team

Google heeft ook AI Edge Foresight voor Mac uitgebracht, een experimentele vergaderassistent die transcripties en privébestanden lokaal indexeert. De Android-route via ML Kit volgt volgens het bedrijf in de komende weken. De Gallery-app biedt nu een demonstratie; voor een productie-app moeten ontwikkelaars de index, koppelingen en toegangsregels nog in hun eigen omgeving inrichten.

Scores en hardware vragen een eigen test

Volgens Googles modelkaart stijgt de MTEB-Code-score van 68,76 naar 78,68 punten; de meertalige score verandert van 61,15 naar 61,36. Dat is bijna tien punten winst voor code, maar een kleine verschuiving voor meertalige tekst. De modelkaart geeft afzonderlijke cijfers voor beeld, video en audio. EmbeddingGemma haalt 64,64 op MIEB Lite, 50,67 Hit@1 voor videozoekopdrachten en 69,54 MRR@10 voor audiozoekresultaten. Die cijfers komen uit verschillende benchmarks en zijn niet rechtstreeks onderling vergelijkbaar. Het zijn bovendien evaluaties van Google, geen meting op de documenten of opnames van een Nederlands bedrijf.

De ontwikkelaarsblog rapporteert 37,3 milliseconden om één beeld om te zetten naar een vector op de GPU van een MacBook M5 Pro. Op de CPU van een Raspberry Pi 5 is dat 1.761 milliseconden per beeld. Beide metingen gebruiken maximaal 70 visuele tokens per afbeelding. Bij gelijkblijvende snelheid vergt de modelstap voor 10.000 beelden rekenkundig ongeveer zes minuten op de Mac en bijna vijf uur op de Pi. Bestanden lezen en de vectorindex opbouwen kosten daar nog tijd bovenop.

Googles tabel met verwerkingstijd per afbeelding op CPU, GPU en NPU voor verschillende apparaten, bron: Google AI Edge Team
Googles tabel met verwerkingstijd per afbeelding op CPU, GPU en NPU voor verschillende apparaten, bron: Google AI Edge Team

De modelkaart legt filtering van zoekresultaten en controle op vertekening bij de ontwikkelaar. Lokaal verwerken houdt de embeddings van een externe API weg. De modelkeuze regelt geen toegang tot bronbestanden of de opgebouwde index. De uitkomst hangt af van de combinatie van apparaat, bronmateriaal, zoekindex en toegangsregels.

Lokaal zoeken maakt meer soorten bedrijfsmedia doorzoekbaar via één stap. In productie bepalen indexbeheer, toegangsrechten en hardware of de resultaten bruikbaar blijven.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van zoekidee naar toepassing

Ik denk mee welke documenten, beelden of opnames doorzoekbaar moeten worden, ontwerp de aanpak en bouw de toepassing van eerste test tot live systeem. Waar het kan houd ik de verwerking op je eigen infrastructuur, zodat je grip houdt op je data.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Google’s Gemma-modellen passeren een miljard downloads
Nieuws
5 min

21 aug 06:20

Google’s Gemma-modellen passeren een miljard downloads

Google telt een miljard downloads voor zijn open Gemma-modellen en ruim honderdduizend afgeleide varianten. Belangrijker dan het cijfer is de licentie: Gemma 4 staat onder een kale Apache 2.0-tekst.

Google brengt TimesFM-3 uit en sluit commercieel gebruik van de gewichten uit
Nieuws
5 min

1 sep 00:10

Google brengt TimesFM-3 uit en sluit commercieel gebruik van de gewichten uit

Googles nieuwe voorspelmodel TimesFM-3 staat bovenaan drie benchmarks, maar de licentie verbiedt productie en omzetgerelateerd gebruik. Zakelijk voorspellen kan alleen via versie 2.5 of de betaalde route in BigQuery.

Thomson Reuters bouwt eigen AI-model op open Chinese gewichten
Nieuws
6 min

24 aug 16:12

Thomson Reuters bouwt eigen AI-model op open Chinese gewichten

Thomson Reuters trainde voor 40 miljoen dollar een eigen AI-model op open Qwen-gewichten en de eigen juridische archieven. De benchmarks laten precies zien waar eigen data wel en niet loont.

Roblox geeft drie moderatiemodellen vrij die elk chatplatform zelf kan draaien
Nieuws
5 min

21 aug 14:26

Roblox geeft drie moderatiemodellen vrij die elk chatplatform zelf kan draaien

Roblox publiceert een PII-detector, een spraakclassifier en Sentinel onder Apache 2.0. Voor elk Nederlands platform met gebruikerschat liggen er nu productiemodellen die direct raken aan AVG- en DSA-verplichtingen, inclusief cijfers per taal.

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.