Een digitale videotijdlijn met blauwe en paarse clips op een zwarte achtergrond
Nieuws2 september · 12:194 min leestijd

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens

Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite kiezen voortaan zelf welke videofragmenten ze bekijken. Google meet tot 88 procent minder tokens en tot 66 procent lagere analysekosten per vraag.

Google zet agentische video-analyse aan in Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite: het model kiest zelf welke fragmenten het bekijkt en verbruikt daardoor tot 88 procent minder tokens, schrijft het bedrijf.

Wie video door een AI-model haalt, betaalt per token, en video is duur per seconde. Bij de gewone verwerking rekent Google ongeveer 100 tokens per seconde beeld op lage mediaresolutie, dus een vergaderopname van een uur kost al 360.000 tokens voor één vraag. Elke volgende vraag over diezelfde opname kost dat opnieuw. Voor een servicedesk die gesprekken wil terugzoeken of een winkel die camerabeelden nakijkt, was precies dat de reden om het niet te doen.

Wat de cijfers zeggen

Twee staafdiagrammen van Google met tokens per vraag en nauwkeurigheid van Gemini 3.7 Flash met en zonder agentische videoanalyse (bron: Google)
Twee staafdiagrammen van Google met tokens per vraag en nauwkeurigheid van Gemini 3.7 Flash met en zonder agentische videoanalyse (bron: Google)

Google publiceert de meting per benchmark. Op 1H-VideoQA zakt het verbruik van 397.600 naar 47.700 tokens per vraag, een besparing van 88 procent, terwijl de nauwkeurigheid stijgt van 87,5 naar 88,5 procent. Op LVBench gaat het van 300.300 naar 36.000 tokens, eveneens 88 procent, met een sprong van 85,1 naar 88,6 procent.

Op Minerva, dat complex redeneren meet in plaats van lange video, valt de tokenwinst lager uit: 58,4 procent. Daar zit wel de grootste kwaliteitssprong, van 73,7 naar 79,0 procent. De 88 procent is dus geen gemiddelde maar het maximum, en het wordt gehaald op lange video. Als vergelijking gebruikt Google statische verwerking op 1 beeld per seconde bij lage mediaresolutie. Onder de geteste modellen levert 3.7 Flash met agentische verwerking de hoogste nauwkeurigheid tegen de laagste kosten per vraag, tekent The Decoder aan.

De kostenwinst blijft achter bij de tokenwinst. Google noemt tot 66 procent lagere analysekosten tegenover die 88 procent minder tokens. Dat verschil zit in het navigeren zelf: het zoeken en terugspoelen telt volgens de API-documentatie mee als redeneertokens, het opgehaalde fragment als tool-tokens. Je betaalt dus voor het bepalen waar het model moet kijken.

Het model bepaalt zelf wat het bekijkt

Tot nu toe slikte het model de hele video op een vaste framerate, standaard 1 beeld per seconde. Agentische verwerking draait dat om. Het model beslist wat het bekijkt, op welke snelheid en via welke modaliteit, dus beeld, audio of transcript, en haalt alleen de momenten op die het nodig heeft. Dat gebeurt in een lus met een interne tool die het relevante stuk van het bestand laadt, zodat een ontwikkelaar dat zoekwerk niet meer zelf hoeft te programmeren.

Daarmee komen taken binnen bereik die op 1 beeld per seconde niet lukten. Google noemt het terugvinden van momenten korter dan een seconde, zoeken in opnames van meerdere uren zonder miljoenen tokens te verbranden, afwijkingen opsporen door verdachte tijdvensters op een hogere framerate opnieuw te bekijken, en het tellen van herhaalde bewegingen of losse objecten.

Dat transcript-spoor is voor Nederlandse opnames het interessantst. Google bracht eind augustus Gemini 3.5 Transcribe uit met Nederlandse taalondersteuning in de API, waarmee gesproken Nederlands in klantgesprekken en vergaderingen niet langer het zwakke punt van zo'n pijplijn hoeft te zijn.

Aanzetten kost één veld

De functie is vanaf nu beschikbaar via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform, voor geüploade video's en voor YouTube-video's. Aanzetten gaat met één instelling: zet processing op agentic in de API-configuratie. Google rekent er geen apart tarief voor, het gewone tokentarief van de Gemini API blijft gelden.

Voor 3.7 Flash valt die rekensom nu dubbel gunstig uit, want dat model draait nog op het introductietarief van 0,75 dollar per miljoen invoertokens dat op 31 december 2026 vervalt. Reken je businesscase dus door op de 1,50 dollar die vanaf 1 januari 2027 weer geldt, met de tokenbesparing eroverheen.

Eén beperking staat in de documentatie: bij clips korter dan vijf minuten kan de tijd tot het eerste antwoord juist oplopen, omdat het model eerst nadenkt over waar het moet kijken. Google noemt de functie het meest geschikt voor video's boven de vijf minuten. Voor korte fragmenten blijft statische verwerking de snellere keuze. Buiten de API om rolt de functie binnenkort uit naar gebruikers van de Gemini-app en gaat ze de komende maanden 'Ask YouTube' op de YouTube-kijkpagina aandrijven.

Waar dit heen wijst

Onder deze release zit een verschuiving in hoe de rekening van AI ontstaat. Niet het tarief per token bepaalt straks je factuur, maar het aantal stappen dat een model per opdracht zet. Gartner voorspelt dat de inferentiekosten per agentische workflow tot 2028 vervijfvoudigen terwijl de prijs per token gewoon blijft dalen. Agentische video-analyse werkt de andere kant op: het model zet extra stappen om er in totaal veel minder te hoeven zetten.

Voor video, per seconde het duurste soort invoer dat je een model kunt geven, verschuift daarmee de grens tussen wat je nog handmatig laat uitkijken en wat je een model laat doorzoeken. Een archief van beelden, calls en opnames dat vorig jaar te duur was om te bevragen, is dat bij deze verhouding niet meer.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Video die zichzelf uitleest

Camerabeelden, klantgesprekken en opnames doorzoekbaar maken is zelden alleen een modelkeuze. Ik denk mee over wat je er echt uit wilt halen, ontwerp de flow en bouw en koppel hem, zelf gehost waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Google lanceert Gemini Omni 1.1 Flash, maar eigen video bewerken kan niet in de EER
Nieuws
5 min

28 aug 04:14

Google lanceert Gemini Omni 1.1 Flash, maar eigen video bewerken kan niet in de EER

Gemini Omni 1.1 Flash is algemeen beschikbaar via de Gemini API, met scenes tot veertig seconden, 4K en tarieven van 0,03 tot 0,30 dollar per seconde. Het bewerken van eigen geuploade video blijft in de EER uitgeschakeld.

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API
Nieuws
5 min

27 aug 00:35

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API

Google brengt Gemini 3.5 Transcribe uit, een spraak-naar-tekstmodel dat vulwoorden weghaalt en tekst opmaakt. Nederlands werkt via de API, de consumentenkanalen blijven voorlopig Engels. Kosten: ongeveer 30 dollarcent per uur audio.

Google lanceert Gemini 3.7 Flash en halveert de tokenprijs tot 1 januari
Nieuws
4 min

13 aug 22:11

Google lanceert Gemini 3.7 Flash en halveert de tokenprijs tot 1 januari

Google brengt Gemini 3.7 Flash uit voor de helft van de prijs van zijn drie weken oude voorganger. Die korting vervalt op 31 december 2026, waarna het tarief weer verdubbelt.

Google lanceert goedkopere Gemini Flash-modellen en een AI die kwetsbaarheden zelf patcht
Nieuws
3 min

21 jul 18:10

Google lanceert goedkopere Gemini Flash-modellen en een AI die kwetsbaarheden zelf patcht

Google verlaagt met Gemini 3.6 Flash en 3.5 Flash-Lite de prijs van AI-code en lanceert 3.5 Flash Cyber, een model dat softwarelekken zelfstandig opspoort en patcht, voorlopig alleen voor overheden en vertrouwde partners.

Google lanceert Gemini 3.1 Flash-Lite en Omni Flash: beeldgeneratie in 4 seconden en video-AI via de API
Nieuws
4 min

30 jun 20:11

Google lanceert Gemini 3.1 Flash-Lite en Omni Flash: beeldgeneratie in 4 seconden en video-AI via de API

Google maakt hoge-volume beeldgeneratie en gespreksgestuurde videoproductie betaalbaar: Nano Banana 2 Lite genereert beelden in 4 seconden voor $0,034, Gemini Omni Flash maakt video bewerken via een tekstinstructie mogelijk voor $0,10 per seconde.

Google zet ontwerptool Pics aan in Workspace vanaf Business Standard
Nieuws
4 min

1 sep 20:21

Google zet ontwerptool Pics aan in Workspace vanaf Business Standard

Google Pics is sinds 1 september algemeen beschikbaar in Workspace vanaf Business Standard, inclusief Nederlands. De tool maakt en bewerkt beeld in Docs en Slides, maar levert geen sjablonen, merkkit of advertentiepublicatie.