Google zet agentische video-analyse aan in Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite: het model kiest zelf welke fragmenten het bekijkt en verbruikt daardoor tot 88 procent minder tokens, schrijft het bedrijf.
Wie video door een AI-model haalt, betaalt per token, en video is duur per seconde. Bij de gewone verwerking rekent Google ongeveer 100 tokens per seconde beeld op lage mediaresolutie, dus een vergaderopname van een uur kost al 360.000 tokens voor één vraag. Elke volgende vraag over diezelfde opname kost dat opnieuw. Voor een servicedesk die gesprekken wil terugzoeken of een winkel die camerabeelden nakijkt, was precies dat de reden om het niet te doen.
Wat de cijfers zeggen

Google publiceert de meting per benchmark. Op 1H-VideoQA zakt het verbruik van 397.600 naar 47.700 tokens per vraag, een besparing van 88 procent, terwijl de nauwkeurigheid stijgt van 87,5 naar 88,5 procent. Op LVBench gaat het van 300.300 naar 36.000 tokens, eveneens 88 procent, met een sprong van 85,1 naar 88,6 procent.
Op Minerva, dat complex redeneren meet in plaats van lange video, valt de tokenwinst lager uit: 58,4 procent. Daar zit wel de grootste kwaliteitssprong, van 73,7 naar 79,0 procent. De 88 procent is dus geen gemiddelde maar het maximum, en het wordt gehaald op lange video. Als vergelijking gebruikt Google statische verwerking op 1 beeld per seconde bij lage mediaresolutie. Onder de geteste modellen levert 3.7 Flash met agentische verwerking de hoogste nauwkeurigheid tegen de laagste kosten per vraag, tekent The Decoder aan.
De kostenwinst blijft achter bij de tokenwinst. Google noemt tot 66 procent lagere analysekosten tegenover die 88 procent minder tokens. Dat verschil zit in het navigeren zelf: het zoeken en terugspoelen telt volgens de API-documentatie mee als redeneertokens, het opgehaalde fragment als tool-tokens. Je betaalt dus voor het bepalen waar het model moet kijken.
Het model bepaalt zelf wat het bekijkt
Tot nu toe slikte het model de hele video op een vaste framerate, standaard 1 beeld per seconde. Agentische verwerking draait dat om. Het model beslist wat het bekijkt, op welke snelheid en via welke modaliteit, dus beeld, audio of transcript, en haalt alleen de momenten op die het nodig heeft. Dat gebeurt in een lus met een interne tool die het relevante stuk van het bestand laadt, zodat een ontwikkelaar dat zoekwerk niet meer zelf hoeft te programmeren.
Daarmee komen taken binnen bereik die op 1 beeld per seconde niet lukten. Google noemt het terugvinden van momenten korter dan een seconde, zoeken in opnames van meerdere uren zonder miljoenen tokens te verbranden, afwijkingen opsporen door verdachte tijdvensters op een hogere framerate opnieuw te bekijken, en het tellen van herhaalde bewegingen of losse objecten.
Dat transcript-spoor is voor Nederlandse opnames het interessantst. Google bracht eind augustus Gemini 3.5 Transcribe uit met Nederlandse taalondersteuning in de API, waarmee gesproken Nederlands in klantgesprekken en vergaderingen niet langer het zwakke punt van zo'n pijplijn hoeft te zijn.
Aanzetten kost één veld
De functie is vanaf nu beschikbaar via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform, voor geüploade video's en voor YouTube-video's. Aanzetten gaat met één instelling: zet processing op agentic in de API-configuratie. Google rekent er geen apart tarief voor, het gewone tokentarief van de Gemini API blijft gelden.
Voor 3.7 Flash valt die rekensom nu dubbel gunstig uit, want dat model draait nog op het introductietarief van 0,75 dollar per miljoen invoertokens dat op 31 december 2026 vervalt. Reken je businesscase dus door op de 1,50 dollar die vanaf 1 januari 2027 weer geldt, met de tokenbesparing eroverheen.
Eén beperking staat in de documentatie: bij clips korter dan vijf minuten kan de tijd tot het eerste antwoord juist oplopen, omdat het model eerst nadenkt over waar het moet kijken. Google noemt de functie het meest geschikt voor video's boven de vijf minuten. Voor korte fragmenten blijft statische verwerking de snellere keuze. Buiten de API om rolt de functie binnenkort uit naar gebruikers van de Gemini-app en gaat ze de komende maanden 'Ask YouTube' op de YouTube-kijkpagina aandrijven.
Waar dit heen wijst
Onder deze release zit een verschuiving in hoe de rekening van AI ontstaat. Niet het tarief per token bepaalt straks je factuur, maar het aantal stappen dat een model per opdracht zet. Gartner voorspelt dat de inferentiekosten per agentische workflow tot 2028 vervijfvoudigen terwijl de prijs per token gewoon blijft dalen. Agentische video-analyse werkt de andere kant op: het model zet extra stappen om er in totaal veel minder te hoeven zetten.
Voor video, per seconde het duurste soort invoer dat je een model kunt geven, verschuift daarmee de grens tussen wat je nog handmatig laat uitkijken en wat je een model laat doorzoeken. Een archief van beelden, calls en opnames dat vorig jaar te duur was om te bevragen, is dat bij deze verhouding niet meer.
Veelgestelde vragen
Video die zichzelf uitleest
Camerabeelden, klantgesprekken en opnames doorzoekbaar maken is zelden alleen een modelkeuze. Ik denk mee over wat je er echt uit wilt halen, ontwerp de flow en bouw en koppel hem, zelf gehost waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
