Google lanceert Gemini 3.8 Flash tegen exact dezelfde tokenprijs als zijn drie weken oude voorganger, en zet er een securitymodel naast dat alleen vertrouwde verdedigers krijgen, meldt het bedrijf op zijn eigen blog.
Voor wie Flash in een agent of een codeerassistent draait, is dat een andere rekensom dan hij lijkt. De listprijs blijft 0,75 dollar per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens, maar Google zet er zelf bij dat 3.8 Flash harder werkt: het model zet extra redeneerstappen en roept tools herhaaldelijk aan, en op hogere effort-niveaus verbruikt het daarvoor meer tokens. Dezelfde prijs per token dus, meer tokens per taak. Stuur je op rekenkosten, dan adviseert Google een lager effort-niveau of gewoon 3.7 Flash, dat volledig ondersteund blijft voor werk waarin efficiëntie voorgaat.

De prijs per token beweegt niet, de rekening wel
Dat verschil is te meten. De gemiddelde kosten per taak lopen op van 0,40 dollar voor 3.7 Flash naar 0,58 dollar voor 3.8 Flash, rekent vakblad The Decoder voor: ruim veertig procent meer, bij een identieke prijs per token. Dat is het soort verschuiving dat je pas in de maandrekening ziet en niet in de prijslijst.
Het tarief zelf heeft bovendien een einddatum. Dit is een introductieprijs die op 31 december 2026 vervalt, waarna vanaf 1 januari 2027 weer 1,50 dollar per miljoen invoertokens en 7,50 dollar per miljoen uitvoertokens geldt. Datzelfde ritme zag je bij Gemini 3.7 Flash, dat op 13 augustus binnenkwam op precies dit tarief en daarmee de prijs van zijn voorganger halveerde tot 1 januari. De structurele prijs is in zes weken geen cent bewogen. Wat beweegt, is wat je voor dat geld krijgt.
Wat 3.8 Flash beter doet
De winst zit in code en in langlopende agenttaken. Op DeepSWE v1.1, dat langlopend software-engineeringwerk meet, gaat het model van 65,3 naar 73,7 procent, vlak onder de 74,0 procent van Claude Opus 5. Dat laatste model kost wel 5,00 dollar per miljoen invoertokens tegen 0,75 dollar voor Flash. Op Terminal-bench 2.1, voor agentisch werk in de terminal, stijgt de score van 85,8 naar 89,4 procent.
In gespecialiseerde kennisdomeinen wint 3.8 Flash van elk ander model in Googles eigen tabel: 61,4 procent op Vals Finance Agent v2, tegen 59,0 procent voor 3.7 Flash, en 10,0 procent op Harvey's Legal Agent Benchmark tegen 8,8 procent. Die tweede score zegt vooral iets over hoe jong dit veld is: negen van de tien complexe juridische workflows lopen nog stuk. Op HLE-Verified, voor redeneren over meerdere vakgebieden, komt het model op 54,9 procent.
Waar het model niet wint, is net zo bruikbaar om te weten. Op Terminal-bench 4.0, dat algemene agentvaardigheden meet, blijft 3.8 Flash op 19,1 procent staan tegen 51,8 procent voor Claude Opus 5. Op OSWorld-2.0, voor agentisch computergebruik, is dat 59,0 tegen 75,4 procent. En op de Elo-meting GDPVal-AA v2 voor kenniswerk staat 1545 tegen 1824. Dit blijft het model dat je in volume draait, niet het model dat je bewaart voor de moeilijkste taak.
Op LVBench voor lange video haalt 3.8 Flash 87,8 procent in agentische modus. Dat is het spoor waarin Gemini zelf door beeldmateriaal zoekt en tot 88 procent minder tokens verbruikt.
Flash Cyber blijft achter een aanmeldhek
Gemini 3.8 Flash Cyber is het tweede model van vandaag en het is niet vrij af te nemen. Op CyberGym, de standaardbenchmark voor het zelfstandig vinden van kwetsbaarheden in C- en C++-code, haalt het 86,2 procent, tegen 77,5 procent voor 3.5 Flash Cyber en 85,6 procent voor GPT-5.5-Cyber. Op een interne test over twintig programmeertalen komt het boven de 70 procent uit. Op CWE-Bench, de externe patch-benchmark van Collinear, scoort het 47,2 procent pass@1 tegen 47,8 procent voor het beste frontier-model, bij aanzienlijk lagere kosten.

Google gebruikt het model al intern. Het Chrome-securityteam kreeg er 2,6 keer zoveel correcte patches uit als met de beste commerciële modellen, die veel groter zijn. Securitybedrijf Wiz meet 7,5 tot 9,7 procent hogere recall op zijn eigen pentest-benchmark, voor 2,3 tot 5,2 keer lagere kosten. Googles Cloud Vulnerability Research-team vond er binnen twee uur een kritieke fundamentele kwetsbaarheid mee waar normaal maanden onderzoek voor staat.
Toegang loopt via het nieuwe Fairwind-programma, dat vandaag met meer dan 650 partners van start ging en open staat voor overheden en nationale cyberautoriteiten, beheerders van kritieke infrastructuur en kerntechnologieplatforms. Deelnemers moeten de toegang beperken tot hun eigen security-, incidentrespons- en pentestteams en meervoudige authenticatie afdwingen. Voor de meeste Nederlandse bedrijven komt dat neer op: niet beschikbaar. Dezelfde rem zat op 3.5 Flash Cyber, dat 55 bevestigde kwetsbaarheden in de V8-engine van Chrome vond en alleen via CodeMender openstond voor overheden en vertrouwde partners. De reden is onveranderd: een model dat lekken vindt om ze te dichten, vindt ze net zo goed om ze te misbruiken.
Wat wel voor iedereen meekomt, is de weerbaarheid tegen prompt injection. Google meet op de Gray Swan-benchmark een flinke sprong voor beide 3.8-modellen. Draai je een agent die e-mail, documenten of webpagina's leest, dan is dat de aanval waar je het snelst tegenaan loopt: instructies die verstopt zitten in de tekst die je model verwerkt.
Waar je het model kunt draaien
Ontwikkelaars krijgen 3.8 Flash via de Gemini API in Google AI Studio, via Android Studio, in Googles agentomgeving Antigravity en in Stitch voor het genereren van interfaces. Organisaties gebruiken het in Gemini Enterprise. Abonnees van Google AI Pro en Ultra vinden het in de Gemini-app en in Google Sheets. In Google Search draait AI Mode er sinds vandaag op, wereldwijd in het Engels en te kiezen in het modelmenu.
Drie Flash-generaties in zes weken, en deze keer noemt Google zijn vorige Flash niet achterhaald maar het zuinige alternatief dat volledig ondersteund blijft. Daarmee verschuift de keuze van generatie naar werklast: het slimste model voor de taak die dat waard is, het goedkoopste voor de taak die duizenden keren per dag draait. Die splitsing blijft alleen open als de modelnaam in je software een instelling is en geen regel code. En over vier maanden verdubbelt de listprijs sowieso, voor allebei tegelijk.
Veelgestelde vragen
Modelkeuze als instelling, niet als code
Als de tokenprijs elke drie weken verschuift, wil je kunnen wisselen zonder je applicatie open te breken. Ik denk mee over de opzet, ontwerp de workflow en bouw en automatiseer hem end to end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
