Google lanceert Gemini 3.5 Transcribe, een spraak-naar-tekstmodel dat stopwoorden weghaalt en gesproken tekst meteen opmaakt, en dat volgens Google meer dan 85 talen automatisch herkent en transcribeert.
Nederlands zit erbij, maar niet overal. In de documentatie van de Gemini API staat nl-NL gewoon in de talentabel van zowel het opnamemodel als de live-variant. De kanalen waar je vandaag op kunt klikken zijn smaller: de Gemini-app op macOS werkt in het Engels en de Rambler-functie op Android draait in een selectie van landen en talen. Voor een Nederlands zorgteam, adviesbureau of klantcontactafdeling betekent dat iets concreets: dit is vandaag een bouwsteen voor je eigen werkstroom, geen knop die morgen in je toetsenbord verschijnt. Chrome krijgt de functie later, zonder datum.
De kosten zijn wel meteen scherp. Google zet het opnamemodel op ongeveer 0,005 dollar per minuut audio als gemengd tarief voor invoer en uitvoer, de streamingvariant op ongeveer 0,009 dollar per minuut. Artificial Analysis rekent dat om naar 5 dollar per duizend minuten, dus zo'n 30 dollarcent per uur opname. Dat is een andere kostenstructuur dan de kant-en-klare notulisten, waar het Business-plan van Fireflies op 19 dollar per gebruiker per maand met onbeperkte transcriptie staat. Je betaalt per minuut in plaats van per medewerker, en dat draait de rekensom om zodra weinig mensen veel audio verwerken.
Wat het model doet
Google levert twee model-ids. Voor opgenomen audio is er gemini-3.5-transcribe, met sprekerherkenning en tijdstempels per woord. Voor gesprekken die live meelopen is er gemini-3.5-transcribe-live, dat via de Live API met minder dan een seconde vertraging tussentijdse en definitieve transcripties teruggeeft.
De inhoudelijke winst zit in wat Google smart transcription noemt. Het model haalt vulwoorden, gestotter en valse starts eruit, verwerkt zelfcorrecties ("de afspraak is dinsdag, nee, woensdag") en zet gesproken gedachten om in alinea's, opsommingen, datums, bedragen en getallen. Je kunt tot duizend eigen termen meegeven als aangepaste woordenlijst, al meldt de documentatie dat je de beste resultaten haalt bij ongeveer honderd termen. Sprekerherkenning is nauwkeurig tot drie sprekers; meer dan drie is experimenteel. Een verzoek verwerkt audio tot een uur, en tot dertig minuten zodra je sprekerherkenning of tijdstempels aanzet.
De cijfers, en wat ze niet zeggen
Google noemt een woordfoutpercentage van 2,6 procent voor niet-streaming gebruik en 4,0 procent voor streaming, gemeten door meetbureau Artificial Analysis. Dat eerste getal is echt goed, maar het is geen koppositie: op de eigen ranglijst van dat bureau staat het model vijfde met die 2,6 procent, achter onder meer Scribe v2 van ElevenLabs op 2,2 procent en MAI-Transcribe-1.5 van Microsoft op 2,4 procent.
Interessanter voor een Nederlandse werkvloer is de meertalige meting. Op de FLEURS-benchmark, waarvan de gemeten locales expliciet nl-NL bevatten, komt de live-variant uit op 5,50 procent woordfouten en de niet-streaming variant op 5,04 procent. In dezelfde grafiek staat Googles vorige model Chirp 3 op 7,32 procent, GPT Live Transcribe van OpenAI op 8,97 procent, Scribe v2 Realtime van ElevenLabs op 9,70 procent en Nova-3 van Deepgram op 15,77 procent. De tijd tot een definitief transcript verbetert met 70 procent ten opzichte van Chirp 3.
Het verschil tussen 2,6 en 5,50 procent is precies het verschil tussen een grotendeels Engelse meting en een meertalige. Wie een businesscase op Nederlandse audio bouwt, rekent met het tweede getal: ongeveer één op de twintig woorden vraagt nog om een menselijk oog.
Opgepoetste tekst is geen woordelijk verslag
Hier zit de belangrijkste kanttekening voor verslagen die later juridisch of medisch moeten kloppen. Vulwoorden weghalen en zinnen herstructureren betekent dat het model de formulering aanpast. Bij een notitie voor jezelf is dat winst. Bij een klachtgesprek, een intake of een verhoor is de exacte woordkeuze soms juist het bewijsmateriaal.
De documentatie maakt die afweging hard. De smart-modus laat zich niet combineren met tijdstempels of sprekerherkenning. Je kiest dus: opgepoetste, direct bruikbare tekst, of een ruw transcript waarin vaststaat wie wat wanneer zei. Beide tegelijk gaat niet.
Dat maakt de controlestap eerder belangrijker dan overbodig. In de zorg is die stap al ingeburgerd: een AI-scribe levert een concept dat de behandelaar nakijkt, en juist daar haalt Nederlands onderzoek zijn tijdwinst vandaan, waarbij de administratietijd per huisartsconsult daalde van 3:33 naar 1:55 minuut. De winst zit in het wegvallen van het typewerk, niet in het overslaan van de eindredactie.
Waar het nu draait
Voor ontwikkelaars staat het model in openbare preview in de Gemini API via Google AI Studio en Google Antigravity, voor organisaties via het Gemini Enterprise Agent Platform. Aan de consumentenkant draait het al in de Gemini-app op macOS en in Rambler op Gboard, dat volgens Ars Technica voorlopig beperkt is tot de Pixel 11 en volgens Google later dit jaar naar meer toestellen komt.
Met deze stap verdwijnt transcriptie als aparte inkoop. Chirp 3 hoorde bij de losse spraakdienst van Google Cloud; Gemini 3.5 Transcribe is een model met een tokenprijs naast alle andere Gemini-modellen, en dat is precies het argument waarmee Google bestaande cloudklanten hun spraakwerk laat samenvoegen in plaats van bij Whisper of Deepgram af te nemen. Het onderscheidende vermogen verschuift daarmee weg van de motor. Dat zit voortaan in wat eromheen staat: toestemming, waar de audio wordt verwerkt, wie het concept nakijkt en in welk systeem de tekst uiteindelijk landt. En de talenkloof tussen de API en de producten laat zien hoe die volgorde loopt: ondersteuning voor Nederlands arriveert eerst bij wie zelf bouwt, en pas daarna bij wie op een knop wacht.
Veelgestelde vragen
Van gesproken woord naar systeem
Een transcriptiemodel is pas nuttig als de tekst automatisch in je dossier, CRM of ticketsysteem belandt, met een controlestap die klopt. Ik denk mee over die keten, ontwerp hem en bouw hem af, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
