Man aan een bureau die in zijn smartphone spreekt, met toetsenbord en beeldscherm voor zich
Nieuws27 augustus · 00:355 min leestijd

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API

Google brengt Gemini 3.5 Transcribe uit, een spraak-naar-tekstmodel dat vulwoorden weghaalt en tekst opmaakt. Nederlands werkt via de API, de consumentenkanalen blijven voorlopig Engels. Kosten: ongeveer 30 dollarcent per uur audio.

Google lanceert Gemini 3.5 Transcribe, een spraak-naar-tekstmodel dat stopwoorden weghaalt en gesproken tekst meteen opmaakt, en dat volgens Google meer dan 85 talen automatisch herkent en transcribeert.

Nederlands zit erbij, maar niet overal. In de documentatie van de Gemini API staat nl-NL gewoon in de talentabel van zowel het opnamemodel als de live-variant. De kanalen waar je vandaag op kunt klikken zijn smaller: de Gemini-app op macOS werkt in het Engels en de Rambler-functie op Android draait in een selectie van landen en talen. Voor een Nederlands zorgteam, adviesbureau of klantcontactafdeling betekent dat iets concreets: dit is vandaag een bouwsteen voor je eigen werkstroom, geen knop die morgen in je toetsenbord verschijnt. Chrome krijgt de functie later, zonder datum.

De kosten zijn wel meteen scherp. Google zet het opnamemodel op ongeveer 0,005 dollar per minuut audio als gemengd tarief voor invoer en uitvoer, de streamingvariant op ongeveer 0,009 dollar per minuut. Artificial Analysis rekent dat om naar 5 dollar per duizend minuten, dus zo'n 30 dollarcent per uur opname. Dat is een andere kostenstructuur dan de kant-en-klare notulisten, waar het Business-plan van Fireflies op 19 dollar per gebruiker per maand met onbeperkte transcriptie staat. Je betaalt per minuut in plaats van per medewerker, en dat draait de rekensom om zodra weinig mensen veel audio verwerken.

Wat het model doet

Google levert twee model-ids. Voor opgenomen audio is er gemini-3.5-transcribe, met sprekerherkenning en tijdstempels per woord. Voor gesprekken die live meelopen is er gemini-3.5-transcribe-live, dat via de Live API met minder dan een seconde vertraging tussentijdse en definitieve transcripties teruggeeft.

De inhoudelijke winst zit in wat Google smart transcription noemt. Het model haalt vulwoorden, gestotter en valse starts eruit, verwerkt zelfcorrecties ("de afspraak is dinsdag, nee, woensdag") en zet gesproken gedachten om in alinea's, opsommingen, datums, bedragen en getallen. Je kunt tot duizend eigen termen meegeven als aangepaste woordenlijst, al meldt de documentatie dat je de beste resultaten haalt bij ongeveer honderd termen. Sprekerherkenning is nauwkeurig tot drie sprekers; meer dan drie is experimenteel. Een verzoek verwerkt audio tot een uur, en tot dertig minuten zodra je sprekerherkenning of tijdstempels aanzet.

De cijfers, en wat ze niet zeggen

Google noemt een woordfoutpercentage van 2,6 procent voor niet-streaming gebruik en 4,0 procent voor streaming, gemeten door meetbureau Artificial Analysis. Dat eerste getal is echt goed, maar het is geen koppositie: op de eigen ranglijst van dat bureau staat het model vijfde met die 2,6 procent, achter onder meer Scribe v2 van ElevenLabs op 2,2 procent en MAI-Transcribe-1.5 van Microsoft op 2,4 procent.

Interessanter voor een Nederlandse werkvloer is de meertalige meting. Op de FLEURS-benchmark, waarvan de gemeten locales expliciet nl-NL bevatten, komt de live-variant uit op 5,50 procent woordfouten en de niet-streaming variant op 5,04 procent. In dezelfde grafiek staat Googles vorige model Chirp 3 op 7,32 procent, GPT Live Transcribe van OpenAI op 8,97 procent, Scribe v2 Realtime van ElevenLabs op 9,70 procent en Nova-3 van Deepgram op 15,77 procent. De tijd tot een definitief transcript verbetert met 70 procent ten opzichte van Chirp 3.

Het verschil tussen 2,6 en 5,50 procent is precies het verschil tussen een grotendeels Engelse meting en een meertalige. Wie een businesscase op Nederlandse audio bouwt, rekent met het tweede getal: ongeveer één op de twintig woorden vraagt nog om een menselijk oog.

Opgepoetste tekst is geen woordelijk verslag

Hier zit de belangrijkste kanttekening voor verslagen die later juridisch of medisch moeten kloppen. Vulwoorden weghalen en zinnen herstructureren betekent dat het model de formulering aanpast. Bij een notitie voor jezelf is dat winst. Bij een klachtgesprek, een intake of een verhoor is de exacte woordkeuze soms juist het bewijsmateriaal.

De documentatie maakt die afweging hard. De smart-modus laat zich niet combineren met tijdstempels of sprekerherkenning. Je kiest dus: opgepoetste, direct bruikbare tekst, of een ruw transcript waarin vaststaat wie wat wanneer zei. Beide tegelijk gaat niet.

Dat maakt de controlestap eerder belangrijker dan overbodig. In de zorg is die stap al ingeburgerd: een AI-scribe levert een concept dat de behandelaar nakijkt, en juist daar haalt Nederlands onderzoek zijn tijdwinst vandaan, waarbij de administratietijd per huisartsconsult daalde van 3:33 naar 1:55 minuut. De winst zit in het wegvallen van het typewerk, niet in het overslaan van de eindredactie.

Waar het nu draait

Voor ontwikkelaars staat het model in openbare preview in de Gemini API via Google AI Studio en Google Antigravity, voor organisaties via het Gemini Enterprise Agent Platform. Aan de consumentenkant draait het al in de Gemini-app op macOS en in Rambler op Gboard, dat volgens Ars Technica voorlopig beperkt is tot de Pixel 11 en volgens Google later dit jaar naar meer toestellen komt.

Met deze stap verdwijnt transcriptie als aparte inkoop. Chirp 3 hoorde bij de losse spraakdienst van Google Cloud; Gemini 3.5 Transcribe is een model met een tokenprijs naast alle andere Gemini-modellen, en dat is precies het argument waarmee Google bestaande cloudklanten hun spraakwerk laat samenvoegen in plaats van bij Whisper of Deepgram af te nemen. Het onderscheidende vermogen verschuift daarmee weg van de motor. Dat zit voortaan in wat eromheen staat: toestemming, waar de audio wordt verwerkt, wie het concept nakijkt en in welk systeem de tekst uiteindelijk landt. En de talenkloof tussen de API en de producten laat zien hoe die volgorde loopt: ondersteuning voor Nederlands arriveert eerst bij wie zelf bouwt, en pas daarna bij wie op een knop wacht.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van gesproken woord naar systeem

Een transcriptiemodel is pas nuttig als de tekst automatisch in je dossier, CRM of ticketsysteem belandt, met een controlestap die klopt. Ik denk mee over die keten, ontwerp hem en bouw hem af, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft zet MAI-Transcribe-2 op tien dollarcent per uur audio
Nieuws
5 min

3 sep 18:25

Microsoft zet MAI-Transcribe-2 op tien dollarcent per uur audio

Microsoft zet zijn nieuwe spraakmodel MAI-Transcribe-2 op tien dollarcent per uur audio, tijdelijk tot eind dit jaar. Op Nederlands scoort het net achter Gemini, en het draait in maar vier Azure-regio's.

Google lanceert goedkopere Gemini Flash-modellen en een AI die kwetsbaarheden zelf patcht
Nieuws
3 min

21 jul 18:10

Google lanceert goedkopere Gemini Flash-modellen en een AI die kwetsbaarheden zelf patcht

Google verlaagt met Gemini 3.6 Flash en 3.5 Flash-Lite de prijs van AI-code en lanceert 3.5 Flash Cyber, een model dat softwarelekken zelfstandig opspoort en patcht, voorlopig alleen voor overheden en vertrouwde partners.

Google's Gemini Spark landt op de Mac en mag nu aan je lokale bestanden
Nieuws
6 min

2 jul 18:09

Google's Gemini Spark landt op de Mac en mag nu aan je lokale bestanden

Google brengt zijn autonome AI-agent Gemini Spark naar macOS, waar hij voor het eerst lokale bestanden mag lezen en ordenen. Met MCP-ondersteuning, real-time tracking en een prijskaartje van 99 dollar per maand.

Google opent SynthID-detector wereldwijd
Nieuws
4 min

7 okt 20:32

Google opent SynthID-detector wereldwijd

Google maakt de SynthID Detector wereldwijd in het Engels beschikbaar voor beeld, video en audio. De controle zoekt naar watermerken van Google en partners, maar herkent niet alle AI-media.

Google lanceert Gemini 3.8 Live voor realtime spraakagenten
Nieuws
4 min

15 sep 22:50

Google lanceert Gemini 3.8 Live voor realtime spraakagenten

Google brengt Gemini 3.8 Live en Live Extended Thinking naar de Gemini API. De modellen combineren realtime spraak, visuele context en achtergrondtaken, met audio-invoer voor $0,005 per minuut en uitvoer voor $0,018.

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens
Nieuws
4 min

2 sep 12:19

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens

Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite kiezen voortaan zelf welke videofragmenten ze bekijken. Google meet tot 88 procent minder tokens en tot 66 procent lagere analysekosten per vraag.