Condensatormicrofoon met popfilter voor een geluiddichte wand in een opnamestudio
Nieuws23 september · 20:384 min leestijd

Google brengt Gemini 3.8 Flash TTS uit voor AI-stemmen

Google voegt twee tekst-naar-spraakmodellen toe waarmee ontwikkelaars eigen stemmen kunnen ontwerpen en audio regisseren. Nederlands wordt ondersteund, maar stemreplicatie in AI Studio is in de EER niet beschikbaar.

Google introduceert Gemini 3.8 Flash TTS om stemmen uit tekstbeschrijvingen te ontwerpen en spraak per zin te regisseren, meldt het bedrijf op 23 september, naast Flash-Lite voor audioproductie op grotere schaal.

Voor Nederlandse organisaties maakt dat Nederlandstalige productuitleg, podcasts en nasynchronisatie met een eigen ontworpen stem mogelijk. Beide modellen ondersteunen Nederlands via de Gemini API, volgens Googles documentatie.

Twee modellen voor twee werklasten

Flash TTS is bedoeld voor stemontwerp en creatieve regie. Je beschrijft in gewone taal de rol, het accent en de kenmerken van een stem. De API-documentatie noemt 130 ondersteunde talen voor Flash TTS en 101 voor Flash-Lite. Google noemt daarnaast een bibliotheek met meer dan 2.000 kant-en-klare stemmen.

Met de modellen kunnen makers de uitvoering per regel aansturen, zoals tempo en emotie, en scènes met twee stemmen uit één script maken. Flash-Lite richt zich op grote productievolumes voor nasynchronisatie, audiocontent en spraakagenten.

Nederlandse ondersteuning, met een EER-grens

De Google-documentatie voert de model-ID’s gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts zonder het woord preview. De voorganger heet nog wel gemini-3.1-flash-tts-preview, zoals Googles TTS-overzicht laat zien. De aparte API voor stembeheer gebruikt het pad /v1beta/voices. De modelnamen zelf geven dus geen uitsluitsel over de status van elke stemfunctie.

Een ontworpen stem is iets anders dan een kopie van een bestaande stem. Voor stemreplicatie vraagt Google om een opname van 30 seconden en een aparte gesproken toestemmingsverklaring. Gegenereerde audio krijgt een SynthID-watermerk. Google vermeldt dat stemreplicatie in AI Studio niet beschikbaar is in de Europese Economische Ruimte. De beperking noemt specifiek die Studio-functie. De algemene regiolijst van Google omvat Nederland voor AI Studio en de Gemini API.

De kosten zijn per audiotoken

Googles standaardtarief voor betaalde API-aanroepen is tot en met 31 december 2026 $9 per miljoen audiotokens voor Flash TTS en $6 voor Flash-Lite. De documentatie rekent 25 audiotokens per seconde. Een uur gegenereerde audio komt daarmee uit op ongeveer $0,81 voor Flash TTS en $0,54 voor Flash-Lite. Tekstinvoer wordt apart afgerekend. Vanaf 1 januari 2027 verdubbelen de standaardtarieven voor audio-uitvoer.

Dat maakt Flash-Lite aantrekkelijker voor grote volumes, terwijl Flash TTS ruimte biedt voor meer nadruk op stemkarakter en creatieve aanwijzingen. De uurbedragen zijn alleen de berekende kosten van de audio-uitvoer, geen totaalprijs voor tekst, opslag of een complete toepassing.

Een benchmark is geen Nederlandse proef

Google meldt dat Flash TTS in Hume AI’s Voice Design Benchmark 71,4 punten haalt voor Engels en 60,8 voor accentmodellering. Die scores geven een vergelijkingspunt voor stemontwerp, maar meten niet hoe een eigen Nederlandse tekst, productnaam of regionaal accent klinkt.

The Decoder hoorde in twee eigen tests een hoge achtergrondtoon en zag in één test de stem aan het einde veranderen. Die bevinding laat zien dat benchmarkscores en productiegeschiktheid verschillende dingen meten: achtergrondruis en stemvastheid worden pas hoorbaar in de uiteindelijke audio.

Tekst naar spraak is geen spraakagent

Deze TTS-modellen zetten tekst om in audio. Ze luisteren niet zelf naar een gesprek en roepen geen tools aan. Googles modelpagina markeert Live API en functieaanroepen als niet ondersteund. Google beschrijft Gemini 3.8 Live als een model dat realtime beeldcontext verwerkt en tools op de achtergrond uitvoert. Dat sluit aan bij de Live-spraakagenten die beeld en API-aanroepen tijdens gesprekken combineren. TTS kan wel de gesproken uitvoer van zo’n interface leveren.

De verschuiving zit in de stap van vaste stemkeuze naar een ontworpen stem die als onderdeel van software kan worden aangestuurd. Toestemming, Nederlandse uitspraak en controle over lange fragmenten bepalen mede of die stem geloofwaardig blijft zodra klanten hem horen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van idee naar spraakinterface

Ik denk mee over waar gesproken interactie waarde toevoegt, ontwerp de gebruikerservaring en bouw de koppelingen en automatisering tot het werkt. Waar het kan, host ik de oplossing zelf.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Google lanceert Gemini 3.8 Live voor realtime spraakagenten
Nieuws
4 min

15 sep 22:50

Google lanceert Gemini 3.8 Live voor realtime spraakagenten

Google brengt Gemini 3.8 Live en Live Extended Thinking naar de Gemini API. De modellen combineren realtime spraak, visuele context en achtergrondtaken, met audio-invoer voor $0,005 per minuut en uitvoer voor $0,018.

Google lanceert Gemini 3.8 Flash tegen dezelfde tokenprijs
Nieuws
5 min

2 sep 20:08

Google lanceert Gemini 3.8 Flash tegen dezelfde tokenprijs

Google brengt Gemini 3.8 Flash uit tegen exact dezelfde tokenprijs als 3.7 Flash. Het model scoort hoger op vrijwel elke benchmark, maar verbruikt meer tokens per taak, waardoor de rekening per opdracht juist oploopt.

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens
Nieuws
4 min

2 sep 12:19

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens

Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite kiezen voortaan zelf welke videofragmenten ze bekijken. Google meet tot 88 procent minder tokens en tot 66 procent lagere analysekosten per vraag.

Google zet ontwerptool Pics aan in Workspace vanaf Business Standard
Nieuws
4 min

1 sep 20:21

Google zet ontwerptool Pics aan in Workspace vanaf Business Standard

Google Pics is sinds 1 september algemeen beschikbaar in Workspace vanaf Business Standard, inclusief Nederlands. De tool maakt en bewerkt beeld in Docs en Slides, maar levert geen sjablonen, merkkit of advertentiepublicatie.

Google lanceert Gemini Omni 1.1 Flash, maar eigen video bewerken kan niet in de EER
Nieuws
5 min

28 aug 04:14

Google lanceert Gemini Omni 1.1 Flash, maar eigen video bewerken kan niet in de EER

Gemini Omni 1.1 Flash is algemeen beschikbaar via de Gemini API, met scenes tot veertig seconden, 4K en tarieven van 0,03 tot 0,30 dollar per seconde. Het bewerken van eigen geuploade video blijft in de EER uitgeschakeld.

Google lanceert Gemini 3.1 Flash-Lite en Omni Flash: beeldgeneratie in 4 seconden en video-AI via de API
Nieuws
4 min

30 jun 20:11

Google lanceert Gemini 3.1 Flash-Lite en Omni Flash: beeldgeneratie in 4 seconden en video-AI via de API

Google maakt hoge-volume beeldgeneratie en gespreksgestuurde videoproductie betaalbaar: Nano Banana 2 Lite genereert beelden in 4 seconden voor $0,034, Gemini Omni Flash maakt video bewerken via een tekstinstructie mogelijk voor $0,10 per seconde.