Google introduceert Gemini 3.8 Flash TTS om stemmen uit tekstbeschrijvingen te ontwerpen en spraak per zin te regisseren, meldt het bedrijf op 23 september, naast Flash-Lite voor audioproductie op grotere schaal.
Voor Nederlandse organisaties maakt dat Nederlandstalige productuitleg, podcasts en nasynchronisatie met een eigen ontworpen stem mogelijk. Beide modellen ondersteunen Nederlands via de Gemini API, volgens Googles documentatie.
Twee modellen voor twee werklasten
Flash TTS is bedoeld voor stemontwerp en creatieve regie. Je beschrijft in gewone taal de rol, het accent en de kenmerken van een stem. De API-documentatie noemt 130 ondersteunde talen voor Flash TTS en 101 voor Flash-Lite. Google noemt daarnaast een bibliotheek met meer dan 2.000 kant-en-klare stemmen.
Met de modellen kunnen makers de uitvoering per regel aansturen, zoals tempo en emotie, en scènes met twee stemmen uit één script maken. Flash-Lite richt zich op grote productievolumes voor nasynchronisatie, audiocontent en spraakagenten.
Nederlandse ondersteuning, met een EER-grens
De Google-documentatie voert de model-ID’s gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts zonder het woord preview. De voorganger heet nog wel gemini-3.1-flash-tts-preview, zoals Googles TTS-overzicht laat zien. De aparte API voor stembeheer gebruikt het pad /v1beta/voices. De modelnamen zelf geven dus geen uitsluitsel over de status van elke stemfunctie.
Een ontworpen stem is iets anders dan een kopie van een bestaande stem. Voor stemreplicatie vraagt Google om een opname van 30 seconden en een aparte gesproken toestemmingsverklaring. Gegenereerde audio krijgt een SynthID-watermerk. Google vermeldt dat stemreplicatie in AI Studio niet beschikbaar is in de Europese Economische Ruimte. De beperking noemt specifiek die Studio-functie. De algemene regiolijst van Google omvat Nederland voor AI Studio en de Gemini API.
De kosten zijn per audiotoken
Googles standaardtarief voor betaalde API-aanroepen is tot en met 31 december 2026 $9 per miljoen audiotokens voor Flash TTS en $6 voor Flash-Lite. De documentatie rekent 25 audiotokens per seconde. Een uur gegenereerde audio komt daarmee uit op ongeveer $0,81 voor Flash TTS en $0,54 voor Flash-Lite. Tekstinvoer wordt apart afgerekend. Vanaf 1 januari 2027 verdubbelen de standaardtarieven voor audio-uitvoer.
Dat maakt Flash-Lite aantrekkelijker voor grote volumes, terwijl Flash TTS ruimte biedt voor meer nadruk op stemkarakter en creatieve aanwijzingen. De uurbedragen zijn alleen de berekende kosten van de audio-uitvoer, geen totaalprijs voor tekst, opslag of een complete toepassing.
Een benchmark is geen Nederlandse proef
Google meldt dat Flash TTS in Hume AI’s Voice Design Benchmark 71,4 punten haalt voor Engels en 60,8 voor accentmodellering. Die scores geven een vergelijkingspunt voor stemontwerp, maar meten niet hoe een eigen Nederlandse tekst, productnaam of regionaal accent klinkt.
The Decoder hoorde in twee eigen tests een hoge achtergrondtoon en zag in één test de stem aan het einde veranderen. Die bevinding laat zien dat benchmarkscores en productiegeschiktheid verschillende dingen meten: achtergrondruis en stemvastheid worden pas hoorbaar in de uiteindelijke audio.
Tekst naar spraak is geen spraakagent
Deze TTS-modellen zetten tekst om in audio. Ze luisteren niet zelf naar een gesprek en roepen geen tools aan. Googles modelpagina markeert Live API en functieaanroepen als niet ondersteund. Google beschrijft Gemini 3.8 Live als een model dat realtime beeldcontext verwerkt en tools op de achtergrond uitvoert. Dat sluit aan bij de Live-spraakagenten die beeld en API-aanroepen tijdens gesprekken combineren. TTS kan wel de gesproken uitvoer van zo’n interface leveren.
De verschuiving zit in de stap van vaste stemkeuze naar een ontworpen stem die als onderdeel van software kan worden aangestuurd. Toestemming, Nederlandse uitspraak en controle over lange fragmenten bepalen mede of die stem geloofwaardig blijft zodra klanten hem horen.
Veelgestelde vragen
Van idee naar spraakinterface
Ik denk mee over waar gesproken interactie waarde toevoegt, ontwerp de gebruikerservaring en bouw de koppelingen en automatisering tot het werkt. Waar het kan, host ik de oplossing zelf.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
