ElevenLabs bracht op 28 september v4 en v4 Turbo uit voor spraak in meer dan 90 talen; Turbo bereikt volgens het bedrijf mediaan 150 milliseconden tot de eerste hoorbare spraak.
Voor Nederlandse organisaties die klanten of medewerkers in meerdere talen bedienen, verandert de productie van gesproken content en spraakinterfaces. Dezelfde stem kan volgens ElevenLabs in andere taalversies spreken met behoud van de sprekeridentiteit. Turbo is bedoeld voor realtime gesprekken, naast het maken van audiocontent.
Eén stem over taalgrenzen
v4 geeft makers meer regie over de voordracht. Inline tags en gewone taal kunnen aangeven hoe een zin moet klinken, welke emotie past of welk geluid moet meekomen. De modellen houden volgens de aankondiging de stemidentiteit beter vast in lange teksten en gesprekken met meerdere sprekers.
Ook stemklonen horen bij de release. TechCrunch meldt dat een Instant Voice Clone met slechts tien seconden audio kan worden gemaakt. Dat verlaagt de hoeveelheid bronmateriaal voor een eerste proef met een eigen stem.
De modelkeuze zit ook in de API
De modeldocumentatie noemt v4 en v4 Turbo als API-modellen voor meer dan 90 talen en hoogwaardige stemklonen. v4 is beschikbaar via Text to Dialogue; Turbo gebruikt de WebSocket-route voor realtime audio. De API-referentie beschrijft het maken en streamen van dialogen. Een aparte API-route maakt Instant Voice Clones aan.
Voor lange teksten geldt een concrete grens: v4 verwerkt maximaal 10.000 tekens per aanvraag, volgens de documentatie ongeveer tien minuten audio. Een audioboek of cursus moet dus in meerdere delen worden gegenereerd.
ElevenLabs mat in september een mediane tijd van aanvraag tot hoorbare spraak van 150 milliseconden voor v4 Turbo. In dezelfde test kwamen vier andere modellen uit op 262 tot 814 milliseconden. Het bedrijf gebruikte gelijke scripts en standaardinstellingen en haalde netwerkvertraging uit de meting. De uitkomst beschrijft dus de modeltest, niet de totale wachttijd van een complete bedrijfsapplicatie.

Taalbereik, herkenbare stem en responstijd komen zo samen in één programmeerbare spraaklaag. Die kan terugkeren in productuitleg, trainingen en live klantcontact, met dezelfde stem over verschillende taalversies heen.
Veelgestelde vragen
Van tekst naar spraak
Ik denk mee over de rol van spraak in je klantproces, ontwerp de oplossing en realiseer die van eerste idee tot live product. Waar het kan, bouw ik self-hosted en neem ik koppelingen en automatisering mee.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

