Microsoft lanceert op 1 oktober MAI-Transcribe-2-Streaming, MAI-Voice-2.1 en MAI-Voice-2.1-Flash als bouwstenen voor stemagenten, zodat software spraak live kan verwerken en meertalig kan terugspreken.
Voor Nederlandse klantcontactteams verschuift spraak-AI van nabewerking naar het gesprek zelf: een agent kan een vraag herkennen en een volgende systeemstap voorbereiden voordat de beller klaar is. De eerdere MAI-Transcribe-2 verwerkt opgenomen audio voor 10 dollarcent per uur en biedt geen streamingfunctie. De livevariant kost 54 dollarcent per audio-uur tot eind 2026; alle drie modellen zijn beschikbaar via Microsoft Foundry en Azure Speech. Dat is 5,4 keer de introductieprijs van de opgenomen-audioversie.
Luisteren terwijl de klant praat
Het model toont de eerste tekst iets meer dan 100 milliseconden nadat audio binnenkomt. Naarmate er meer spraak volgt, kan het die tekst bijwerken en een stabiele versie vastleggen zodra de spreker klaar is. Daardoor kan een stemagent al redeneren of een systeemfunctie aanroepen terwijl de klant nog praat.
Dat verandert de rol van transcriptie. Die hoeft niet meer alleen achteraf een gesprek uit te schrijven, maar kan tijdens het contact tijd geven om gegevens op te halen of een antwoord voor te bereiden. De actie zelf hangt nog af van een koppeling met je klant-, order- of ticketsysteem.
De antwoordstem spreekt Nederlands
MAI-Voice-2.1 en Flash zetten tekst om in spraak in 23 talen en kunnen dezelfde herkenbare stem over talen heen behouden. Microsoft noemt Nederlands en vermeldt $22 per miljoen tekens voor Voice-2.1, $15 voor Flash en ongeveer 45 milliseconden modelinference voor Flash. Dat laatste cijfer meet de modelinference, niet de totale tijd van een klantvraag tot een antwoord.
De aankondiging noemt 60 talen met doorlopende automatische taaldetectie voor streamingtranscriptie, maar somt ze niet per taal op. De Nederlandse spraakuitvoer bevestigt dus niet automatisch dat de transcriptiemodule Nederlands herkent. Beide spraakmodellen kunnen ook een stem nabootsen op basis van enkele seconden voorbeeldgeluid, met ingebouwde toestemmingswaarborgen.
Beschikbaar via Azure
Naast Microsoft Foundry en Azure Speech noemt Microsoft de MAI Playground, Vercel en Azure Voice Live als toegangsroutes. De spraakmodellen zijn ook via OpenRouter beschikbaar; LiveKit volgt later. Microsoft Learn markeert Voice-2.1 en Flash als publieke preview zonder SLA en raadt productiegebruik af.
De nieuwe modellen leveren de timing en de stem. Of de klant daarmee ook geholpen wordt, hangt af van de gegevens en systeemkoppelingen achter de agent.
Veelgestelde vragen
Van gesprek naar automatisering
Ik denk mee over hoe een AI-stemagent in je klantproces past en ontwerp en bouw daarna de koppelingen en automatisering end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
