Twee vrouwen met een headset op aan het werk achter beeldschermen in een lichte kantoorruimte.
Nieuws3 september · 18:255 min leestijd

Microsoft zet MAI-Transcribe-2 op tien dollarcent per uur audio

Microsoft zet zijn nieuwe spraakmodel MAI-Transcribe-2 op tien dollarcent per uur audio, tijdelijk tot eind dit jaar. Op Nederlands scoort het net achter Gemini, en het draait in maar vier Azure-regio's.

Microsoft brengt MAI-Transcribe-2 uit en zet het spraakmodel op tien dollarcent per uur audio, een tijdelijk tarief tot eind dit jaar. Dat is 72 procent onder de prijs van zijn eigen voorganger van vijf maanden geleden.

Voor een Nederlandse organisatie die klantgesprekken, consulten of vergaderingen laat uitschrijven, is de modelprijs daarmee geen obstakel meer. Vijfduizend uur gesprek per jaar kost bij Microsoft 500 dollar, bij ElevenLabs 1.100, bij OpenAI 1.350 en bij Google 1.500. Op een jaarbegroting voel je dat verschil nauwelijks. De keuze valt dus niet meer op de prijs per uur, maar op drie dingen die minder in het oog springen: het model staat in public preview zonder servicegarantie, het draait in maar vier Azure-regio's, en op Nederlandse audio is het niet de nauwkeurigste.

Tien cent tegen dertig cent

MAI-Transcribe-1 begon op 2 april op 36 dollarcent per uur en opvolger MAI-Transcribe-1.5 hield dat tarief in juni aan. Meetbureau Artificial Analysis, dat modellen test zoals een klant ze aanroept, rekent het nieuwe tarief om naar 1,67 dollar per duizend audiominuten en zet zo alle aanbieders op dezelfde eenheid.

Prijs van batchtranscriptie in dollar per uur audio (bron: Microsoft AI, Artificial Analysis, ElevenLabs, OpenAI)

ElevenLabs vraagt 0,22 dollar per uur voor Scribe v2 en 0,39 dollar voor de realtime-variant. OpenAI rekent voor gpt-transcribe 0,0045 dollar per minuut, ofwel 27 dollarcent per uur. Google's Gemini 3.5 Transcribe kwam uit op ongeveer dertig dollarcent per uur opname, en Meta zette Muse Voice Transcribe op achttien dollarcent per uur verwerkte audio. Ook binnen Azure zelf is tien cent laag: de gewone batchtranscriptie van Azure Speech staat op 18 dollarcent per uur, de realtime-dienst op een dollar.

Wat de superlatieven wel en niet zeggen

Microsoft noemt het model het snelste, nauwkeurigste en goedkoopste ter wereld. Op de ranglijst waar het bedrijf zelf naar verwijst klopt geen van die drie letterlijk. Op de woordfoutindex van Artificial Analysis staat MAI-Transcribe-2 op 2,0 procent, achter Alibaba's Fun-Realtime-ASR-preview op 1,7 procent. Op snelheid haalt het 410,7 keer realtime, achter Nova-3 van Deepgram op 607,7 keer. En goedkoper kan ook: StepAudio 2.5 ASR staat op 0,37 dollar per duizend minuten, ruim vier keer onder het tarief van Microsoft. Wat wel klopt is de combinatie, want geen enkel model is tegelijk nauwkeuriger en sneller.

Die snelheid is voor batchwerk het echte verschil. GPT Transcribe van OpenAI draait 40,0 keer realtime, Scribe v2 van ElevenLabs 53,2 keer. Een uur vergadering is daarmee bij Microsoft na ongeveer negen seconden verwerkt, bij OpenAI na anderhalve minuut. Voor een nachtelijke batch maakt dat weinig uit. Voor een gesprek dat meteen na afloop samengevat in het dossier moet staan, wel.

De vergelijking is ook selectief. Microsoft zet zich af tegen de grote AI-labs en noemt Deepgram, AssemblyAI, Speechmatics en Rev niet, de specialisten die transcriptie al tien jaar aan bedrijven verkopen en die de prijsdruk het hardst gaan voelen.

Wat er standaard in zit

In dat uurtarief zitten functies die specialisten vaak los afrekenen: diarisatie (wie zegt wat), tijdstempels per woord, keyword biasing voor vakjargon, een verbatim- en een clean-stand, automatische taalherkenning en code switching binnen een zin.

De standaardwaarden staan alleen niet zoals je zou verwachten. Diarisatie staat uit, tijdstempels staan op none en de stijl staat op verbatim. Wie een leesbaar verslag wil, zet transcribeStyle op clean; wie voor compliance elke aarzeling en valse start nodig heeft, laat hem staan. Bestanden mogen tot 300 MB, in WAV, MP3 of FLAC. Over streaming zegt de aankondiging niets: dit is een model voor opgenomen audio.

Nederlands zit erbij, maar niet bovenaan

Nederlands staat als nl in de talentabel van zowel MAI-Transcribe-1.5 als het nieuwe model. Interessanter is hoe goed het is. Microsoft publiceert bij de lancering een FLEURS-vergelijking per taal, met de taal vooraf opgegeven. Voor Nederlands ziet die er zo uit.

ModelWoordfout op NederlandsGemiddelde over 60 talen
Gemini 3.1 Pro3,4%5,3%
MAI-Transcribe-23,6%5,2%
Scribe v23,7%6,2%
Gemini 3.5 Transcribe3,8%5,9%
GPT-transcribe4,0%10,4%
Whisper v3-large5,7%22,8%

Twee dingen springen eruit. Nederlands doet het beter dan het gemiddelde over zestig talen, 3,6 tegen 5,2 procent, dus de wereldwijde cijfers onderschatten wat je hier krijgt. En de onderlinge verschillen zijn klein: de bovenste vier modellen liggen binnen vier tiende procentpunt. Op prijs is het gat tussen tien en dertig cent groot, op Nederlandse nauwkeurigheid is het te verwaarlozen.

Waar Microsoft wel duidelijk uitloopt, is zodra je de taal niet vooraf opgeeft. Het gemiddelde blijft dan op 5,2 procent staan, terwijl Gemini 3.1 Pro naar 5,8 procent zakt en Gemini 3.5 Transcribe naar 8,6 procent. Voor een klantcontactteam dat Nederlands, Engels en Pools door elkaar krijgt, is dat het cijfer dat telt.

FLEURS blijft wel voorgelezen tekst, geen echt gesprek. Een teamoverleg met vakjargon, een matige speakerphone en drie mensen die door elkaar praten levert een hoger foutpercentage op. Het getal is een bovengrens, geen belofte.

Waar de audio landt

Voor wie persoonsgegevens verwerkt is de regio de eerste vraag. MAI-Transcribe draait in vier Azure-regio's, waarvan North Europe de enige Europese is: East US, North Europe, Southeast Asia en West US. West Europe, waar veel Nederlandse Azure-omgevingen staan, ondersteunt het model niet.

Dat is geen detail, want Azure Speech verwerkt en bewaart data alleen in de regio van je Speech-resource. Wie binnen de EU wil blijven, zet die resource dus in Ierland en niet in de regio waar de rest van het landschap toevallig al draait.

Preview, en een prijs met een einddatum

De documentatie is expliciet: dit is public preview, zonder servicelevel-afspraak en niet aanbevolen voor productieworkloads. In de Foundry-catalogus staat het model als preview met versiedatum 3 september 2026.

De prijs heeft ook een houdbaarheidsdatum. De tien dollarcent is een lanceeraanbieding tot het einde van dit jaar en een standaardtarief daarna is niet genoemd. Op de officiële Azure-prijslijst staat MAI-transcribe onder LLM Speech nog helemaal zonder tarief. Wie hier een businesscase op bouwt, vraagt het tarief per 1 januari schriftelijk op.

De levenscyclus loopt bovendien hard. MAI-Transcribe-1 verscheen op 2 april en werd op 20 augustus als verouderd gemarkeerd, viereneenhalve maand later.

Drie modellen in vijf maanden

Van 36 naar 10 dollarcent, drie generaties in vijf maanden, en hetzelfde recept dat Microsoft eerder toepaste op een codeermodel met een listprijs 73 procent onder die van zijn voorganger: kies een afgebakende taak, optimaliseer op inferentiekosten, prijs onder de grote labs en zet het model daarna in je eigen producten. Teams, Nuance en de Azure-spraakdiensten draaien op precies dit soort audio.

Die snelheid heeft een keerzijde die op geen enkele prijslijst staat. Een model dat in vijf maanden drie generaties oud wordt, dat in preview draait en waarvan het tarief op 1 januari opnieuw wordt vastgesteld, is geen fundament. Het is een onderdeel. De organisaties die hier het meeste aan overhouden, zijn de organisaties bij wie dat model-id in een configuratieregel staat en niet verweven zit door hun hele applicatie.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Transcriptie in je eigen proces

Tien cent per uur zegt weinig over wat er daarna met die tekst moet gebeuren. Ik denk mee over de opzet, ontwerp de werkstroom en bouw de koppeling naar je dossier, CRM of kennisbank, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API
Nieuws
5 min

27 aug 00:35

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API

Google brengt Gemini 3.5 Transcribe uit, een spraak-naar-tekstmodel dat vulwoorden weghaalt en tekst opmaakt. Nederlands werkt via de API, de consumentenkanalen blijven voorlopig Engels. Kosten: ongeveer 30 dollarcent per uur audio.

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet
Nieuws
4 min

26 aug 22:35

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet

Moonshot vraagt volgens Reuters tot 30 procent van de omzet die Microsoft, Amazon en Google met Kimi K3 zouden maken. De gesprekken bepalen of je het Chinese topmodel straks gewoon als clouddienst inkoopt.

DeepMind verliest zijn zelfstandigheid binnen Google
Nieuws
4 min

9 aug 12:22

DeepMind verliest zijn zelfstandigheid binnen Google

Huidige en voormalige medewerkers zeggen tegen The Guardian dat DeepMind zijn zelfstandigheid heeft verloren. De Gemini-ontwikkeling verhuist naar de Verenigde Staten, terwijl het grote geld bij Google in de cloud zit en niet in het model.

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer
Nieuws
4 min

20 jul 16:22

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer

AMD daagt Nvidia voor het eerst op systeemniveau uit met Helios, een rack-schaal AI-systeem van 72 versnellers, en strikt Microsoft als afnemer voor Azure. Hoe groot die afname is, maakten beide bedrijven niet bekend.

Meta lanceert Muse Voice Transcribe met Nederlands en sprekerherkenning
Nieuws
5 min

2 sep 08:43

Meta lanceert Muse Voice Transcribe met Nederlands en sprekerherkenning

Meta brengt Muse Voice Transcribe uit, een realtime spraakmodel dat transcriptie, sprekerherkenning en spreekpauzes in een model doet. Nederlands staat in de gevalideerde talenlijst en het kost achttien dollarcent per uur audio.

Amazon koopt boeken op, scant ze en vernietigt ze voor AI-training
Nieuws
5 min

17 aug 20:09

Amazon koopt boeken op, scant ze en vernietigt ze voor AI-training

Een tracker in een zeldzaam boek leidde 404 Media naar een Amazon-loods in Las Vegas waar boeken worden opengesneden en gescand voor AI-training. Wat dat betekent voor iedereen die op een opt-out vertrouwt.