Mensen aan een vergadertafel luisteren naar een vrouw die spreekt.
Nieuws2 september · 08:435 min leestijd

Meta lanceert Muse Voice Transcribe met Nederlands en sprekerherkenning

Meta brengt Muse Voice Transcribe uit, een realtime spraakmodel dat transcriptie, sprekerherkenning en spreekpauzes in een model doet. Nederlands staat in de gevalideerde talenlijst en het kost achttien dollarcent per uur audio.

Meta Superintelligence Labs brengt Muse Voice Transcribe uit, een realtime spraakmodel dat transcriberen, sprekers onderscheiden en het einde van een spreekbeurt herkennen in een en hetzelfde model combineert.

Voor een Nederlands bedrijf kantelt het op twee punten. Nederlands staat gewoon tussen de 25 talen die Meta uitgebreid heeft gevalideerd, en het tarief is achttien dollarcent per uur verwerkte audio, ofwel drie dollar per duizend audiominuten. Een team dat twintig uur per week vergadert, komt daarmee op ruim vijftien dollar per maand aan modelkosten. Wie nu per gebruiker per maand betaalt voor een notulist of een gespreksrecorder, kan die rekensom opnieuw maken. Met een stevige kanttekening: dit is een API, geen product. De opname, de opslag, de samenvatting en de koppeling naar je CRM of dossier bouw je er zelf omheen.

Een model in plaats van drie losse stappen

Een goede vergadertranscriptie was tot nu toe een keten. Een spraakherkenner zet audio om in tekst, een tweede systeem bepaalt wie er spreekt, een derde bepaalt wanneer iemand is uitgesproken. Muse Voice Transcribe doet die drie taken in hetzelfde autoregressieve model. Het verwerkt audio in blokjes van 80 milliseconden en beslist per blokje of het nog even doorluistert of alvast tekst uitschrijft. Meta noemt dat adaptive delay: het model leerde met reinforcement learning hoe lang het per woord moet wachten, waarbij nauwkeurigheid en vertraging tegen elkaar worden afgewogen.

Op de streamingmeting van Artificial Analysis van 1 september komt dat uit op 3,1 procent woordfouten bij de definitieve transcriptie, de laagste van de acht vergeleken systemen. Cartesia Ink-2 staat op 3,4 procent, ElevenLabs Scribe v2 Realtime op 3,6 procent, en Google's Gemini 3.5 Transcribe Live op 4,0 procent. Dat is hetzelfde model dat een week eerder nl-NL in de Gemini API kreeg voor ongeveer dertig dollarcent per uur audio. Meta zit dus lager in foutmarge en ruwweg veertig procent lager in prijs.

Staafdiagram van de streaming woordfoutmarge bij de definitieve transcriptie, met Muse Voice Transcribe op 3,1 procent en zeven andere systemen tussen 3,4 en 4,0 procent. Bron: Meta AI Research en Artificial Analysis, 1 september 2026.
Staafdiagram van de streaming woordfoutmarge bij de definitieve transcriptie, met Muse Voice Transcribe op 3,1 procent en zeven andere systemen tussen 3,4 en 4,0 procent. Bron: Meta AI Research en Artificial Analysis, 1 september 2026.

Het onderscheiden van sprekers gaat mee omhoog. In Meta's eigen vergelijking op de publieke datasets AMI-IHM, AMI-SDM en VoxConverse komt het model op 17,5 procent gemiddelde diarisatiefout, terwijl de beste offline concurrent op 21,1 procent blijft steken. Offline systemen mogen de hele opname overzien voordat ze een oordeel vellen; Muse doet het terwijl het audio binnenkomt. Het houdt twintig sprekers of meer uit elkaar en verwerkt opnames van langer dan een uur zonder nabewerking.

Staafdiagram van de gemiddelde diarisatiefoutmarge op AMI-IHM, AMI-SDM en VoxConverse, met Muse Voice Transcribe op 17,5 procent en vijf andere systemen tussen 21,1 en 28,6 procent. Bron: Meta AI Research.
Staafdiagram van de gemiddelde diarisatiefoutmarge op AMI-IHM, AMI-SDM en VoxConverse, met Muse Voice Transcribe op 17,5 procent en vijf andere systemen tussen 21,1 en 28,6 procent. Bron: Meta AI Research.

Reken die 17,5 procent wel eerlijk door: ongeveer een zesde van de spreektijd wordt nog altijd aan de verkeerde persoon toegeschreven. Voor een intern verslag is dat prima, voor een gespreksverslag waar een handtekening onder moet, niet.

Wat de cijfers niet zeggen over Nederlandse audio

Alle gepubliceerde scores komen van Engelstalige of grotendeels Engelstalige metingen. AMI en VoxConverse zijn Engelse vergaderkorpora, en Meta publiceert geen aparte woordfoutmarge voor Nederlands. Die 3,1 procent is dus geen belofte voor een teamoverleg met vakjargon, een slechte speakerphone en drie mensen die door elkaar praten.

Sturen kan wel. Je geeft vooraf mee welke talen je verwacht, en je levert een lijst met eigen woorden aan, product- en klantnamen bijvoorbeeld, zodat het model die vaker goed spelt. Beide zet je vast bij het openen van de sessie; wijzigen tijdens een lopende sessie kan niet. Wisselen tussen talen binnen een zin ondersteunt het model native, wat op een Nederlandse werkvloer vol Engelse vaktermen meer uitmaakt dan het klinkt.

Wat er niet in zit

De documentatie is helder over wat je niet krijgt. Geen tijdstempels per woord, alleen per spreekbeurt. Geen betrouwbaarheidsscores, geen emotieherkenning, geen herkenning van geluiden. Sprekerlabels als A en B gelden alleen binnen een sessie: dezelfde persoon krijgt in een volgende opname een ander label, en namen koppelt het model niet.

De limieten sturen je ontwerp net zo hard. Een realtime sessie loopt maximaal zestig minuten en er is geen hervattingssleutel, dus een lange vergadering knip je zelf en plak je zelf aan elkaar. Een geupload bestand mag hooguit tien minuten duren en 32 megabyte groot zijn, in mono 16-bits PCM. Per account draaien acht gelijktijdige streams en duizend gestarte streams per uur. De gewichten zijn niet vrijgegeven: het model draait via de Meta Model API, Meta AI voor Mac en Muse Code. Zelf hosten is geen optie.

Klantgesprekken en de AVG

Wie klantgesprekken laat uitschrijven, heeft aan de foutmarge niet genoeg. De vraag waar die audio blijft weegt zwaarder. Meta biedt zero data retention aan, waarbij invoer en antwoord na afhandeling niet worden bewaard, maar dat is geen standaardinstelling en niet aan te zetten in de webinterface. Het wordt per organisatie ingeschakeld na contact met sales, de ondersteuning kan per model verschillen, en in de prijslijst rekent Meta er niets extra's voor. Verwerk je persoonsgegevens in gesproken vorm, dan regel je dit vooraf, samen met een verwerkersovereenkomst en een besluit over de verwerkingslocatie.

Die 3,1 procent is niet waar de verschuiving zit. In een week tijd zetten twee grote labs een streamingmodel neer dat per uur audio wordt afgerekend in plaats van per gebruiker per maand. Transcriptie schuift daarmee op van een aparte tool die je koopt naar een functie die je in je eigen software zet, naast de opnames, de dossiers en de systemen waar de tekst toch al langs moet. Wat een leverancier van vergadernotulen dan nog verkoopt, is niet de herkenning maar alles eromheen: de werkstroom, de bewaartermijnen en het bewijs dat het klopt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van gesprek naar bruikbaar dossier

Een transcriptiemodel levert tekst, geen werkende keten: de opname, de bewaartermijn en de koppeling naar je CRM of dossier moet iemand ontwerpen. Ik denk daarin mee als ondernemer, teken de keten uit en bouw hem af, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Meta zet eigen beeldmodel Muse Image in Instagram en WhatsApp
Nieuws
3 min

7 jul 22:10

Meta zet eigen beeldmodel Muse Image in Instagram en WhatsApp

Meta bouwt zijn eerste eigen beeldmodel Muse Image direct in Meta AI, Instagram en WhatsApp. Voor Nederlandse bedrijven verschuift beeld maken naar de apps zelf, al draait het op Meta's gesloten model.

Meta bevestigt inbraak door eigen AI-model bij ander bedrijf
Nieuws
5 min

6 aug 02:22

Meta bevestigt inbraak door eigen AI-model bij ander bedrijf

Meta bevestigt dat een van zijn AI-modellen tijdens een cybersecuritytest bij een ander bedrijf inbrak. Een misconfiguratie bij testpartner Irregular gaf het model internettoegang. Het is het derde lab met dit probleem bij dezelfde tester.

Google DeepMind zakt van 49 naar 18,6 procent van het AI-talent in EMEA
Nieuws
5 min

27 aug 12:08

Google DeepMind zakt van 49 naar 18,6 procent van het AI-talent in EMEA

Het aandeel van Google DeepMind in de aanwerving van AI-onderzoekers in Europa, het Midden-Oosten en Afrika zakte van 49 naar 18,6 procent. Anthropic en Mistral pikken dat talent op, blijkt uit cijfers van Zeki Data.

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API
Nieuws
5 min

27 aug 00:35

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API

Google brengt Gemini 3.5 Transcribe uit, een spraak-naar-tekstmodel dat vulwoorden weghaalt en tekst opmaakt. Nederlands werkt via de API, de consumentenkanalen blijven voorlopig Engels. Kosten: ongeveer 30 dollarcent per uur audio.

Elke marketingtag op je site is een verwerker die je nooit hebt aangenomen
Inzicht
7 min

15 aug 09:00

Elke marketingtag op je site is een verwerker die je nooit hebt aangenomen

Je verwerkingsregister komt uit je crediteurenadministratie, terwijl de meeste gegevensstromen op je site via tags lopen die niemand ooit heeft geteld of opgezegd. Wie de tag plaatste, is niet wie ervoor aansprakelijk is.

Franse uitgevers klagen Google AI Overviews aan bij mededingingsautoriteit
Nieuws
5 min

11 aug 22:09

Franse uitgevers klagen Google AI Overviews aan bij mededingingsautoriteit

Bijna 300 Franse dagbladen klagen Google aan bij de mededingingsautoriteit om AI Overviews. Toezichthouder Arcom schat het verkeersverlies door AI-samenvattingen op 33 tot 38 procent in Europese markten waar de functie al draaide.