Meta Superintelligence Labs brengt Muse Voice Transcribe uit, een realtime spraakmodel dat transcriberen, sprekers onderscheiden en het einde van een spreekbeurt herkennen in een en hetzelfde model combineert.
Voor een Nederlands bedrijf kantelt het op twee punten. Nederlands staat gewoon tussen de 25 talen die Meta uitgebreid heeft gevalideerd, en het tarief is achttien dollarcent per uur verwerkte audio, ofwel drie dollar per duizend audiominuten. Een team dat twintig uur per week vergadert, komt daarmee op ruim vijftien dollar per maand aan modelkosten. Wie nu per gebruiker per maand betaalt voor een notulist of een gespreksrecorder, kan die rekensom opnieuw maken. Met een stevige kanttekening: dit is een API, geen product. De opname, de opslag, de samenvatting en de koppeling naar je CRM of dossier bouw je er zelf omheen.
Een model in plaats van drie losse stappen
Een goede vergadertranscriptie was tot nu toe een keten. Een spraakherkenner zet audio om in tekst, een tweede systeem bepaalt wie er spreekt, een derde bepaalt wanneer iemand is uitgesproken. Muse Voice Transcribe doet die drie taken in hetzelfde autoregressieve model. Het verwerkt audio in blokjes van 80 milliseconden en beslist per blokje of het nog even doorluistert of alvast tekst uitschrijft. Meta noemt dat adaptive delay: het model leerde met reinforcement learning hoe lang het per woord moet wachten, waarbij nauwkeurigheid en vertraging tegen elkaar worden afgewogen.
Op de streamingmeting van Artificial Analysis van 1 september komt dat uit op 3,1 procent woordfouten bij de definitieve transcriptie, de laagste van de acht vergeleken systemen. Cartesia Ink-2 staat op 3,4 procent, ElevenLabs Scribe v2 Realtime op 3,6 procent, en Google's Gemini 3.5 Transcribe Live op 4,0 procent. Dat is hetzelfde model dat een week eerder nl-NL in de Gemini API kreeg voor ongeveer dertig dollarcent per uur audio. Meta zit dus lager in foutmarge en ruwweg veertig procent lager in prijs.

Het onderscheiden van sprekers gaat mee omhoog. In Meta's eigen vergelijking op de publieke datasets AMI-IHM, AMI-SDM en VoxConverse komt het model op 17,5 procent gemiddelde diarisatiefout, terwijl de beste offline concurrent op 21,1 procent blijft steken. Offline systemen mogen de hele opname overzien voordat ze een oordeel vellen; Muse doet het terwijl het audio binnenkomt. Het houdt twintig sprekers of meer uit elkaar en verwerkt opnames van langer dan een uur zonder nabewerking.

Reken die 17,5 procent wel eerlijk door: ongeveer een zesde van de spreektijd wordt nog altijd aan de verkeerde persoon toegeschreven. Voor een intern verslag is dat prima, voor een gespreksverslag waar een handtekening onder moet, niet.
Wat de cijfers niet zeggen over Nederlandse audio
Alle gepubliceerde scores komen van Engelstalige of grotendeels Engelstalige metingen. AMI en VoxConverse zijn Engelse vergaderkorpora, en Meta publiceert geen aparte woordfoutmarge voor Nederlands. Die 3,1 procent is dus geen belofte voor een teamoverleg met vakjargon, een slechte speakerphone en drie mensen die door elkaar praten.
Sturen kan wel. Je geeft vooraf mee welke talen je verwacht, en je levert een lijst met eigen woorden aan, product- en klantnamen bijvoorbeeld, zodat het model die vaker goed spelt. Beide zet je vast bij het openen van de sessie; wijzigen tijdens een lopende sessie kan niet. Wisselen tussen talen binnen een zin ondersteunt het model native, wat op een Nederlandse werkvloer vol Engelse vaktermen meer uitmaakt dan het klinkt.
Wat er niet in zit
De documentatie is helder over wat je niet krijgt. Geen tijdstempels per woord, alleen per spreekbeurt. Geen betrouwbaarheidsscores, geen emotieherkenning, geen herkenning van geluiden. Sprekerlabels als A en B gelden alleen binnen een sessie: dezelfde persoon krijgt in een volgende opname een ander label, en namen koppelt het model niet.
De limieten sturen je ontwerp net zo hard. Een realtime sessie loopt maximaal zestig minuten en er is geen hervattingssleutel, dus een lange vergadering knip je zelf en plak je zelf aan elkaar. Een geupload bestand mag hooguit tien minuten duren en 32 megabyte groot zijn, in mono 16-bits PCM. Per account draaien acht gelijktijdige streams en duizend gestarte streams per uur. De gewichten zijn niet vrijgegeven: het model draait via de Meta Model API, Meta AI voor Mac en Muse Code. Zelf hosten is geen optie.
Klantgesprekken en de AVG
Wie klantgesprekken laat uitschrijven, heeft aan de foutmarge niet genoeg. De vraag waar die audio blijft weegt zwaarder. Meta biedt zero data retention aan, waarbij invoer en antwoord na afhandeling niet worden bewaard, maar dat is geen standaardinstelling en niet aan te zetten in de webinterface. Het wordt per organisatie ingeschakeld na contact met sales, de ondersteuning kan per model verschillen, en in de prijslijst rekent Meta er niets extra's voor. Verwerk je persoonsgegevens in gesproken vorm, dan regel je dit vooraf, samen met een verwerkersovereenkomst en een besluit over de verwerkingslocatie.
Die 3,1 procent is niet waar de verschuiving zit. In een week tijd zetten twee grote labs een streamingmodel neer dat per uur audio wordt afgerekend in plaats van per gebruiker per maand. Transcriptie schuift daarmee op van een aparte tool die je koopt naar een functie die je in je eigen software zet, naast de opnames, de dossiers en de systemen waar de tekst toch al langs moet. Wat een leverancier van vergadernotulen dan nog verkoopt, is niet de herkenning maar alles eromheen: de werkstroom, de bewaartermijnen en het bewijs dat het klopt.
Veelgestelde vragen
Van gesprek naar bruikbaar dossier
Een transcriptiemodel levert tekst, geen werkende keten: de opname, de bewaartermijn en de koppeling naar je CRM of dossier moet iemand ontwerpen. Ik denk daarin mee als ondernemer, teken de keten uit en bouw hem af, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
