Smartphonescherm met de pictogrammen van chatapps als WhatsApp, Signal, Telegram en WeChat
Nieuws21 augustus · 14:265 min leestijd

Roblox geeft drie moderatiemodellen vrij die elk chatplatform zelf kan draaien

Roblox publiceert een PII-detector, een spraakclassifier en Sentinel onder Apache 2.0. Voor elk Nederlands platform met gebruikerschat liggen er nu productiemodellen die direct raken aan AVG- en DSA-verplichtingen, inclusief cijfers per taal.

Roblox geeft drie AI-moderatiemodellen vrij onder de Apache 2.0-licentie: een detector voor persoonsgegevens die in 189 talen werkt, een spraakclassifier voor 30 talen en Sentinel, dat vroege signalen van kindergevaar opspoort. De aankondiging staat sinds 19 augustus op het eigen nieuwsplatform van het bedrijf.

Voor een Nederlands platform met een chatfunctie verandert daarmee de rekensom. Een marktplaats, een community, een klantportaal: wie misbruik en weglekkende persoonsgegevens wil afvangen, kocht tot nu toe een filter bij Azure, AWS of Google, of bouwde iets met zoekwoordenlijsten. Er ligt nu een derde optie. Het gaat om modellen die op Roblox zelf in productie draaien, met gewichten die je op eigen hardware kunt zetten. Dat raakt twee verplichtingen tegelijk. De AVG houdt je aansprakelijk voor persoonsgegevens die via je eigen kanalen naar buiten komen, en artikel 28 van de digitaledienstenverordening verplicht online platforms die toegankelijk zijn voor minderjarigen tot passende maatregelen. De ACM houdt daar in Nederland toezicht op en wees platforms in juli 2025 op de Europese richtlijnen die eisen dat minderjarigen kunnen rekenen op een hoge mate van privacy, veiligheid en bescherming.

Wat er precies vrijkomt

Moderatiemodellen zijn classifiers die een bericht of een geluidsfragment beoordelen op beleidsovertredingen, zoals iemand die om een telefoonnummer vraagt of een gesprek naar een andere app probeert te trekken. Roblox publiceert er drie, plus een testset waarmee je een eigen model kunt afmeten. Dit ligt er nu:

  • PII Classifier v2, op Hugging Face. Gebouwd op XLM-RoBERTa-large. Het beoordeelt een bericht binnen de omringende chat in plaats van los. Roblox schaalde de taaldekking van 17 naar 189 talen en zag de F1-score op de eigen evaluatieset stijgen van 63,41 naar 90,52. Het model geeft drie scores terug: vragen om persoonsgegevens, delen van persoonsgegevens en wegleiden naar een ander platform, elk met een eigen aanbevolen drempelwaarde.
  • Voice safety classifier v3, op Hugging Face. Het beoordeelt audiofragmenten van maximaal vijftien seconden op acht overtredingscategorieën in 30 talen. Op Nederlands haalt het model 51,0 procent recall bij 69,0 procent precisie, gemeten op een vals-positief-percentage van 1 procent.
  • Sentinel v2, op GitHub. Een Python-bibliotheek die met contrastief leren zeldzame patronen opspoort, gericht op gesprekken die richting kindergevaar bewegen. Versie 2 tilt de ROC-AUC van 0,894 met de standaardinstellingen naar 0,996 met de beste configuratie en doorloopt 324 configuraties in minder dan drie minuten, waar dat eerder bijna een uur kostte.
  • Roblox PII Classifier Benchmark, op Hugging Face. Een evaluatieset met synthetische Engelstalige groepschats vol ontwijkingstrucs: fonetische omschrijvingen, tekenvervanging, versluierde taal en informatie die over meerdere beurten wordt uitgesmeerd.
Schermafbeelding van een Roblox-chat waarin berichten met verhulde platformnamen worden gemarkeerd en de chat tien minuten wordt geschorst. Beeld: Roblox
Schermafbeelding van een Roblox-chat waarin berichten met verhulde platformnamen worden gemarkeerd en de chat tien minuten wordt geschorst. Beeld: Roblox

Sentinel wijkt van de drie het sterkst af van een gewoon filter. Het model zoekt niet naar expliciete taal, maar naar de aanloop ernaartoe, zodat een menselijke beoordelaar de gesprekken ziet die aandacht verdienen voordat er iets strafbaars in staat. In de twaalf maanden tot 7 augustus 2026 kwam volgens Roblox bijna 70 procent van de gedetecteerde gevallen uit die vroege detectie.

De licentie is het deel dat je moet nakijken

Alle vier de artefacten staan onder Apache 2.0, zonder toegangspoort en zonder aanvullende gebruiksvoorwaarden. Dat is een groter verschil dan het lijkt. Bij open-weight modellen zit het venijn doorgaans in het LICENSE-bestand: Qwen3.8-Max eist een aparte licentie voordat een model-als-dienst met meer dan vijftig miljoen dollar omzet over twaalf maanden het model commercieel gebruikt. Apache 2.0 kent zulke bepalingen niet. Je mag deze modellen commercieel draaien, aanpassen en meeleveren in je eigen product, en die toestemming kan later niet worden ingetrokken voor de versie die je hebt gedownload.

Wat de cijfers niet zeggen

De 61 procent recall die Roblox voor de spraakclassifier over alle talen noemt, is een gemiddelde. Nederlands zit daar met 51,0 procent onder, Engels zit er met 67,9 procent boven en Pools springt eruit met 75,2 procent. Zo'n tabel per taal is precies wat de grote leveranciers niet publiceren: bij Azure AI Content Safety werkt de hallucinatiecheck alleen met Engels en staat Nederlands als ondersteund in plaats van speciaal getraind. Roblox zet de zwakke plekken van zijn eigen model gewoon in de modelkaart. Dat maakt het model niet beter, het maakt de aankoopbeslissing wel controleerbaar.

Voor de PII-detector ontbreekt zo'n uitsplitsing. De sprong naar 189 talen leunt op synthetische trainingsdata, en de gepubliceerde benchmark bevat alleen Engelstalige chats. Een Nederlandse toepassing meet je dus zelf, op je eigen verkeer.

Ook de nieuwswaarde verdient een nuchtere blik. De spraakclassifier staat al sinds 19 mei 2026 op Hugging Face en de Sentinel-code voor versie 2 landde op 6 augustus op GitHub. Wat op 19 augustus veranderde, is dat Roblox de set als geheel aanbiedt aan de ROOST Model Community, met de benchmark erbij. En de adoptie is nog minimaal: de drie repositories staan op enkele tientallen downloads.

Dat laatste tekent de werkelijke drempel. Deze modellen zijn geen dienst met een factuur en een servicetoezegging, maar gewichten en een Python-bibliotheek. Ze zijn er voor de partij die zijn moderatie zelf draait en zelf wil kunnen uitleggen waarom een bericht is tegengehouden. Wie een kant-en-klare knop zoekt, heeft er weinig aan.

ROOST is een zelfstandige stichting die open-source infrastructuur voor online veiligheid onderhoudt en die Roblox in 2025 mede oprichtte met Google, OpenAI en Discord. Daarmee verschuift er iets in hoe veiligheidstechniek verspreid raakt. Tot nu toe was moderatie een inkoopvraag met een prijs per duizend berichten en een talenlijst die je moest geloven. Er komt een laag onder die markt te liggen waarin de basiscomponenten gratis en controleerbaar zijn, en de concurrentie verschuift naar wat je erbovenop bouwt: drempelwaarden die bij jouw publiek passen, een beoordelingsproces dat een toezichthouder kan volgen, en meetwerk in je eigen taal. Voor een toezichthouder die vraagt welke passende maatregelen je nam, is dat een aanmerkelijk beter antwoord dan een productnaam.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Moderatie in je eigen keten

Gratis gewichten zijn het begin, de winst zit in het inpassen: drempelwaarden op jouw publiek, een beoordelingsstroom die een toezichthouder kan volgen en meetwerk in het Nederlands. Ik denk mee over de opzet, ontwerp de aanpak en bouw en automatiseer het geheel, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nieuw-Zeeland dient wet in die sociale media verbiedt onder de 16
Nieuws
5 min

24 aug 14:11

Nieuw-Zeeland dient wet in die sociale media verbiedt onder de 16

Nieuw-Zeeland dient een wet in die sociale media verbiedt onder de zestien, met boetes tot tien procent van de wereldwijde omzet. De wet schrijft voor welke leeftijdscontrole telt, en een opgegeven geboortedatum hoort daar niet bij.

Google’s Gemma-modellen passeren een miljard downloads
Nieuws
5 min

21 aug 06:20

Google’s Gemma-modellen passeren een miljard downloads

Google telt een miljard downloads voor zijn open Gemma-modellen en ruim honderdduizend afgeleide varianten. Belangrijker dan het cijfer is de licentie: Gemma 4 staat onder een kale Apache 2.0-tekst.

Het veiligheidsfilter dat je koopt is niet op Nederlands getest, en dat staat in de handleiding
Inzicht
8 min

17 aug 17:00

Het veiligheidsfilter dat je koopt is niet op Nederlands getest, en dat staat in de handleiding

Een contentfilter kopen zegt niets zolang je niet weet in welke talen het is getraind en getest. Bij Azure, AWS en Google staat Nederlands in de tweede rang, en de smalste functie is juist de belangrijkste.

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code
Nieuws
4 min

7 aug 12:24

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code

Amazon, Cursor, Microsoft, OpenAI en Vercel publiceerden een open pakketformaat voor Agent Skills en MCP-servers. Google sluit aan als core maintainer. Je bouwt een agentuitbreiding voortaan een keer, niet per client.