Roblox geeft drie AI-moderatiemodellen vrij onder de Apache 2.0-licentie: een detector voor persoonsgegevens die in 189 talen werkt, een spraakclassifier voor 30 talen en Sentinel, dat vroege signalen van kindergevaar opspoort. De aankondiging staat sinds 19 augustus op het eigen nieuwsplatform van het bedrijf.
Voor een Nederlands platform met een chatfunctie verandert daarmee de rekensom. Een marktplaats, een community, een klantportaal: wie misbruik en weglekkende persoonsgegevens wil afvangen, kocht tot nu toe een filter bij Azure, AWS of Google, of bouwde iets met zoekwoordenlijsten. Er ligt nu een derde optie. Het gaat om modellen die op Roblox zelf in productie draaien, met gewichten die je op eigen hardware kunt zetten. Dat raakt twee verplichtingen tegelijk. De AVG houdt je aansprakelijk voor persoonsgegevens die via je eigen kanalen naar buiten komen, en artikel 28 van de digitaledienstenverordening verplicht online platforms die toegankelijk zijn voor minderjarigen tot passende maatregelen. De ACM houdt daar in Nederland toezicht op en wees platforms in juli 2025 op de Europese richtlijnen die eisen dat minderjarigen kunnen rekenen op een hoge mate van privacy, veiligheid en bescherming.
Wat er precies vrijkomt
Moderatiemodellen zijn classifiers die een bericht of een geluidsfragment beoordelen op beleidsovertredingen, zoals iemand die om een telefoonnummer vraagt of een gesprek naar een andere app probeert te trekken. Roblox publiceert er drie, plus een testset waarmee je een eigen model kunt afmeten. Dit ligt er nu:
- PII Classifier v2, op Hugging Face. Gebouwd op XLM-RoBERTa-large. Het beoordeelt een bericht binnen de omringende chat in plaats van los. Roblox schaalde de taaldekking van 17 naar 189 talen en zag de F1-score op de eigen evaluatieset stijgen van 63,41 naar 90,52. Het model geeft drie scores terug: vragen om persoonsgegevens, delen van persoonsgegevens en wegleiden naar een ander platform, elk met een eigen aanbevolen drempelwaarde.
- Voice safety classifier v3, op Hugging Face. Het beoordeelt audiofragmenten van maximaal vijftien seconden op acht overtredingscategorieën in 30 talen. Op Nederlands haalt het model 51,0 procent recall bij 69,0 procent precisie, gemeten op een vals-positief-percentage van 1 procent.
- Sentinel v2, op GitHub. Een Python-bibliotheek die met contrastief leren zeldzame patronen opspoort, gericht op gesprekken die richting kindergevaar bewegen. Versie 2 tilt de ROC-AUC van 0,894 met de standaardinstellingen naar 0,996 met de beste configuratie en doorloopt 324 configuraties in minder dan drie minuten, waar dat eerder bijna een uur kostte.
- Roblox PII Classifier Benchmark, op Hugging Face. Een evaluatieset met synthetische Engelstalige groepschats vol ontwijkingstrucs: fonetische omschrijvingen, tekenvervanging, versluierde taal en informatie die over meerdere beurten wordt uitgesmeerd.

Sentinel wijkt van de drie het sterkst af van een gewoon filter. Het model zoekt niet naar expliciete taal, maar naar de aanloop ernaartoe, zodat een menselijke beoordelaar de gesprekken ziet die aandacht verdienen voordat er iets strafbaars in staat. In de twaalf maanden tot 7 augustus 2026 kwam volgens Roblox bijna 70 procent van de gedetecteerde gevallen uit die vroege detectie.
De licentie is het deel dat je moet nakijken
Alle vier de artefacten staan onder Apache 2.0, zonder toegangspoort en zonder aanvullende gebruiksvoorwaarden. Dat is een groter verschil dan het lijkt. Bij open-weight modellen zit het venijn doorgaans in het LICENSE-bestand: Qwen3.8-Max eist een aparte licentie voordat een model-als-dienst met meer dan vijftig miljoen dollar omzet over twaalf maanden het model commercieel gebruikt. Apache 2.0 kent zulke bepalingen niet. Je mag deze modellen commercieel draaien, aanpassen en meeleveren in je eigen product, en die toestemming kan later niet worden ingetrokken voor de versie die je hebt gedownload.
Wat de cijfers niet zeggen
De 61 procent recall die Roblox voor de spraakclassifier over alle talen noemt, is een gemiddelde. Nederlands zit daar met 51,0 procent onder, Engels zit er met 67,9 procent boven en Pools springt eruit met 75,2 procent. Zo'n tabel per taal is precies wat de grote leveranciers niet publiceren: bij Azure AI Content Safety werkt de hallucinatiecheck alleen met Engels en staat Nederlands als ondersteund in plaats van speciaal getraind. Roblox zet de zwakke plekken van zijn eigen model gewoon in de modelkaart. Dat maakt het model niet beter, het maakt de aankoopbeslissing wel controleerbaar.
Voor de PII-detector ontbreekt zo'n uitsplitsing. De sprong naar 189 talen leunt op synthetische trainingsdata, en de gepubliceerde benchmark bevat alleen Engelstalige chats. Een Nederlandse toepassing meet je dus zelf, op je eigen verkeer.
Ook de nieuwswaarde verdient een nuchtere blik. De spraakclassifier staat al sinds 19 mei 2026 op Hugging Face en de Sentinel-code voor versie 2 landde op 6 augustus op GitHub. Wat op 19 augustus veranderde, is dat Roblox de set als geheel aanbiedt aan de ROOST Model Community, met de benchmark erbij. En de adoptie is nog minimaal: de drie repositories staan op enkele tientallen downloads.
Dat laatste tekent de werkelijke drempel. Deze modellen zijn geen dienst met een factuur en een servicetoezegging, maar gewichten en een Python-bibliotheek. Ze zijn er voor de partij die zijn moderatie zelf draait en zelf wil kunnen uitleggen waarom een bericht is tegengehouden. Wie een kant-en-klare knop zoekt, heeft er weinig aan.
ROOST is een zelfstandige stichting die open-source infrastructuur voor online veiligheid onderhoudt en die Roblox in 2025 mede oprichtte met Google, OpenAI en Discord. Daarmee verschuift er iets in hoe veiligheidstechniek verspreid raakt. Tot nu toe was moderatie een inkoopvraag met een prijs per duizend berichten en een talenlijst die je moest geloven. Er komt een laag onder die markt te liggen waarin de basiscomponenten gratis en controleerbaar zijn, en de concurrentie verschuift naar wat je erbovenop bouwt: drempelwaarden die bij jouw publiek passen, een beoordelingsproces dat een toezichthouder kan volgen, en meetwerk in je eigen taal. Voor een toezichthouder die vraagt welke passende maatregelen je nam, is dat een aanmerkelijk beter antwoord dan een productnaam.
Veelgestelde vragen
Moderatie in je eigen keten
Gratis gewichten zijn het begin, de winst zit in het inpassen: drempelwaarden op jouw publiek, een beoordelingsstroom die een toezichthouder kan volgen en meetwerk in het Nederlands. Ik denk mee over de opzet, ontwerp de aanpak en bouw en automatiseer het geheel, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
