Chinese AI-ontwikkelaars publiceerden bij slechts 31 van 857 modelreleases een veiligheidsresultaat dat aan de specifieke versie is gekoppeld, blijkt uit SemiAnalysis’ telling van 8 oktober over 2021 tot en met 15 september 2026.
Bij een Chinese modelintegratie kan een inkoper dus vaak geen openbaar testrapport aan de exacte versie koppelen. Dat maakt de modelversie, testdatum, onderzochte risico’s en beperkingen relevante onderdelen van leverancierscontrole. Ontbreekt publicatie, dan ontbreekt openbaar bewijs. Dat zegt op zichzelf niet dat de leverancier intern niet heeft getest.
De teller volgt openbare rapporten
SemiAnalysis bracht 857 herkenbare modelreleases in kaart van negen Chinese ontwikkelaars: Alibaba, ByteDance, Tencent, Baidu, DeepSeek, Moonshot, Z.ai, MiniMax en StepFun. Het gaat om 741 productmodellen en 116 onderzoeksmodellen die tussen 2021 en 15 september 2026 openbaar verschenen. De onderzoekers controleerden modelkaarten, releasenotities en technische rapporten van de ontwikkelaars.
Een resultaat telde alleen mee als er een cijfermatige of inhoudelijke testuitkomst aan de genoemde modelversie was gekoppeld. De onderwerpen omvatten schadelijke uitvoer, weerstand tegen omzeiling van beveiligingen, toxische inhoud, privacy, weigeringsgedrag en gevaarlijke capaciteiten. Algemene verklaringen dat een model veiligheidstraining had gekregen of was geëvalueerd, telden niet. Een rapport over een topmodel gold evenmin automatisch voor andere formaten of momentopnamen.
Bij 31 releases vond SemiAnalysis wel zo’n resultaat, oftewel 3,6 procent. Bij tien andere releases meldden ontwikkelaars dat ze hadden geëvalueerd, maar zonder cijfers. Drie andere vermeldingen kwamen alleen uit pers- of beleggersinformatie, zonder terugvindbare documentatie van de maker. Voor de overige 813 releases vonden de onderzoekers geen openbaar veiligheidsoverzicht. Reuters merkt op dat dit interne tests niet uitsluit en dat het rapport geen vergelijkbaar percentage voor Amerikaanse aanbieders geeft.
De uitslag komt vaak na de release
Slechts negen van de 857 releases hadden een gepubliceerde testuitkomst bij of vóór de lancering. Bij zestien andere verscheen een passende uitslag pas later, met een mediane vertraging van 42 dagen en een maximum van 349 dagen. Bij zes resultaten konden de onderzoekers niet vaststellen wanneer ze verschenen of aan welke precieze versie ze hoorden. Die drie groepen samen vormen de 31 releases met een resultaat.
Voor de frontiermodellen uit 2026 tot en met de peildatum vond de census alleen bij GLM-5.3 een notitie over een capaciteitstest die bij de lancering beschikbaar was. GLM-5.2, de Kimi K2.5- en K3-reeks, DeepSeek V4, Qwen3.7-Max, Qwen3.8-Max en Doubao Seed 2.1 hadden toen geen gepubliceerde testuitkomst. Ook bij redeneermodellen was de openbare documentatie schaars: 93 procent had geen resultaat.
De dataset telt elke modelgrootte en momentopname apart, waardoor Alibaba bijvoorbeeld 238 releases heeft. Start-ups publiceerden vaker een resultaat dan de vier hyperscalers: 6,3 tegenover 2 procent. SemiAnalysis waarschuwt dat verschillen in modelbenaming die vergelijking indicatief maken, geen ranglijst.
Andere toetsen stellen andere vragen
Deze telling gaat over bewijs dat aan afzonderlijke releases hangt. In augustus beoordeelde Guidelight Anthropic, Google, Meta, OpenAI en xAI op zes bedrijfsbrede controlepraktijken, zoals monitoring, voorafgaande toestemming voor risicovolle acties en containment. Geen van die bedrijven scoorde op een praktijk hoger dan 3 op 5. De toets van Guidelight vond ook geen vastgelegd containmentplan bij de vijf onderzochte labs. Dat is verwante context, maar een andere meting: controle over gedrag binnen een lab zegt niet welke testuitslag bij een concrete modelversie is gepubliceerd.
Een derde-partijtest kan bestaan zonder dat de ontwikkelaar die zelf publiceert. SaferAI onderzocht GLM-5.2 via de publieke API, zonder medewerking van Z.ai. Het model loste 29 van 34 CyBench-cyberopgaven op en weigerde volgens het rapport geen van de geteste offensieve cyber- of biologietaken. Dat is een externe evaluatie, geen veiligheidsrapport van de maker en dus een ander soort bewijs dan de census telt. De SaferAI-test van GLM-5.2 vond geen weigering bij offensieve cyber- en biologietaken.

OpenAI publiceerde op 22 september zeven uitgangspunten voor externe evaluaties: een afgebakende claim, passende toegang en transparantie over methoden en onzekerheden. Die aanpak beschrijft hoe OpenAI externe toetsen wil inrichten; het is geen sectorbrede standaard. De zeven principes van OpenAI laten zien welke informatie een onafhankelijke toets kan bevatten.
De inkoopvraag begint bij de versie
De 3,6 procent is geen schatting van hoeveel Chinese modellen intern zijn getest en ook geen meting van welk land veiligere modellen bouwt. De census volgt negen ontwikkelaars en hun terugvindbare documentatie. Bij Amerikaanse aanbieders zijn wel veiligheidsrapporten en modelkaarten voor sommige grote releases gepubliceerd, maar het rapport bevat geen gelijke noemer.
Voor een Nederlandse inkoper is daarom een controleerbare vraag nuttiger dan een algemene belofte: “Welke testuitslag hoort bij precies het model en versienummer dat u levert, wanneer is die test uitgevoerd, welke risico’s zijn onderzocht en wat viel buiten de scope?” Vraag ook wie de test uitvoerde en of de uitkomst onafhankelijke controle kreeg. Een rapport dat de juiste versie, datum en reikwijdte noemt, maakt vergelijking mogelijk. Een algemene verklaring dat een model is getest, laat die koppeling open.
De 3,6 procent beschrijft openbaar zichtbare testuitkomsten; het is geen ranglijst van onveilige modellen. Het laat wel zien hoe vaak bewijs niet met een specifieke release meereist. Omdat aanbieders meerdere formaten en momentopnamen publiceren, moet een rapport ook bij de versie passen die werkelijk wordt ingekocht. Bij een nieuwe release begint die controle opnieuw.
Veelgestelde vragen
Van modelkeuze naar werkend systeem
Ik denk mee over de juiste aanpak, ontwerp de oplossing en realiseer en automatiseer het hele traject tot een werkend systeem. Waar het kan, bouw ik self-hosted, zodat jij grip houdt op modelkeuze en controle.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
