Z.ai brengt codeermodel GLM-5.3 vandaag uit via zijn API, maar houdt de gewichten twee weken achter tot de veiligheidsevaluatie en de hardening klaar zijn, schrijft het bedrijf in zijn releaseblog.
Voor een Nederlands team dat zijn codeermodel op eigen hardware of bij een Europese aanbieder wil draaien, is dat een gat van twee weken met maar één invulling: de API van Z.ai zelf, waar de verwerking onder Chinees recht valt. Op Hugging Face staat onder zai-org vandaag geen GLM-5.3-repository, en de gewichten van GLM-5.2 dateren daar nog van 2 juli. Wie op soevereiniteit stuurt, wacht dus tot eind augustus. Wie eerder wil beginnen, ruilt die keuze in voor snelheid.
Alle winst komt uit post-training
GLM-5.3 draait op hetzelfde basismodel als GLM-5.2. Z.ai schrijft dat het de hele sprong uit post-training haalde: meer trainingsomgevingen, meer soorten taken en meer rekenkracht op dezelfde basis. Op Terminal-Bench 3.0 gaat de score van 4,6 naar 28,3, op DeepSWE v1.1 van 46,2 naar 66,9 en op Agents' Last Exam van 23,8 naar 28,5.
Interessanter dan de losse scores is de tokenrekening eronder. Op de eigen Z.ai Code Bench haalt GLM-5.3 bij effortniveau high 31,4 procent bij ongeveer 50.000 uitvoertokens per taak, waar Claude Opus 4.8 op 29,5 procent komt bij 120.000 tokens. Claude Fable 5 blijft met 39,5 procent op max voor. Voor een team dat per token betaalt verschuift dat de kostprijs per opgeloste taak, het cijfer waarop Databricks vorige maand zijn ontwikkelaars op GLM 5.2 zette voor 1,28 dollar per taak tegen 1,94 dollar voor Opus 4.8.

De cybercapaciteit die harder groeide dan gepland
Z.ai voegde data en omgevingen voor het opsporen van kwetsbaarheden toe aan de trainingsmix en zag die vaardigheid sneller doorgroeien dan verwacht. Op CyberGym, waar een model een lek in broncode moet vinden en aantonen, gaat GLM-5.3 van 77,2 naar 84,5 procent, hoger dan GPT-5.6 Sol op 83,6. Op ExploitBench, dat een stap verder in de aanvalsketen zit, verdubbelt het model van 24,4 naar 54,4 procent, al blijft GPT-5.6 Sol daar met 76,5 ruim voor. Op ExploitGym rondt GLM-5.3 105 taken af binnen twee uur en 130 binnen zes uur, tegen 29 en 39 voor GLM-5.2.
Die scores bleven niet in de testopstelling. Samen met Chinese securityteams liet Z.ai het model los op echte codebases; na expertreview en ontdubbeling leverde dat 2.436 kwetsbaarheden op in 269 opensourceprojecten, waarvan 1.097 middelhoog tot kritiek. Het bedrijf houdt de meldingen bij in een openbaar register waarin nu 53 gevallen zijn vrijgegeven en 2.383 onder embargo staan. De vrijgegeven regels wijzen naar software die ook in Nederlandse serverruimtes draait: een use-after-free in de Linux-kernel, een geheugenfout in WebKit, een heap-overflow in GStreamer en een detectie-omzeiling in netwerkmonitor Suricata. De oudste fout stamt uit 1981, en gemiddeld lag een lek 26,6 jaar stil voordat het gevonden werd.

Wat er vandaag aan de API verandert
Een aanroep zonder denkmodus accepteert GLM-5.3 niet meer. Het veld thinking.type moet op enabled staan en reasoning_effort kent drie standen: low, high en max, met max als standaard. Wie nu met disabled werkt en alleen de model-id omzet, krijgt een foutmelding terug in plaats van een antwoord. Het venster blijft staan op 1 miljoen tokens context en 128.000 tokens uitvoer.
Een tokenprijs voor GLM-5.3 staat nog niet op de prijslijst, waar GLM-5.2 op 1,4 dollar per miljoen invoertokens en 4,4 dollar per miljoen uitvoertokens blijft staan. Toegang loopt vandaag via het GLM Coding Plan, dat is overgegaan op een puntensysteem waarin aanroepen buiten de piekuren de helft kosten. Die piek valt doordeweeks van 14.00 tot 18.00 uur Chinese tijd, oftewel 8.00 tot 12.00 uur Nederlandse tijd: precies de ochtend waarin een Nederlands ontwikkelteam aan het werk is.
Een releasedatum als veiligheidsmaatregel
Het uitstel is het echte nieuws, niet de benchmarkwinst. Z.ai publiceerde tot nu toe geen veiligheidskader, en het Franse SaferAI mat begin augustus dat GLM-5.2 geen enkele offensieve cyber- of biologietaak weigerde. Dezelfde maker houdt nu de gewichten van de opvolger tegen omdat de exploitvaardigheid harder groeide dan gepland, terwijl de aangekondigde hardening nog door geen enkele externe partij is getoetst.
Dat uitstel lost het onderliggende probleem ook niet op. Zodra de gewichten er staan, kan iedereen ze finetunen, en juist de rem die Z.ai er nu inbouwt is het onderdeel dat een derde partij er weer uit kan halen. Ondertussen weegt Peking al maanden of de export van modelgewichten aan banden gaat, dus ook een toegezegde datum is geen zekerheid. Wat hier zichtbaar wordt, is dat het releasemoment van een open model een veiligheidsinstrument is geworden. Voor wie zelf hosten als de veilige route beschouwde, betekent dat een nieuwe onzekerheid: niet of het model goed genoeg is, maar of en wanneer je het überhaupt in handen krijgt.
Veelgestelde vragen
Zelf hosten zonder gedoe
Twijfel je tussen een API van ver weg en een model op je eigen infrastructuur, dan denk ik met je mee over die keuze en bouw ik de oplossing er daarna ook bij, van ontwerp tot werkende koppeling. Self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
