Laptop op een tafel met programmacode in C# op het scherm
Nieuws14 augustus · 12:105 min leestijd

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter

Z.ai bracht GLM-5.3 uit via zijn API, maar de gewichten volgen pas over twee weken omdat de post-training onverwacht sterke exploitvaardigheden opleverde. Zelf hosten kan dus nog niet, meelopen via een Chinese API wel.

Z.ai brengt codeermodel GLM-5.3 vandaag uit via zijn API, maar houdt de gewichten twee weken achter tot de veiligheidsevaluatie en de hardening klaar zijn, schrijft het bedrijf in zijn releaseblog.

Voor een Nederlands team dat zijn codeermodel op eigen hardware of bij een Europese aanbieder wil draaien, is dat een gat van twee weken met maar één invulling: de API van Z.ai zelf, waar de verwerking onder Chinees recht valt. Op Hugging Face staat onder zai-org vandaag geen GLM-5.3-repository, en de gewichten van GLM-5.2 dateren daar nog van 2 juli. Wie op soevereiniteit stuurt, wacht dus tot eind augustus. Wie eerder wil beginnen, ruilt die keuze in voor snelheid.

Alle winst komt uit post-training

GLM-5.3 draait op hetzelfde basismodel als GLM-5.2. Z.ai schrijft dat het de hele sprong uit post-training haalde: meer trainingsomgevingen, meer soorten taken en meer rekenkracht op dezelfde basis. Op Terminal-Bench 3.0 gaat de score van 4,6 naar 28,3, op DeepSWE v1.1 van 46,2 naar 66,9 en op Agents' Last Exam van 23,8 naar 28,5.

Interessanter dan de losse scores is de tokenrekening eronder. Op de eigen Z.ai Code Bench haalt GLM-5.3 bij effortniveau high 31,4 procent bij ongeveer 50.000 uitvoertokens per taak, waar Claude Opus 4.8 op 29,5 procent komt bij 120.000 tokens. Claude Fable 5 blijft met 39,5 procent op max voor. Voor een team dat per token betaalt verschuift dat de kostprijs per opgeloste taak, het cijfer waarop Databricks vorige maand zijn ontwikkelaars op GLM 5.2 zette voor 1,28 dollar per taak tegen 1,94 dollar voor Opus 4.8.

Grafiek van Z.ai met de nauwkeurigheid van GLM-5.3, GLM-5.2, Claude Fable 5 en Claude Opus 4.8 op de Z.ai Code Bench, afgezet tegen het aantal uitvoertokens per taak. (Bron: Z.ai)
Grafiek van Z.ai met de nauwkeurigheid van GLM-5.3, GLM-5.2, Claude Fable 5 en Claude Opus 4.8 op de Z.ai Code Bench, afgezet tegen het aantal uitvoertokens per taak. (Bron: Z.ai)

De cybercapaciteit die harder groeide dan gepland

Z.ai voegde data en omgevingen voor het opsporen van kwetsbaarheden toe aan de trainingsmix en zag die vaardigheid sneller doorgroeien dan verwacht. Op CyberGym, waar een model een lek in broncode moet vinden en aantonen, gaat GLM-5.3 van 77,2 naar 84,5 procent, hoger dan GPT-5.6 Sol op 83,6. Op ExploitBench, dat een stap verder in de aanvalsketen zit, verdubbelt het model van 24,4 naar 54,4 procent, al blijft GPT-5.6 Sol daar met 76,5 ruim voor. Op ExploitGym rondt GLM-5.3 105 taken af binnen twee uur en 130 binnen zes uur, tegen 29 en 39 voor GLM-5.2.

Die scores bleven niet in de testopstelling. Samen met Chinese securityteams liet Z.ai het model los op echte codebases; na expertreview en ontdubbeling leverde dat 2.436 kwetsbaarheden op in 269 opensourceprojecten, waarvan 1.097 middelhoog tot kritiek. Het bedrijf houdt de meldingen bij in een openbaar register waarin nu 53 gevallen zijn vrijgegeven en 2.383 onder embargo staan. De vrijgegeven regels wijzen naar software die ook in Nederlandse serverruimtes draait: een use-after-free in de Linux-kernel, een geheugenfout in WebKit, een heap-overflow in GStreamer en een detectie-omzeiling in netwerkmonitor Suricata. De oudste fout stamt uit 1981, en gemiddeld lag een lek 26,6 jaar stil voordat het gevonden werd.

Staafdiagram van Z.ai met de scores van GLM-5.3, GLM-5.2, Kimi K3 en gesloten modellen op de cyberbenchmarks CyberGym, ExploitBench en ExploitGym. (Bron: Z.ai)
Staafdiagram van Z.ai met de scores van GLM-5.3, GLM-5.2, Kimi K3 en gesloten modellen op de cyberbenchmarks CyberGym, ExploitBench en ExploitGym. (Bron: Z.ai)

Wat er vandaag aan de API verandert

Een aanroep zonder denkmodus accepteert GLM-5.3 niet meer. Het veld thinking.type moet op enabled staan en reasoning_effort kent drie standen: low, high en max, met max als standaard. Wie nu met disabled werkt en alleen de model-id omzet, krijgt een foutmelding terug in plaats van een antwoord. Het venster blijft staan op 1 miljoen tokens context en 128.000 tokens uitvoer.

Een tokenprijs voor GLM-5.3 staat nog niet op de prijslijst, waar GLM-5.2 op 1,4 dollar per miljoen invoertokens en 4,4 dollar per miljoen uitvoertokens blijft staan. Toegang loopt vandaag via het GLM Coding Plan, dat is overgegaan op een puntensysteem waarin aanroepen buiten de piekuren de helft kosten. Die piek valt doordeweeks van 14.00 tot 18.00 uur Chinese tijd, oftewel 8.00 tot 12.00 uur Nederlandse tijd: precies de ochtend waarin een Nederlands ontwikkelteam aan het werk is.

Een releasedatum als veiligheidsmaatregel

Het uitstel is het echte nieuws, niet de benchmarkwinst. Z.ai publiceerde tot nu toe geen veiligheidskader, en het Franse SaferAI mat begin augustus dat GLM-5.2 geen enkele offensieve cyber- of biologietaak weigerde. Dezelfde maker houdt nu de gewichten van de opvolger tegen omdat de exploitvaardigheid harder groeide dan gepland, terwijl de aangekondigde hardening nog door geen enkele externe partij is getoetst.

Dat uitstel lost het onderliggende probleem ook niet op. Zodra de gewichten er staan, kan iedereen ze finetunen, en juist de rem die Z.ai er nu inbouwt is het onderdeel dat een derde partij er weer uit kan halen. Ondertussen weegt Peking al maanden of de export van modelgewichten aan banden gaat, dus ook een toegezegde datum is geen zekerheid. Wat hier zichtbaar wordt, is dat het releasemoment van een open model een veiligheidsinstrument is geworden. Voor wie zelf hosten als de veilige route beschouwde, betekent dat een nieuwe onzekerheid: niet of het model goed genoeg is, maar of en wanneer je het überhaupt in handen krijgt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Zelf hosten zonder gedoe

Twijfel je tussen een API van ver weg en een model op je eigen infrastructuur, dan denk ik met je mee over die keuze en bouw ik de oplossing er daarna ook bij, van ontwerp tot werkende koppeling. Self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld
Nieuws
4 min

18 jul 06:11

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld

Moonshot AI bracht Kimi K3 uit, met 2,8 biljoen parameters het grootste open-weight model ter wereld. De benchmarks zetten het vlak achter Claude en GPT, tegen een fractie van de prijs.

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak
Nieuws
5 min

14 aug 00:15

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak

Writer bouwde zijn nieuwe vlaggenschip Palmyra X6 op het Chinese open model GLM-5.2 en meet 52 procent lagere kosten per agenttaak. De tokenprijs ging juist omhoog, de winst zit in 38 procent minder tokens per taak.

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag
Signaal
7 min

27 jul 12:04

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag

In tien dagen greep iedereen naar dezelfde laag in de AI-keten, en dat was niet het model. Het schaarse goed blijkt de capaciteit om een model te serveren, en daar verschuift de macht nu naartoe.

Hugging Face zet Chinees GLM-5.2 in om inbraak te analyseren nadat Amerikaanse modellen weigeren
Nieuws
4 min

22 jul 22:11

Hugging Face zet Chinees GLM-5.2 in om inbraak te analyseren nadat Amerikaanse modellen weigeren

Hugging Face gebruikte het Chinese open model GLM-5.2 van Z.ai om de recente inbraak op zijn systemen te ontleden, nadat toonaangevende Amerikaanse AI-modellen de cybertaak weigerden. Een concreet voorbeeld van wat dichtgetimmerde modellen kosten voor wie zich moet verdedigen.

China evenaart Anthropic in cybersecurity: Z.ai vindt kwetsbaarheden net zo goed als Mythos
Nieuws
4 min

28 jun 14:37

China evenaart Anthropic in cybersecurity: Z.ai vindt kwetsbaarheden net zo goed als Mythos

Volgens het Wall Street Journal evenaart een nieuw Chinees model van Z.ai de Amerikaanse top in het vinden van beveiligingslekken. Dat zet vraagtekens bij het nut van de exportrem op AI.

GLM-5.2 klopt GPT-5.5 op coding, en kost een zesde
Nieuws
5 min

17 jun 02:11

GLM-5.2 klopt GPT-5.5 op coding, en kost een zesde

Het open-weight model GLM-5.2 van Z.ai verslaat GPT-5.5 op meerdere langlopende coding-benchmarks tegen ongeveer een zesde van de prijs. Wat dat betekent voor jouw AI-codeerkosten.