Z.ai bevestigt in zijn eigen aankondiging dat het anonieme model Ox Alpha van het Chinese lab komt, en zet het als GLM-5.3-Flash onder MIT-licentie op Hugging Face.
Daarmee krijgt een inkoopbeslissing die een week lang zonder tegenpartij werd genomen alsnog een naam. Wie sinds 20 augustus bedrijfscode door het gratis endpoint stuurde, weet nu wie er aan de andere kant zat: Z.AI Co., Ltd, gevestigd in China. Vanaf nu kun je een leverancierscheck doen, een verwerkersovereenkomst vragen of de gewichten gewoon zelf draaien. Wat je die week hebt verstuurd, komt daar niet mee terug.
Het lab noemt de anonieme week een testronde
In zijn aankondiging van 26 augustus schrijft Z.ai dat het GLM-5.3-Flash voor de release anoniem als ox-alpha testte op OpenCode en OpenRouter om gebruikersfeedback te verzamelen, dat het binnen een week het drukst gebruikte model werd en dat al dat verkeer op Chinese AI-chips is afgehandeld. Op de stealth-pagina van OpenRouter staat inmiddels dat het model door ZAI is ontwikkeld en beheerd, met daaronder onverkort de mededeling dat prompts en antwoorden door de aanbieder worden bewaard.
Dat is precies wat er wel en niet verandert. Het gratis model dat sinds 20 augustus op OpenRouter draaide en waarvan de anonieme aanbieder volgens de voorwaarden elke prompt bewaarde, verwerkte in die week 9,9 biljoen tokens voor 154.000 unieke gebruikers via de code-assistent OpenCode. Die inhoud ging onder de stealth-voorwaarden naar de aanbieder, met een onherroepelijke licentie erbij. De naam is nu bekend. De licentie die je toen verstrekte, blijft staan.
De licentie is kaal MIT, zonder regioclausule
Het LICENSE-bestand in de repository is de standaard MIT-tekst met "Copyright (c) 2026 Z.AI Co., Ltd" erboven. Geen aanvullende gebruiksvoorwaarden, geen omzetdrempel, geen uitgesloten regio's, en de gewichten zitten niet achter een toegangsverzoek. Downloaden, draaien, aanpassen en doorverkopen mag, zolang de copyrightregel meereist.
Dat is ruimer dan wat er deze week nog meer openging. Alibaba gaf Qwen3.8-Flash-Next vrij onder de Qwen Community License 1.0, waarbij intern gebruik gratis blijft maar een model-als-dienst boven een omzetdrempel een aparte overeenkomst met Alibaba vraagt. Bouw je een product bovenop het model, dan scheelt MIT je die juridische controle per klantcontract.
Wat Z.ai zelf meet
GLM-5.3-Flash telt 320 miljard parameters en zet er per token 18 miljard van aan, verdeeld over 45 lagen en 288 experts. Het is het eerste model in de GLM-5-reeks dat van huis uit beeld en video verwerkt, met een contextvenster van een miljoen tokens.
Op zes programmeer- en agentbenchmarks zet het lab de nieuwe versie naast zijn vorige en naast de westerse top. DeepSWE v1.1 gaat van 46,2 naar 63,4, AutomationBench v1.0.6 van 26,2 naar 48,8. Op Terminal Bench 2.1 staat 84,3 tegenover 85,0 voor Claude Opus 4.8 en 87,4 voor GPT-5.6 Terra. Op GDPval-AA v2 haalt het model met 1773 de hoogste score van de hele vergelijking, en op de intelligentie-index van Artificial Analysis noteert Z.ai 57 punten tegen 0,045 dollar per taak, een niveau dat volgens het lab eerder ongeveer tien keer zoveel kostte. De cijfers komen uit de publicatie van Z.ai zelf; alleen die twee metingen zijn door Artificial Analysis afgenomen.

TechCrunch plaatst de release in een reeks goedkope en capabele Chinese modellen die marktaandeel afsnoepen van OpenAI en Anthropic.
Prijs en beschikbaarheid
Via OpenRouter kost het model 0,075 dollar per miljoen invoertokens en 0,25 dollar per miljoen uitvoertokens, inclusief een korting van 50 procent die tot 9 september 2026 loopt; daarna verdubbelen beide tarieven. Zeven aanbieders hosten het daar, waaronder Cloudflare, DeepInfra en Baseten, dus uitval bij één partij legt een workflow niet plat. In het eigen abonnement van Z.ai zit het model met drie keer zoveel quotum als GLM-5.3.
Zelf draaien is geen werkstationklus. De gepubliceerde gewichten staan in FP8 en beslaan 62 bestanden van samen ongeveer 328 gigabyte. Z.ai noemt SGLang, vLLM, TokenSpeed en KTransformers als frameworks die het model bedienen. Voor de meeste bedrijven betekent die MIT-licentie in de praktijk dus: draaien bij een GPU-aanbieder naar keuze, binnen een rechtsgebied dat je zelf uitkiest, niet op een server in de meterkast.
Wat de open licentie wel en niet oplost
Daarmee lost de vrije licentie één van twee vragen op. Wie de gewichten zelf draait, houdt de prompts binnen de eigen omgeving en zit niet vast aan de prijslijst van het lab. Wie de API blijft gebruiken, koopt naast een model ook een rechtsgebied: open gewichten verplaatsen vendor lock-in vaker dan ze hem opheffen, omdat de afhankelijkheid van een Chinees lab en zijn jurisdictie ervoor terugkomt. En de stealth-lancering heeft nu een bewezen opbrengst: een week zonder naam leverde een testpubliek, een koppositie en een berg echte productiecode op, voordat er ook maar één licentievoorwaarde op tafel lag. Dat recept ligt vanaf vandaag klaar voor het volgende lab dat een model wil uitproberen.
Veelgestelde vragen
Open model, eigen omgeving
Een MIT-licentie zegt dat je een model zelf mag draaien, niet hoe je dat in je eigen processen krijgt. Ik denk mee over die keuze, ontwerp de opzet en bouw en automatiseer hem tot in productie, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
