Een zwarte Gigabyte-videokaart met drie ventilatoren, staand op een wit bureau
Nieuws27 augustus · 04:194 min leestijd

Z.ai blijkt maker van Ox Alpha en zet het model onder MIT-licentie open

Het gratis mysteriemodel Ox Alpha blijkt van het Chinese Z.ai en staat nu als GLM-5.3-Flash onder MIT-licentie op Hugging Face. Zelf draaien mag, maar de prompts van de anonieme week zijn al verstuurd.

Z.ai bevestigt in zijn eigen aankondiging dat het anonieme model Ox Alpha van het Chinese lab komt, en zet het als GLM-5.3-Flash onder MIT-licentie op Hugging Face.

Daarmee krijgt een inkoopbeslissing die een week lang zonder tegenpartij werd genomen alsnog een naam. Wie sinds 20 augustus bedrijfscode door het gratis endpoint stuurde, weet nu wie er aan de andere kant zat: Z.AI Co., Ltd, gevestigd in China. Vanaf nu kun je een leverancierscheck doen, een verwerkersovereenkomst vragen of de gewichten gewoon zelf draaien. Wat je die week hebt verstuurd, komt daar niet mee terug.

Het lab noemt de anonieme week een testronde

In zijn aankondiging van 26 augustus schrijft Z.ai dat het GLM-5.3-Flash voor de release anoniem als ox-alpha testte op OpenCode en OpenRouter om gebruikersfeedback te verzamelen, dat het binnen een week het drukst gebruikte model werd en dat al dat verkeer op Chinese AI-chips is afgehandeld. Op de stealth-pagina van OpenRouter staat inmiddels dat het model door ZAI is ontwikkeld en beheerd, met daaronder onverkort de mededeling dat prompts en antwoorden door de aanbieder worden bewaard.

Dat is precies wat er wel en niet verandert. Het gratis model dat sinds 20 augustus op OpenRouter draaide en waarvan de anonieme aanbieder volgens de voorwaarden elke prompt bewaarde, verwerkte in die week 9,9 biljoen tokens voor 154.000 unieke gebruikers via de code-assistent OpenCode. Die inhoud ging onder de stealth-voorwaarden naar de aanbieder, met een onherroepelijke licentie erbij. De naam is nu bekend. De licentie die je toen verstrekte, blijft staan.

De licentie is kaal MIT, zonder regioclausule

Het LICENSE-bestand in de repository is de standaard MIT-tekst met "Copyright (c) 2026 Z.AI Co., Ltd" erboven. Geen aanvullende gebruiksvoorwaarden, geen omzetdrempel, geen uitgesloten regio's, en de gewichten zitten niet achter een toegangsverzoek. Downloaden, draaien, aanpassen en doorverkopen mag, zolang de copyrightregel meereist.

Dat is ruimer dan wat er deze week nog meer openging. Alibaba gaf Qwen3.8-Flash-Next vrij onder de Qwen Community License 1.0, waarbij intern gebruik gratis blijft maar een model-als-dienst boven een omzetdrempel een aparte overeenkomst met Alibaba vraagt. Bouw je een product bovenop het model, dan scheelt MIT je die juridische controle per klantcontract.

Wat Z.ai zelf meet

GLM-5.3-Flash telt 320 miljard parameters en zet er per token 18 miljard van aan, verdeeld over 45 lagen en 288 experts. Het is het eerste model in de GLM-5-reeks dat van huis uit beeld en video verwerkt, met een contextvenster van een miljoen tokens.

Op zes programmeer- en agentbenchmarks zet het lab de nieuwe versie naast zijn vorige en naast de westerse top. DeepSWE v1.1 gaat van 46,2 naar 63,4, AutomationBench v1.0.6 van 26,2 naar 48,8. Op Terminal Bench 2.1 staat 84,3 tegenover 85,0 voor Claude Opus 4.8 en 87,4 voor GPT-5.6 Terra. Op GDPval-AA v2 haalt het model met 1773 de hoogste score van de hele vergelijking, en op de intelligentie-index van Artificial Analysis noteert Z.ai 57 punten tegen 0,045 dollar per taak, een niveau dat volgens het lab eerder ongeveer tien keer zoveel kostte. De cijfers komen uit de publicatie van Z.ai zelf; alleen die twee metingen zijn door Artificial Analysis afgenomen.

Staafdiagram van Z.ai met de scores van GLM-5.3-Flash tegenover GLM-5.2, DeepSeek-V4-Vision-Exp, Claude Opus 4.8, GPT-5.6 Terra en Gemini 3.7 Flash op zes benchmarks (bron: Z.ai)
Staafdiagram van Z.ai met de scores van GLM-5.3-Flash tegenover GLM-5.2, DeepSeek-V4-Vision-Exp, Claude Opus 4.8, GPT-5.6 Terra en Gemini 3.7 Flash op zes benchmarks (bron: Z.ai)

TechCrunch plaatst de release in een reeks goedkope en capabele Chinese modellen die marktaandeel afsnoepen van OpenAI en Anthropic.

Prijs en beschikbaarheid

Via OpenRouter kost het model 0,075 dollar per miljoen invoertokens en 0,25 dollar per miljoen uitvoertokens, inclusief een korting van 50 procent die tot 9 september 2026 loopt; daarna verdubbelen beide tarieven. Zeven aanbieders hosten het daar, waaronder Cloudflare, DeepInfra en Baseten, dus uitval bij één partij legt een workflow niet plat. In het eigen abonnement van Z.ai zit het model met drie keer zoveel quotum als GLM-5.3.

Zelf draaien is geen werkstationklus. De gepubliceerde gewichten staan in FP8 en beslaan 62 bestanden van samen ongeveer 328 gigabyte. Z.ai noemt SGLang, vLLM, TokenSpeed en KTransformers als frameworks die het model bedienen. Voor de meeste bedrijven betekent die MIT-licentie in de praktijk dus: draaien bij een GPU-aanbieder naar keuze, binnen een rechtsgebied dat je zelf uitkiest, niet op een server in de meterkast.

Wat de open licentie wel en niet oplost

Daarmee lost de vrije licentie één van twee vragen op. Wie de gewichten zelf draait, houdt de prompts binnen de eigen omgeving en zit niet vast aan de prijslijst van het lab. Wie de API blijft gebruiken, koopt naast een model ook een rechtsgebied: open gewichten verplaatsen vendor lock-in vaker dan ze hem opheffen, omdat de afhankelijkheid van een Chinees lab en zijn jurisdictie ervoor terugkomt. En de stealth-lancering heeft nu een bewezen opbrengst: een week zonder naam leverde een testpubliek, een koppositie en een berg echte productiecode op, voordat er ook maar één licentievoorwaarde op tafel lag. Dat recept ligt vanaf vandaag klaar voor het volgende lab dat een model wil uitproberen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Open model, eigen omgeving

Een MIT-licentie zegt dat je een model zelf mag draaien, niet hoe je dat in je eigen processen krijgt. Ik denk mee over die keuze, ontwerp de opzet en bouw en automatiseer hem tot in productie, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Google’s Gemma-modellen passeren een miljard downloads
Nieuws
5 min

21 aug 06:20

Google’s Gemma-modellen passeren een miljard downloads

Google telt een miljard downloads voor zijn open Gemma-modellen en ruim honderdduizend afgeleide varianten. Belangrijker dan het cijfer is de licentie: Gemma 4 staat onder een kale Apache 2.0-tekst.

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens
Nieuws
5 min

27 aug 02:22

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens

Alibaba zet de gewichten van Qwen3.8-Flash-Next open. Het model activeert 6 van 176 miljard parameters per token, kost gehost 0,16 dollar per miljoen invoertokens en komt met een strakkere licentie dan het vlaggenschip.

Thomson Reuters bouwt eigen AI-model op open Chinese gewichten
Nieuws
6 min

24 aug 16:12

Thomson Reuters bouwt eigen AI-model op open Chinese gewichten

Thomson Reuters trainde voor 40 miljoen dollar een eigen AI-model op open Qwen-gewichten en de eigen juridische archieven. De benchmarks laten precies zien waar eigen data wel en niet loont.

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway
Nieuws
5 min

24 aug 02:11

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.

Gratis AI-model Ox Alpha komt van anonieme aanbieder die prompts bewaart
Nieuws
4 min

23 aug 00:07

Gratis AI-model Ox Alpha komt van anonieme aanbieder die prompts bewaart

Ox Alpha staat sinds 20 augustus gratis op OpenRouter en verslaat in losse tests duurdere modellen. De aanbieder blijft anoniem en bewaart volgens de voorwaarden elke prompt die je erin stopt.

Drie runs met een goedkoop AI-model vinden meer lekken dan één dure run
Nieuws
5 min

21 aug 12:22

Drie runs met een goedkoop AI-model vinden meer lekken dan één dure run

Aikido verbrandde 11,7 miljard tokens om tien AI-modellen op 32 verse CVE's te testen. Drie runs DeepSeek V4 Pro kosten 295 dollar en vinden er 28, meer dan een enkele pass van Opus 5 of Grok 4.6.