Alibaba geeft de gewichten van Qwen3.8-Flash-Next vrij op Hugging Face, een model dat per token 6 van 176 miljard parameters aanzet en waarvan de gehoste versie ongeveer een twaalfde kost van het eigen vlaggenschip.
Dat verschuift de rekensom onder elke functie die je per token afrekent. De productieversie Qwen3.8-Flash staat op 0,16 dollar per miljoen invoertokens en 0,47 dollar per miljoen uitvoertokens, terwijl Qwen3.8-Max op dezelfde wolk 2 en 6 dollar rekent. Een agentworkflow die per maand 100 miljoen invoertokens en 10 miljoen uitvoertokens verstookt, gaat daarmee van ongeveer 260 dollar naar ruim 20 dollar. Voor gecachete invoer zakt het tarief naar 0,016 dollar per miljoen.
Zes miljard parameters aan het werk per token
Qwen3.8-Flash-Next is een mixture-of-experts met een ingebouwde vision-encoder. De romp telt 125 miljard parameters en de aparte n-gram-embeddingtabel nog eens 51 miljard, samen de 176 miljard waarop NVIDIA het model telt; daarbovenop komt een module van 4 miljard voor multi-token-predictie. Per token doen er 6 miljard mee. Het model verwerkt standaard 262.144 tokens en met YaRN tot een miljoen.
Die zuinigheid begint al bij de training. Alibaba schrijft dat het model ongeveer een negende van de trainingskosten van Qwen3.7-Plus vroeg en toch beter presteert op programmeer- en kantoortaken. Dat oudere model telt 397 miljard parameters.
Op de meetlat van Alibaba zelf haalt Flash-Next 62,5 op SWE-bench Pro, tegen 55,8 voor Qwen3.7-Plus en 53,4 voor Claude Opus 4.6. Op CoWorkBench, dat langlopend kantoorwerk test, staat 73,9 tegen 65,1 en 68,2. Op JobBench loopt het verschil op tot 55,7 tegen 27,6. De zwakke plek staat in dezelfde tabel: op de redeneertest HLE blijft het met 35,9 onder de 40,0 van Opus. Alle cijfers komen van de leverancier; onafhankelijke metingen zijn er nog niet.

Zelf draaien kan, maar niet op een enkele kaart
De gewichten staan open, alleen bepaalt het formaat of dat praktisch is. De FP8-variant beslaat 172,78 GiB aan gewichtenbestanden, de BF16-versie 335,28 GiB. NVIDIA meldt dat het model ook draait op een DGX Station, op clusters van DGX Sparks en op werkstations met vier RTX PRO 6000 Blackwell Max-Q-kaarten, en dat een GB300 NVL72 er ruim 16.000 tokens per seconde per GPU uit haalt. Voor een MKB-bedrijf is dat een serverinvestering, geen kast onder het bureau.
Wie op een enkele videokaart wil blijven, houdt Qwen3.8-27B over, dat onder Apache 2.0 staat en de afgelopen dertig dagen bijna 3,3 miljoen keer werd gedownload. Die kleinere modellen dragen het gebruik: Qwen passeerde deze maand op Hugging Face de grens van 3 miljard downloads en verdrong daarmee Llama en Gemma.
De licentie is strakker dan bij het vlaggenschip
Bij de gewichten zit geen Apache 2.0 maar de Qwen Community License 1.0. Die sluit geen enkele regio uit, dus Europees gebruik loopt niet tegen een grens aan. Intern gebruik blijft gratis, zolang je het model, de uitvoer ervan of de onderliggende capaciteiten niet aan derden beschikbaar stelt.
Een van de twee voorwaarden is wel aangescherpt. Bij Qwen3.8-Max moest een bedrijf met een model-als-dienst of een AI-werkassistent pas boven 50 miljoen dollar omzet over twaalf aaneengesloten maanden een aparte overeenkomst sluiten. In de tekst bij Flash-Next is die drempel weg: wie zo'n bedrijf voert, heeft vooraf een aparte licentie van Qwen nodig voor elk commercieel gebruik, ongeacht de omvang.
De begripsomschrijvingen zijn ongewijzigd overgenomen. Een model-als-dienst is derden toegang geven tot inferentie of natrainen, en een AI-werkassistent is een zelfstandig product voor programmeren of kantoorwerk, met Alibaba's eigen Qoder en QwenWork als voorbeeld. Zit het model als functie in een pakket dat vooral iets anders doet, dan val je er nadrukkelijk buiten. Verkoop je de assistent zelf, dan begint het gesprek met Qwen nu bij de eerste euro omzet in plaats van bij de vijftigmiljoenste dollar.
Waar dit heen wijst
Alibaba brengt de architectuur bewust vroeg naar buiten. Het bedrijf noemt Flash-Next een voorproefje op Qwen4 en vergelijkt de stap met Qwen3-Next, waarvan de hybride aandachtsopzet daarna de hele lijn van Qwen3.5 tot Qwen3.8 droeg. Wie nu op dit model bouwt, kiest dus ook de architectuur waarop de volgende generatie verdergaat.
Twee bewegingen lopen in deze release naast elkaar. Het rekenwerk per token zakt naar 6 miljard parameters en de prijs met een factor twaalf, terwijl de voorwaarden waaronder je het model mag doorverkopen strakker worden. Rekenkracht wordt goedkoper, de licentie wordt de plek waar Alibaba zijn rendement ophaalt. Voor het merendeel van de Nederlandse bedrijven, die zo'n model intern inzetten, valt die rekening niet. Voor wie een programmeer- of kantoorassistent als product verkoopt, staat er nu een zin in de voorwaarden die er bij het vorige model nog niet stond.
Veelgestelde vragen
Kies het model dat past
Een twaalfde van de tokenprijs verandert alleen iets als de rest van de keten klopt. Ik denk met je mee over de modelkeuze, ontwerp de workflow eromheen en bouw en automatiseer hem tot en met de koppeling met je eigen systemen, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
