Zwarte serverracks op een rij in een datacenter
Nieuws27 augustus · 02:225 min leestijd

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens

Alibaba zet de gewichten van Qwen3.8-Flash-Next open. Het model activeert 6 van 176 miljard parameters per token, kost gehost 0,16 dollar per miljoen invoertokens en komt met een strakkere licentie dan het vlaggenschip.

Alibaba geeft de gewichten van Qwen3.8-Flash-Next vrij op Hugging Face, een model dat per token 6 van 176 miljard parameters aanzet en waarvan de gehoste versie ongeveer een twaalfde kost van het eigen vlaggenschip.

Dat verschuift de rekensom onder elke functie die je per token afrekent. De productieversie Qwen3.8-Flash staat op 0,16 dollar per miljoen invoertokens en 0,47 dollar per miljoen uitvoertokens, terwijl Qwen3.8-Max op dezelfde wolk 2 en 6 dollar rekent. Een agentworkflow die per maand 100 miljoen invoertokens en 10 miljoen uitvoertokens verstookt, gaat daarmee van ongeveer 260 dollar naar ruim 20 dollar. Voor gecachete invoer zakt het tarief naar 0,016 dollar per miljoen.

Zes miljard parameters aan het werk per token

Qwen3.8-Flash-Next is een mixture-of-experts met een ingebouwde vision-encoder. De romp telt 125 miljard parameters en de aparte n-gram-embeddingtabel nog eens 51 miljard, samen de 176 miljard waarop NVIDIA het model telt; daarbovenop komt een module van 4 miljard voor multi-token-predictie. Per token doen er 6 miljard mee. Het model verwerkt standaard 262.144 tokens en met YaRN tot een miljoen.

Die zuinigheid begint al bij de training. Alibaba schrijft dat het model ongeveer een negende van de trainingskosten van Qwen3.7-Plus vroeg en toch beter presteert op programmeer- en kantoortaken. Dat oudere model telt 397 miljard parameters.

Op de meetlat van Alibaba zelf haalt Flash-Next 62,5 op SWE-bench Pro, tegen 55,8 voor Qwen3.7-Plus en 53,4 voor Claude Opus 4.6. Op CoWorkBench, dat langlopend kantoorwerk test, staat 73,9 tegen 65,1 en 68,2. Op JobBench loopt het verschil op tot 55,7 tegen 27,6. De zwakke plek staat in dezelfde tabel: op de redeneertest HLE blijft het met 35,9 onder de 40,0 van Opus. Alle cijfers komen van de leverancier; onafhankelijke metingen zijn er nog niet.

Schema van de Qwen3.8-Flash-Next-architectuur met GDN- en QSA-lagen, MoE-blokken en de n-gram-embeddinglaag (bron: Qwen, Alibaba Group)
Schema van de Qwen3.8-Flash-Next-architectuur met GDN- en QSA-lagen, MoE-blokken en de n-gram-embeddinglaag (bron: Qwen, Alibaba Group)

Zelf draaien kan, maar niet op een enkele kaart

De gewichten staan open, alleen bepaalt het formaat of dat praktisch is. De FP8-variant beslaat 172,78 GiB aan gewichtenbestanden, de BF16-versie 335,28 GiB. NVIDIA meldt dat het model ook draait op een DGX Station, op clusters van DGX Sparks en op werkstations met vier RTX PRO 6000 Blackwell Max-Q-kaarten, en dat een GB300 NVL72 er ruim 16.000 tokens per seconde per GPU uit haalt. Voor een MKB-bedrijf is dat een serverinvestering, geen kast onder het bureau.

Wie op een enkele videokaart wil blijven, houdt Qwen3.8-27B over, dat onder Apache 2.0 staat en de afgelopen dertig dagen bijna 3,3 miljoen keer werd gedownload. Die kleinere modellen dragen het gebruik: Qwen passeerde deze maand op Hugging Face de grens van 3 miljard downloads en verdrong daarmee Llama en Gemma.

De licentie is strakker dan bij het vlaggenschip

Bij de gewichten zit geen Apache 2.0 maar de Qwen Community License 1.0. Die sluit geen enkele regio uit, dus Europees gebruik loopt niet tegen een grens aan. Intern gebruik blijft gratis, zolang je het model, de uitvoer ervan of de onderliggende capaciteiten niet aan derden beschikbaar stelt.

Een van de twee voorwaarden is wel aangescherpt. Bij Qwen3.8-Max moest een bedrijf met een model-als-dienst of een AI-werkassistent pas boven 50 miljoen dollar omzet over twaalf aaneengesloten maanden een aparte overeenkomst sluiten. In de tekst bij Flash-Next is die drempel weg: wie zo'n bedrijf voert, heeft vooraf een aparte licentie van Qwen nodig voor elk commercieel gebruik, ongeacht de omvang.

De begripsomschrijvingen zijn ongewijzigd overgenomen. Een model-als-dienst is derden toegang geven tot inferentie of natrainen, en een AI-werkassistent is een zelfstandig product voor programmeren of kantoorwerk, met Alibaba's eigen Qoder en QwenWork als voorbeeld. Zit het model als functie in een pakket dat vooral iets anders doet, dan val je er nadrukkelijk buiten. Verkoop je de assistent zelf, dan begint het gesprek met Qwen nu bij de eerste euro omzet in plaats van bij de vijftigmiljoenste dollar.

Waar dit heen wijst

Alibaba brengt de architectuur bewust vroeg naar buiten. Het bedrijf noemt Flash-Next een voorproefje op Qwen4 en vergelijkt de stap met Qwen3-Next, waarvan de hybride aandachtsopzet daarna de hele lijn van Qwen3.5 tot Qwen3.8 droeg. Wie nu op dit model bouwt, kiest dus ook de architectuur waarop de volgende generatie verdergaat.

Twee bewegingen lopen in deze release naast elkaar. Het rekenwerk per token zakt naar 6 miljard parameters en de prijs met een factor twaalf, terwijl de voorwaarden waaronder je het model mag doorverkopen strakker worden. Rekenkracht wordt goedkoper, de licentie wordt de plek waar Alibaba zijn rendement ophaalt. Voor het merendeel van de Nederlandse bedrijven, die zo'n model intern inzetten, valt die rekening niet. Voor wie een programmeer- of kantoorassistent als product verkoopt, staat er nu een zin in de voorwaarden die er bij het vorige model nog niet stond.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Kies het model dat past

Een twaalfde van de tokenprijs verandert alleen iets als de rest van de keten klopt. Ik denk met je mee over de modelkeuze, ontwerp de workflow eromheen en bouw en automatiseer hem tot en met de koppeling met je eigen systemen, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

Ornith zet modelfamilie 1.5 open, van 9B tot 397B
Nieuws
6 min

20 aug 06:10

Ornith zet modelfamilie 1.5 open, van 9B tot 397B

Ornith zette de gewichten van modelfamilie 1.5 op Hugging Face, van 9 tot 397 miljard parameters onder een MIT-label. Het LICENSE-bestand waarnaar de modelkaarten verwijzen ontbreekt in alle drie de repositories.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

Alibaba zet de gewichten van Qwen3.8-Max volgende week open
Nieuws
5 min

3 aug 06:12

Alibaba zet de gewichten van Qwen3.8-Max volgende week open

Alibaba maakt Qwen3.8-Max wereldwijd beschikbaar en zet de gewichten volgende week open, samen met een kleinere 27B-versie. Het gehoste model kost 2 dollar per miljoen invoertokens, ruim onder Claude Opus 5.

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel
Nieuws
5 min

14 aug 20:11

Alibaba publiceert Qwen3.8-27B onder Apache 2.0, zonder omzetdrempel

Alibaba zet de gewichten van Qwen3.8-27B onder Apache 2.0 op Hugging Face. Het formaat dat op één videokaart past valt daarmee buiten de licentie met de omzetdrempel van 50 miljoen dollar die het vlaggenschip wel draagt.