Een GeForce RTX videokaart met gele stroomkabels in een open computerkast naast een beeldscherm.
Nieuws28 augustus · 06:234 min leestijd

Nvidia versnelt Chinese open modellen en noemt een verbod erop een omzetrisico

Nvidia versnelt Qwen3.8-27B op zijn eigen RTX-kaarten en noemt in het kwartaalrapport van 26 augustus een verbod op DeepSeek, Qwen of Kimi een risico voor zijn resultaten. Die risicoparagraaf staat er al sinds februari.

Nvidia versnelt Chinese open modellen op zijn eigen kaarten en noemt in het kwartaalrapport dat het woensdag bij de Amerikaanse beurstoezichthouder indiende een verbod op DeepSeek, Qwen of Kimi een risico voor zijn resultaten.

Voor een Nederlands team dat zo'n model op eigen hardware draait, verandert vooral de rekensom onder de motorkap. Qwen3.8-27B haalt op een enkele GeForce RTX 5090 131 tokens per seconde met multi-token prediction, tegen 77 zonder. Dat is genoeg voor een codeeragent die de hele dag meeloopt, op een kaart die je zelf in de kast hebt staan, met je broncode binnenshuis. De andere kant van dezelfde week: de fabrikant van die kaart houdt er zelf rekening mee dat Washington precies die modellen kan afsluiten.

Wat er in de indiening staat

Het rapport beslaat het kwartaal tot en met 26 juli en werd op 26 augustus ingediend. In de risicoparagraaf schrijft Nvidia dat elke regel of beperking die het hindert om producten en diensten te leveren voor toepassingen bovenop basismodellen van Chinese oorsprong, "zoals DeepSeek, Qwen of Kimi", een materieel effect kan hebben op de bedrijfsvoering en de resultaten. De drie namen staan er letterlijk.

Nieuw is die passage niet, en dat is het belangrijkste voorbehoud bij de berichtgeving erover. Dezelfde zin met dezelfde drie modelnamen stond al in het jaarverslag over het boekjaar tot 25 januari, ingediend op 25 februari, en in het kwartaalrapport van 20 mei. Het enige verschil in de nieuwe versie is de spelling: waar Nvidia eerder "KIMMI" schreef, staat er nu "Kimi". Dit is een staande risicoparagraaf, geen plotseling alarm.

Ook de tweede helft van het verhaal staat er al langer. In de directietoelichting schrijft Nvidia dat de vraag naar open basismodellen het gebruik van zijn producten wereldwijd aanjaagt, maar dat die vraag kan dalen als die modellen vooral op de platforms van concurrenten worden ingezet. Dat is de zin die het gedrag verklaart. Het gaat niet om de angst voor een verbod, het gaat om de angst dat de populairste gewichten het beste draaien op andermans silicium.

Wat de ondersteuning oplevert

Sinds 14 augustus geeft Nvidia Qwen3.8-27B day-zero ondersteuning op RTX PRO-kaarten, de GeForce RTX 5090, DGX Spark, DGX Station en de Jetson-modules voor edge-toepassingen. Het model telt 27 miljard parameters en past daarmee op een enkele GPU. Draaien kan via llama.cpp, Ollama, Unsloth en LM Studio; de gemeten snelheid komt van een Q4_K_M-checkpoint op llama.cpp. Ondersteuning voor het zuinigere NVFP4-formaat volgt later, schrijft het bedrijf.

Staafdiagram van Nvidia: Qwen3.8 27B haalt 131 tokens per seconde met multi-token prediction aan op een GeForce RTX 5090, tegen 77 zonder. Bron: NVIDIA
Staafdiagram van Nvidia: Qwen3.8 27B haalt 131 tokens per seconde met multi-token prediction aan op een GeForce RTX 5090, tegen 77 zonder. Bron: NVIDIA

De licentiekant sluit daarop aan, en die weegt voor een bedrijf vaak zwaarder dan de snelheid: Alibaba publiceerde Qwen3.8-27B onder Apache 2.0 zonder omzetdrempel, terwijl voor het grotere Qwen3.8 wel een drempel geldt.

Voor DeepSeek ligt het losser dan de koppen suggereren. Nvidia noemt de opgefriste DeepSeek-V4-Flash in dezelfde blogreeks, een mixture-of-experts-model van 284 miljard parameters waarvan er 13 miljard actief zijn, met een contextvenster van een miljoen tokens. Maar het schrijft erbij dat je dat model lokaal draait op een DGX Station met GGUF-bestanden die de gemeenschap heeft gebouwd. Dat is werk van de community, geen eigen day-zero-optimalisatie.

Waarom Nvidia dit doet

China is als afzetmarkt voor de chips zelf vrijwel weggevallen. Leveringen van H200's onder het Amerikaanse vergunningsprogramma bleven onder 1 procent van de datacenteromzet, Nvidia nam in de eerste helft van dit boekjaar 0,4 miljard dollar aan kosten voor overtollige H200-voorraad en inkoopverplichtingen, en op elke H200 die alsnog wordt geleverd komt 25 procent invoerheffing die het bedrijf niet doorberekent. In een kwartaal waarin het 96,2 miljard dollar omzet boekte, is dat een restpost.

Wat overblijft is de modellenkant. De sterkste gewichten die je vandaag kunt downloaden komen grotendeels uit China, en draaien die het snelst op hardware van een ander, dan verliest Nvidia de laag eronder. Vandaar de day-zero ondersteuning. En vandaar ook de zet de andere kant op: met een licentiedeal van 6 miljard dollar met Poolside wil Nvidia een westers open-weight topmodel bouwen.

Het politieke risico blijft intussen hypothetisch. Het Witte Huis blies begin augustus sancties, een handelszwarte lijst en een cloudverbod op Chinese modelmakers af na verzet uit Silicon Valley, maar er is geen besluit gepubliceerd dat die opties intrekt. Jensen Huang noemde de Chinese modellen in juli uitstekend en zei dat ze gebruikt moeten worden.

Wat deze week zichtbaar maakt, is dat de hardwarelaag en de modellaag uit elkaar lopen. Nvidia maakt zich onmisbaar onder welke gewichten er ook winnen en zet de politieke onzekerheid daarover als vaste post in zijn eigen boeken. Voor wie een zelfhost-opzet kiest, zijn dat twee losse afhankelijkheden met twee losse risicoprofielen: de kaart onder je model wordt sneller en is modelneutraal, de gewichten erop zijn wat een overheid kan raken.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Open modellen, eigen hardware

Welk model je ook kiest, de winst zit in wat eromheen staat: de koppeling met je systemen, het toezicht erop en de plek waar je data blijft. Ik denk mee over die keuze, ontwerp de opzet en bouw hem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Nvidia wil met de Poolside-licentie een open-weight topmodel bouwen
Nieuws
5 min

23 aug 06:07

Nvidia wil met de Poolside-licentie een open-weight topmodel bouwen

Nvidia wil de licentiedeal van 6 miljard dollar met Poolside gebruiken om een van 's werelds krachtigste open-weight modellen te bouwen, meldt The Wall Street Journal. Wat dat verandert voor teams die nu op Chinese gewichten zelf hosten.

Witte Huis blaast sancties en cloudverbod op Chinese open modellen af
Nieuws
4 min

4 aug 16:25

Witte Huis blaast sancties en cloudverbod op Chinese open modellen af

Het Witte Huis overwoog sancties, een handelszwarte lijst en een verbod voor Amerikaanse cloudbedrijven om zaken te doen met Chinese makers van open AI-modellen. Na verzet uit Silicon Valley ging dat pakket van tafel, meldt The New York Times.

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba
Nieuws
4 min

31 jul 16:38

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba

Moonshot draait Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg. De rekenkracht achter het goedkope open model is geleend, bij een partij die tegelijk aandeelhouder en concurrent is.

Witte Huis neigt naar beperkingen per Chinees AI-model, niet naar een breed verbod
Nieuws
4 min

26 jul 12:11

Witte Huis neigt naar beperkingen per Chinees AI-model, niet naar een breed verbod

Amerikaanse functionarissen neigen naar beperkingen per Chinees AI-model in plaats van een breed verbod, meldt The New York Times. Silicon Valley ligt er openlijk over overhoop, met Nvidia, Microsoft en Meta tegenover OpenAI en Anthropic.

Poolside brengt Laguna S 2.1 uit: westers open codeermodel dat je zelf host
Nieuws
4 min

22 jul 06:11

Poolside brengt Laguna S 2.1 uit: westers open codeermodel dat je zelf host

Poolside brengt Laguna S 2.1 uit, een open-weight codeermodel van 118 miljard parameters dat op één NVIDIA DGX Spark draait. Een westers alternatief naast de Chinese open modellen Kimi, GLM en Qwen, met volledige controle over waar je code draait.

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens
Nieuws
5 min

27 aug 02:22

Alibaba zet Qwen3.8-Flash-Next open en rekent 0,16 dollar per miljoen tokens

Alibaba zet de gewichten van Qwen3.8-Flash-Next open. Het model activeert 6 van 176 miljard parameters per token, kost gehost 0,16 dollar per miljoen invoertokens en komt met een strakkere licentie dan het vlaggenschip.