Nvidia versnelt Chinese open modellen op zijn eigen kaarten en noemt in het kwartaalrapport dat het woensdag bij de Amerikaanse beurstoezichthouder indiende een verbod op DeepSeek, Qwen of Kimi een risico voor zijn resultaten.
Voor een Nederlands team dat zo'n model op eigen hardware draait, verandert vooral de rekensom onder de motorkap. Qwen3.8-27B haalt op een enkele GeForce RTX 5090 131 tokens per seconde met multi-token prediction, tegen 77 zonder. Dat is genoeg voor een codeeragent die de hele dag meeloopt, op een kaart die je zelf in de kast hebt staan, met je broncode binnenshuis. De andere kant van dezelfde week: de fabrikant van die kaart houdt er zelf rekening mee dat Washington precies die modellen kan afsluiten.
Wat er in de indiening staat
Het rapport beslaat het kwartaal tot en met 26 juli en werd op 26 augustus ingediend. In de risicoparagraaf schrijft Nvidia dat elke regel of beperking die het hindert om producten en diensten te leveren voor toepassingen bovenop basismodellen van Chinese oorsprong, "zoals DeepSeek, Qwen of Kimi", een materieel effect kan hebben op de bedrijfsvoering en de resultaten. De drie namen staan er letterlijk.
Nieuw is die passage niet, en dat is het belangrijkste voorbehoud bij de berichtgeving erover. Dezelfde zin met dezelfde drie modelnamen stond al in het jaarverslag over het boekjaar tot 25 januari, ingediend op 25 februari, en in het kwartaalrapport van 20 mei. Het enige verschil in de nieuwe versie is de spelling: waar Nvidia eerder "KIMMI" schreef, staat er nu "Kimi". Dit is een staande risicoparagraaf, geen plotseling alarm.
Ook de tweede helft van het verhaal staat er al langer. In de directietoelichting schrijft Nvidia dat de vraag naar open basismodellen het gebruik van zijn producten wereldwijd aanjaagt, maar dat die vraag kan dalen als die modellen vooral op de platforms van concurrenten worden ingezet. Dat is de zin die het gedrag verklaart. Het gaat niet om de angst voor een verbod, het gaat om de angst dat de populairste gewichten het beste draaien op andermans silicium.
Wat de ondersteuning oplevert
Sinds 14 augustus geeft Nvidia Qwen3.8-27B day-zero ondersteuning op RTX PRO-kaarten, de GeForce RTX 5090, DGX Spark, DGX Station en de Jetson-modules voor edge-toepassingen. Het model telt 27 miljard parameters en past daarmee op een enkele GPU. Draaien kan via llama.cpp, Ollama, Unsloth en LM Studio; de gemeten snelheid komt van een Q4_K_M-checkpoint op llama.cpp. Ondersteuning voor het zuinigere NVFP4-formaat volgt later, schrijft het bedrijf.

De licentiekant sluit daarop aan, en die weegt voor een bedrijf vaak zwaarder dan de snelheid: Alibaba publiceerde Qwen3.8-27B onder Apache 2.0 zonder omzetdrempel, terwijl voor het grotere Qwen3.8 wel een drempel geldt.
Voor DeepSeek ligt het losser dan de koppen suggereren. Nvidia noemt de opgefriste DeepSeek-V4-Flash in dezelfde blogreeks, een mixture-of-experts-model van 284 miljard parameters waarvan er 13 miljard actief zijn, met een contextvenster van een miljoen tokens. Maar het schrijft erbij dat je dat model lokaal draait op een DGX Station met GGUF-bestanden die de gemeenschap heeft gebouwd. Dat is werk van de community, geen eigen day-zero-optimalisatie.
Waarom Nvidia dit doet
China is als afzetmarkt voor de chips zelf vrijwel weggevallen. Leveringen van H200's onder het Amerikaanse vergunningsprogramma bleven onder 1 procent van de datacenteromzet, Nvidia nam in de eerste helft van dit boekjaar 0,4 miljard dollar aan kosten voor overtollige H200-voorraad en inkoopverplichtingen, en op elke H200 die alsnog wordt geleverd komt 25 procent invoerheffing die het bedrijf niet doorberekent. In een kwartaal waarin het 96,2 miljard dollar omzet boekte, is dat een restpost.
Wat overblijft is de modellenkant. De sterkste gewichten die je vandaag kunt downloaden komen grotendeels uit China, en draaien die het snelst op hardware van een ander, dan verliest Nvidia de laag eronder. Vandaar de day-zero ondersteuning. En vandaar ook de zet de andere kant op: met een licentiedeal van 6 miljard dollar met Poolside wil Nvidia een westers open-weight topmodel bouwen.
Het politieke risico blijft intussen hypothetisch. Het Witte Huis blies begin augustus sancties, een handelszwarte lijst en een cloudverbod op Chinese modelmakers af na verzet uit Silicon Valley, maar er is geen besluit gepubliceerd dat die opties intrekt. Jensen Huang noemde de Chinese modellen in juli uitstekend en zei dat ze gebruikt moeten worden.
Wat deze week zichtbaar maakt, is dat de hardwarelaag en de modellaag uit elkaar lopen. Nvidia maakt zich onmisbaar onder welke gewichten er ook winnen en zet de politieke onzekerheid daarover als vaste post in zijn eigen boeken. Voor wie een zelfhost-opzet kiest, zijn dat twee losse afhankelijkheden met twee losse risicoprofielen: de kaart onder je model wordt sneller en is modelneutraal, de gewichten erop zijn wat een overheid kan raken.
Veelgestelde vragen
Open modellen, eigen hardware
Welk model je ook kiest, de winst zit in wat eromheen staat: de koppeling met je systemen, het toezicht erop en de plek waar je data blijft. Ik denk mee over die keuze, ontwerp de opzet en bouw hem, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
