Moonshot draait zijn open model Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg op basis van ingewijden. Alibaba levert die rekenkracht en is tegelijk een van de grootste investeerders in het Chinese AI-bedrijf.
Voor een Nederlands bedrijf dat K3 op de shortlist zette als goedkoop open alternatief verandert daarmee de aard van het risico. De capaciteit achter het model is niet van Moonshot zelf. Ze is gehuurd bij een partij die aandeelhouder en concurrent tegelijk is, en zo'n contractuele afhankelijkheid zie je in geen enkele benchmark terug.
Wat Bloomberg meldt en wat Alibaba ontkent
Het gaat volgens de bronnen om chips uit Nvidia's Hopper-generatie, specifiek de H200-versnellers. Een woordvoerder van Alibaba ontkent dat het bedrijf H200-rekenkracht aan Moonshot levert, maar laat de bredere afspraak over 20.000 chips onweersproken en wil niet zeggen om welke chips het dan wel gaat.
Die halve ontkenning ligt in twee hoofdsteden gevoelig. Washington gaf in mei ongeveer tien Chinese bedrijven, waaronder Alibaba, toestemming om per klant tot 75.000 H200-chips te kopen, waarna diezelfde kopers zich inhielden op aanwijzing van Beijing, dat zijn eigen chipindustrie wil beschermen. Bevestigen dat er Amerikaanse H200's onder het bekendste Chinese open model liggen, is dus voor beide overheden ongemakkelijk.
Uit hetzelfde bericht komt een detail dat de verhouding tekent: Kimi scoort in benchmarks beter dan Alibaba's eigen Qwen-modellen, terwijl beide teams op vergelijkbare Alibaba-infrastructuur werken. Binnen Alibaba zou dat voor wrijving hebben gezorgd.
Een kanttekening hoort er hard bij. Het getal van 20.000 rust op een enkele scoop met anonieme bronnen. Van Investing.com tot de Seoul Economic Daily nemen andere redacties het over, maar niemand heeft het zelfstandig bevestigd.

Waarom dit de aanmeldstop van 20 juli verklaart
Elf dagen geleden stopte Moonshot met het aannemen van nieuwe Kimi K3-abonnees omdat het rekencluster tegen zijn maximum aanliep. Met gehuurde capaciteit valt dat op zijn plek. Wie zijn cluster huurt, bouwt niet even bij als de vraag verdubbelt, maar moet daarover onderhandelen met de verhuurder.
Ook de rolverdeling binnen dat rekenpark wordt duidelijker. Voor het trainen van K3 gebruikte Moonshot volgens The Information Blackwell-chips in de datacenters van twee Chinese bedrijven, die daarvoor losse servers van acht chips aan elkaar moesten knopen. Voor het draaien van het model leunt het bedrijf op de H20, de China-versie van Nvidia die aan beide kanten van de Stille Oceaan is toegestaan, en het raadt daarvoor minstens 64 van die GPU's aan.
De omstreden kant zit bij die Blackwell-chips. Het Witte Huis beschuldigde Moonshot op 22 juli ervan dat het Anthropics Fable-model distilleerde en GB300-servers deels via Thailand verwierf. Bloomberg meldt nu dat er inderdaad een kanaal naar Blackwell-processors via Zuidoost-Azië loopt, al blijft onduidelijk of het om legaal huren of om een overtreding gaat.
Twee routes, twee soorten afhankelijkheid
Ga je via de API van Moonshot, dan koop je een plek in de rij achter een cluster dat iemand anders bezit, en die iemand bouwt met Qwen aan een concurrerend model. Dat is geen doemscenario, maar wel een reden om een tweede aanbieder klaar te zetten voordat je een klantproces op K3 bouwt.
De andere route is zelf draaien. De gewichten die Moonshot op 27 juli om 17.00 uur op Hugging Face publiceerde staan daar onder een eigen Kimi K3-licentie. Het model telt 2,8 biljoen parameters, waarvan er per token 104 miljard actief zijn, en is gekwantiseerd naar MXFP4 zodat het op meer soorten hardware past. Serveren kan met vLLM of SGLang. Klein is dat allemaal niet, en de meeste bedrijven zullen het via een inferentie-aanbieder doen, maar het is wel het verschil tussen een leverancier die je kwijt kunt raken en een model dat je houdt.
Daarmee verschuift de vraag waar bij open modellen het echte risico zit. De gewichten zijn van jou zodra je ze hebt gedownload, de rekenkracht om ze te draaien is dat nooit. Het is dezelfde beweging die open gewichten inmiddels een Chinese jurisdictie meegeeft en de ene afhankelijkheid voor de andere inruilt, maar dan een laag lager: niet bij het model, maar bij de chips waarop het staat. Wie K3 in productie neemt, kiest niet alleen een model, maar erft ook de vraag wie de stekker van dat cluster in handen heeft.
Veelgestelde vragen
Niet vastzitten aan een model
Als de rekenkracht onder je AI van iemand anders is, wil je kunnen wisselen zonder je hele proces te verbouwen. Ik denk mee over die keuze, ontwerp de opzet en bouw en automatiseer hem ook, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
