Wand van serverracks met bundels kabels in een donkere serverruimte.
Nieuws31 juli · 16:384 min leestijd

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba

Moonshot draait Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg. De rekenkracht achter het goedkope open model is geleend, bij een partij die tegelijk aandeelhouder en concurrent is.

Moonshot draait zijn open model Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg op basis van ingewijden. Alibaba levert die rekenkracht en is tegelijk een van de grootste investeerders in het Chinese AI-bedrijf.

Voor een Nederlands bedrijf dat K3 op de shortlist zette als goedkoop open alternatief verandert daarmee de aard van het risico. De capaciteit achter het model is niet van Moonshot zelf. Ze is gehuurd bij een partij die aandeelhouder en concurrent tegelijk is, en zo'n contractuele afhankelijkheid zie je in geen enkele benchmark terug.

Wat Bloomberg meldt en wat Alibaba ontkent

Het gaat volgens de bronnen om chips uit Nvidia's Hopper-generatie, specifiek de H200-versnellers. Een woordvoerder van Alibaba ontkent dat het bedrijf H200-rekenkracht aan Moonshot levert, maar laat de bredere afspraak over 20.000 chips onweersproken en wil niet zeggen om welke chips het dan wel gaat.

Die halve ontkenning ligt in twee hoofdsteden gevoelig. Washington gaf in mei ongeveer tien Chinese bedrijven, waaronder Alibaba, toestemming om per klant tot 75.000 H200-chips te kopen, waarna diezelfde kopers zich inhielden op aanwijzing van Beijing, dat zijn eigen chipindustrie wil beschermen. Bevestigen dat er Amerikaanse H200's onder het bekendste Chinese open model liggen, is dus voor beide overheden ongemakkelijk.

Uit hetzelfde bericht komt een detail dat de verhouding tekent: Kimi scoort in benchmarks beter dan Alibaba's eigen Qwen-modellen, terwijl beide teams op vergelijkbare Alibaba-infrastructuur werken. Binnen Alibaba zou dat voor wrijving hebben gezorgd.

Een kanttekening hoort er hard bij. Het getal van 20.000 rust op een enkele scoop met anonieme bronnen. Van Investing.com tot de Seoul Economic Daily nemen andere redacties het over, maar niemand heeft het zelfstandig bevestigd.

Nvidia H100-versneller voor datacenters, de Hopper-generatie waartoe ook de H200 behoort. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)
Nvidia H100-versneller voor datacenters, de Hopper-generatie waartoe ook de H200 behoort. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)

Waarom dit de aanmeldstop van 20 juli verklaart

Elf dagen geleden stopte Moonshot met het aannemen van nieuwe Kimi K3-abonnees omdat het rekencluster tegen zijn maximum aanliep. Met gehuurde capaciteit valt dat op zijn plek. Wie zijn cluster huurt, bouwt niet even bij als de vraag verdubbelt, maar moet daarover onderhandelen met de verhuurder.

Ook de rolverdeling binnen dat rekenpark wordt duidelijker. Voor het trainen van K3 gebruikte Moonshot volgens The Information Blackwell-chips in de datacenters van twee Chinese bedrijven, die daarvoor losse servers van acht chips aan elkaar moesten knopen. Voor het draaien van het model leunt het bedrijf op de H20, de China-versie van Nvidia die aan beide kanten van de Stille Oceaan is toegestaan, en het raadt daarvoor minstens 64 van die GPU's aan.

De omstreden kant zit bij die Blackwell-chips. Het Witte Huis beschuldigde Moonshot op 22 juli ervan dat het Anthropics Fable-model distilleerde en GB300-servers deels via Thailand verwierf. Bloomberg meldt nu dat er inderdaad een kanaal naar Blackwell-processors via Zuidoost-Azië loopt, al blijft onduidelijk of het om legaal huren of om een overtreding gaat.

Twee routes, twee soorten afhankelijkheid

Ga je via de API van Moonshot, dan koop je een plek in de rij achter een cluster dat iemand anders bezit, en die iemand bouwt met Qwen aan een concurrerend model. Dat is geen doemscenario, maar wel een reden om een tweede aanbieder klaar te zetten voordat je een klantproces op K3 bouwt.

De andere route is zelf draaien. De gewichten die Moonshot op 27 juli om 17.00 uur op Hugging Face publiceerde staan daar onder een eigen Kimi K3-licentie. Het model telt 2,8 biljoen parameters, waarvan er per token 104 miljard actief zijn, en is gekwantiseerd naar MXFP4 zodat het op meer soorten hardware past. Serveren kan met vLLM of SGLang. Klein is dat allemaal niet, en de meeste bedrijven zullen het via een inferentie-aanbieder doen, maar het is wel het verschil tussen een leverancier die je kwijt kunt raken en een model dat je houdt.

Daarmee verschuift de vraag waar bij open modellen het echte risico zit. De gewichten zijn van jou zodra je ze hebt gedownload, de rekenkracht om ze te draaien is dat nooit. Het is dezelfde beweging die open gewichten inmiddels een Chinese jurisdictie meegeeft en de ene afhankelijkheid voor de andere inruilt, maar dan een laag lager: niet bij het model, maar bij de chips waarop het staat. Wie K3 in productie neemt, kiest niet alleen een model, maar erft ook de vraag wie de stekker van dat cluster in handen heeft.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Niet vastzitten aan een model

Als de rekenkracht onder je AI van iemand anders is, wil je kunnen wisselen zonder je hele proces te verbouwen. Ik denk mee over die keuze, ontwerp de opzet en bouw en automatiseer hem ook, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Exportcontrole op AI klimt de stack op: van chip naar model naar jouw contract
Signaal
8 min

28 jul 00:44

Exportcontrole op AI klimt de stack op: van chip naar model naar jouw contract

In januari 2025 stond de regel er al: modelgewichten onder exportvergunning. Hij werd ingetrokken. Anderhalf jaar later doet Washington hetzelfde per brief, en Beijing bouwt het instrument na.

China dreigt met tegenmaatregelen tegen Amerikaanse sancties om Kimi K3
Nieuws
4 min

28 jul 00:16

China dreigt met tegenmaatregelen tegen Amerikaanse sancties om Kimi K3

China's ministerie van Handel noemt de Amerikaanse sanctiedreiging rond Kimi K3 AI-hegemonisme en belooft alle noodzakelijke maatregelen. Voor Nederlandse teams die op het Chinese model bouwen, komt de druk nu van twee kanten tegelijk.

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag
Signaal
7 min

27 jul 12:04

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag

In tien dagen greep iedereen naar dezelfde laag in de AI-keten, en dat was niet het model. Het schaarse goed blijkt de capaciteit om een model te serveren, en daar verschuift de macht nu naartoe.

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur
Nieuws
4 min

27 jul 08:15

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur

Moonshot zet de gewichten van Kimi K3 vandaag om 17.00 uur op Hugging Face. Wat er dan vrijkomt, waarom de licentie nog ontbreekt en hoeveel hardware zelf draaien echt vraagt.

Chinese militaire onderzoekers trainen defensiesystemen op output van OpenAI en Anthropic
Nieuws
5 min

31 jul 12:12

Chinese militaire onderzoekers trainen defensiesystemen op output van OpenAI en Anthropic

Reuters vond in ruim tachtig Chinese papers en patenten dat aan het leger gelieerde onderzoekers output van OpenAI- en Anthropic-modellen gebruiken voor drones, doelherkenning en socialemediamonitoring. Dat verhardt het debat over modeltoegang.

Congrescommissies vragen DoorDash uitleg over Chinees model Kimi K2.6
Nieuws
4 min

1 aug 04:34

Congrescommissies vragen DoorDash uitleg over Chinees model Kimi K2.6

Twee commissies van het Amerikaanse Huis vragen DoorDash uitleg over het Chinese model Kimi K2.6. De aanleiding is een eigen benchmark waarin dat model beter scoorde dan de Amerikaanse opstelling, en ook nog goedkoper was.