Close-up van een servermodule met een groen oplichtend statuslampje.
Nieuws27 juli · 08:154 min leestijd

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur

Moonshot zet de gewichten van Kimi K3 vandaag om 17.00 uur op Hugging Face. Wat er dan vrijkomt, waarom de licentie nog ontbreekt en hoeveel hardware zelf draaien echt vraagt.

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur Nederlandse tijd op Hugging Face, waar op dit moment nog een aftelklok staat in plaats van modelbestanden.

Dat verschil van een halve dag is groter dan het lijkt. Meerdere publicaties melden vanochtend al dat K3 klaarstaat om te downloaden, terwijl op de officiële pagina van Moonshot nog geen enkel bestand staat. Wie een self-hosted proef wil inplannen, kan dus pas vanmiddag beginnen. En ook daarna blijft de vraag die voor een bedrijf het zwaarst weegt nog even open: onder welke licentie de gewichten vallen, en of je ze commercieel mag gebruiken.

Wat er om 17.00 uur online komt

Op zijn eigen releasepagina noemt Moonshot K3 het eerste open model in de 3-biljoenklasse, gebouwd op twee eigen technieken: Kimi Delta Attention en Attention Residuals. De pagina belooft ingebouwde tool calling, agent-functies en een verlengd contextvenster voor het lezen van hele codebases.

De harde cijfers komen uit de berichtgeving van Bloomberg. K3 telt 2,8 biljoen parameters en verwerkt een miljoen tokens in één prompt, waarmee het het grootste open-gewicht model ter wereld wordt op een moment dat Anthropic de omvang van modellen als Claude juist geheimhoudt. Oprichter Yang Zhilin zegt gebruikers te willen winnen met openheid en bredere beschikbaarheid dan de gesloten Amerikaanse systemen. Sinds het debuut van K3 zijn de dagelijkse verkopen van Moonshot volgens Bloomberg minstens verzesvoudigd.

De ruwe bestanden zeggen op zichzelf weinig. Moonshot licht de architectuur, de training en de benchmarkscores pas toe in een technisch rapport dat later volgt. Analist Nathan Lambert becijferde eerder dat K3 een mixture-of-experts-model is dat 16 van zijn 896 experts per vraag activeert en ongeveer 2,5 keer efficiënter schaalt dan zijn voorganger K2.

De licentie is de echte onbekende

Bij een open-weight model bepaalt de licentie wat je er zakelijk mee mag. Juist die ontbrak tot vandaag. Moonshot had de voorwaarden half juli nog steeds niet gepubliceerd en zegt ze samen met de gewichten uit te brengen, waardoor de commerciële bruikbaarheid tot aan de release onbevestigd blijft.

Voor een Nederlands bedrijf is dat het eerste wat je vanmiddag nakijkt, nog vóór de benchmarks. Een licentie kan gebruik in commerciële producten toestaan, beperken tot onderzoek, of voorwaarden stellen aan doorlevering en aan wat je met de uitvoer mag doen. Zonder die tekst weet je niet of een proef ooit productie mag worden.

Zelf draaien vraagt tientallen versnellers

De tweede rem is fysiek. In het 4-bits MXFP4-formaat beslaan de gewichten alleen al ongeveer 1,4 terabyte, tegen ruwweg 5,6 terabyte bij 16 bits. Northflank rekent voor dat een serieuze opstelling 64 of meer versnellers vraagt en dat geen enkele H100, H200 of B200 het model in zijn eentje kan dragen. Daar komt nog geheugen voor de cache en de context bovenop.

Vier Nvidia H100-versnellerkaarten naast elkaar opgesteld. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)
Vier Nvidia H100-versnellerkaarten naast elkaar opgesteld. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)

Voor vrijwel elk Nederlands bedrijf betekent dat: de gewichten zijn openbaar, maar het model draaien besteed je uit aan een hostingpartij. Daarmee komt een deel van de leveranciersafhankelijkheid gewoon terug, alleen bij een andere partij. Via de API blijft de rekensom voorlopig eenvoudiger, met drie dollar per miljoen invoertokens en vijftien dollar per miljoen uitvoertokens, waarmee K3 op ongeveer de helft van de kosten per taak van Anthropics Opus 4.8 uitkomt.

De grote clouds houden zich nog afzijdig

De distributie loopt daarmee achter op de vraag. Bloomberg Intelligence-analisten Mandeep Singh en William Tong schrijven dat de adoptie van open-gewicht modellen een omslagpunt bereikt, maar dat het verdienmodel afhangt van distributie via de grote cloudaanbieders. Amazon Bedrock, Azure Foundry en Google Vertex AI ondersteunen deze Chinese open modellen nog niet, terwijl hun aandeel in het tokenverkeer na de lanceringen van K3 en GLM-5.2 op 68 procent uitkwam.

Achter de schermen beweegt het wel. Microsoft onderzoekt of K3 Copilot-functies kan overnemen en daarmee tot 600 miljoen dollar aan inferentiekosten kan schelen, voorlopig als evaluatie en niet als uitrol. Zolang de hyperscalers het model niet standaard aanbieden, loopt de weg naar K3 voor de meeste bedrijven via routeringsdiensten of een gespecialiseerde hoster.

Een model dat je kunt bewaren

De release valt in een ongemakkelijke week. Vijf dagen geleden beschuldigde het Witte Huis Moonshot ervan Anthropics Fable-model te hebben gedistilleerd voor de ontwikkeling van K3, en vorige week kwam daar de aantijging bij dat het model op verboden Nvidia-chips is getraind. Moonshot reageerde niet op vragen daarover.

Dat is precies wat vanmiddag verandert. Een API kun je afsluiten, een exportregel kan een dienst blokkeren, maar een bestand van 1,4 terabyte dat eenmaal is gedownload, staat er. De juridische en politieke onzekerheid rond Moonshot verdwijnt daarmee niet, want onder de Chinese National Intelligence Law uit 2017 moet elke organisatie meewerken aan het nationale inlichtingenwerk, en die weegt mee zodra je het model als gehoste dienst afneemt in plaats van zelf draait. Maar de keuze verschuift wel: van vertrouwen op een leverancier naar een afweging die je zelf kunt maken, mits je de hardware en de licentie op orde hebt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Open modellen praktisch inzetten

Of je nu een open model als Kimi K3 overweegt of bij een gesloten API blijft, ik help je van afweging tot werkende opstelling: meedenken over de keuze, het ontwerp maken, bouwen en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet
Nieuws
4 min

26 aug 22:35

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet

Moonshot vraagt volgens Reuters tot 30 procent van de omzet die Microsoft, Amazon en Google met Kimi K3 zouden maken. De gesprekken bepalen of je het Chinese topmodel straks gewoon als clouddienst inkoopt.

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway
Nieuws
5 min

24 aug 02:11

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.

Harvey traint eigen juridisch model op het open Chinese Kimi K3
Nieuws
5 min

21 aug 18:11

Harvey traint eigen juridisch model op het open Chinese Kimi K3

Harvey post-traint zijn eerste eigen juridische model op het open-weight Kimi K3 van Moonshot in plaats van een frontier-API te huren. Wat de cijfers laten zien en wat die route echt kost.

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba
Nieuws
4 min

31 jul 16:38

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba

Moonshot draait Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg. De rekenkracht achter het goedkope open model is geleend, bij een partij die tegelijk aandeelhouder en concurrent is.

Exportcontrole op AI klimt de stack op: van chip naar model naar jouw contract
Signaal
8 min

28 jul 00:44

Exportcontrole op AI klimt de stack op: van chip naar model naar jouw contract

In januari 2025 stond de regel er al: modelgewichten onder exportvergunning. Hij werd ingetrokken. Anderhalf jaar later doet Washington hetzelfde per brief, en Beijing bouwt het instrument na.

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag
Signaal
7 min

27 jul 12:04

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag

In tien dagen greep iedereen naar dezelfde laag in de AI-keten, en dat was niet het model. Het schaarse goed blijkt de capaciteit om een model te serveren, en daar verschuift de macht nu naartoe.