Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur Nederlandse tijd op Hugging Face, waar op dit moment nog een aftelklok staat in plaats van modelbestanden.
Dat verschil van een halve dag is groter dan het lijkt. Meerdere publicaties melden vanochtend al dat K3 klaarstaat om te downloaden, terwijl op de officiële pagina van Moonshot nog geen enkel bestand staat. Wie een self-hosted proef wil inplannen, kan dus pas vanmiddag beginnen. En ook daarna blijft de vraag die voor een bedrijf het zwaarst weegt nog even open: onder welke licentie de gewichten vallen, en of je ze commercieel mag gebruiken.
Wat er om 17.00 uur online komt
Op zijn eigen releasepagina noemt Moonshot K3 het eerste open model in de 3-biljoenklasse, gebouwd op twee eigen technieken: Kimi Delta Attention en Attention Residuals. De pagina belooft ingebouwde tool calling, agent-functies en een verlengd contextvenster voor het lezen van hele codebases.
De harde cijfers komen uit de berichtgeving van Bloomberg. K3 telt 2,8 biljoen parameters en verwerkt een miljoen tokens in één prompt, waarmee het het grootste open-gewicht model ter wereld wordt op een moment dat Anthropic de omvang van modellen als Claude juist geheimhoudt. Oprichter Yang Zhilin zegt gebruikers te willen winnen met openheid en bredere beschikbaarheid dan de gesloten Amerikaanse systemen. Sinds het debuut van K3 zijn de dagelijkse verkopen van Moonshot volgens Bloomberg minstens verzesvoudigd.
De ruwe bestanden zeggen op zichzelf weinig. Moonshot licht de architectuur, de training en de benchmarkscores pas toe in een technisch rapport dat later volgt. Analist Nathan Lambert becijferde eerder dat K3 een mixture-of-experts-model is dat 16 van zijn 896 experts per vraag activeert en ongeveer 2,5 keer efficiënter schaalt dan zijn voorganger K2.
De licentie is de echte onbekende
Bij een open-weight model bepaalt de licentie wat je er zakelijk mee mag. Juist die ontbrak tot vandaag. Moonshot had de voorwaarden half juli nog steeds niet gepubliceerd en zegt ze samen met de gewichten uit te brengen, waardoor de commerciële bruikbaarheid tot aan de release onbevestigd blijft.
Voor een Nederlands bedrijf is dat het eerste wat je vanmiddag nakijkt, nog vóór de benchmarks. Een licentie kan gebruik in commerciële producten toestaan, beperken tot onderzoek, of voorwaarden stellen aan doorlevering en aan wat je met de uitvoer mag doen. Zonder die tekst weet je niet of een proef ooit productie mag worden.
Zelf draaien vraagt tientallen versnellers
De tweede rem is fysiek. In het 4-bits MXFP4-formaat beslaan de gewichten alleen al ongeveer 1,4 terabyte, tegen ruwweg 5,6 terabyte bij 16 bits. Northflank rekent voor dat een serieuze opstelling 64 of meer versnellers vraagt en dat geen enkele H100, H200 of B200 het model in zijn eentje kan dragen. Daar komt nog geheugen voor de cache en de context bovenop.

Voor vrijwel elk Nederlands bedrijf betekent dat: de gewichten zijn openbaar, maar het model draaien besteed je uit aan een hostingpartij. Daarmee komt een deel van de leveranciersafhankelijkheid gewoon terug, alleen bij een andere partij. Via de API blijft de rekensom voorlopig eenvoudiger, met drie dollar per miljoen invoertokens en vijftien dollar per miljoen uitvoertokens, waarmee K3 op ongeveer de helft van de kosten per taak van Anthropics Opus 4.8 uitkomt.
De grote clouds houden zich nog afzijdig
De distributie loopt daarmee achter op de vraag. Bloomberg Intelligence-analisten Mandeep Singh en William Tong schrijven dat de adoptie van open-gewicht modellen een omslagpunt bereikt, maar dat het verdienmodel afhangt van distributie via de grote cloudaanbieders. Amazon Bedrock, Azure Foundry en Google Vertex AI ondersteunen deze Chinese open modellen nog niet, terwijl hun aandeel in het tokenverkeer na de lanceringen van K3 en GLM-5.2 op 68 procent uitkwam.
Achter de schermen beweegt het wel. Microsoft onderzoekt of K3 Copilot-functies kan overnemen en daarmee tot 600 miljoen dollar aan inferentiekosten kan schelen, voorlopig als evaluatie en niet als uitrol. Zolang de hyperscalers het model niet standaard aanbieden, loopt de weg naar K3 voor de meeste bedrijven via routeringsdiensten of een gespecialiseerde hoster.
Een model dat je kunt bewaren
De release valt in een ongemakkelijke week. Vijf dagen geleden beschuldigde het Witte Huis Moonshot ervan Anthropics Fable-model te hebben gedistilleerd voor de ontwikkeling van K3, en vorige week kwam daar de aantijging bij dat het model op verboden Nvidia-chips is getraind. Moonshot reageerde niet op vragen daarover.
Dat is precies wat vanmiddag verandert. Een API kun je afsluiten, een exportregel kan een dienst blokkeren, maar een bestand van 1,4 terabyte dat eenmaal is gedownload, staat er. De juridische en politieke onzekerheid rond Moonshot verdwijnt daarmee niet, want onder de Chinese National Intelligence Law uit 2017 moet elke organisatie meewerken aan het nationale inlichtingenwerk, en die weegt mee zodra je het model als gehoste dienst afneemt in plaats van zelf draait. Maar de keuze verschuift wel: van vertrouwen op een leverancier naar een afweging die je zelf kunt maken, mits je de hardware en de licentie op orde hebt.
Veelgestelde vragen
Open modellen praktisch inzetten
Of je nu een open model als Kimi K3 overweegt of bij een gesloten API blijft, ik help je van afweging tot werkende opstelling: meedenken over de keuze, het ontwerp maken, bouwen en automatiseren, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
