Close-up van een servermodule met een groen oplichtend statuslampje.
Nieuws27 juli · 08:154 min leestijd

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur

Moonshot zet de gewichten van Kimi K3 vandaag om 17.00 uur op Hugging Face. Wat er dan vrijkomt, waarom de licentie nog ontbreekt en hoeveel hardware zelf draaien echt vraagt.

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur Nederlandse tijd op Hugging Face, waar op dit moment nog een aftelklok staat in plaats van modelbestanden.

Dat verschil van een halve dag is groter dan het lijkt. Meerdere publicaties melden vanochtend al dat K3 klaarstaat om te downloaden, terwijl op de officiële pagina van Moonshot nog geen enkel bestand staat. Wie een self-hosted proef wil inplannen, kan dus pas vanmiddag beginnen. En ook daarna blijft de vraag die voor een bedrijf het zwaarst weegt nog even open: onder welke licentie de gewichten vallen, en of je ze commercieel mag gebruiken.

Wat er om 17.00 uur online komt

Op zijn eigen releasepagina noemt Moonshot K3 het eerste open model in de 3-biljoenklasse, gebouwd op twee eigen technieken: Kimi Delta Attention en Attention Residuals. De pagina belooft ingebouwde tool calling, agent-functies en een verlengd contextvenster voor het lezen van hele codebases.

De harde cijfers komen uit de berichtgeving van Bloomberg. K3 telt 2,8 biljoen parameters en verwerkt een miljoen tokens in één prompt, waarmee het het grootste open-gewicht model ter wereld wordt op een moment dat Anthropic de omvang van modellen als Claude juist geheimhoudt. Oprichter Yang Zhilin zegt gebruikers te willen winnen met openheid en bredere beschikbaarheid dan de gesloten Amerikaanse systemen. Sinds het debuut van K3 zijn de dagelijkse verkopen van Moonshot volgens Bloomberg minstens verzesvoudigd.

De ruwe bestanden zeggen op zichzelf weinig. Moonshot licht de architectuur, de training en de benchmarkscores pas toe in een technisch rapport dat later volgt. Analist Nathan Lambert becijferde eerder dat K3 een mixture-of-experts-model is dat 16 van zijn 896 experts per vraag activeert en ongeveer 2,5 keer efficiënter schaalt dan zijn voorganger K2.

De licentie is de echte onbekende

Bij een open-weight model bepaalt de licentie wat je er zakelijk mee mag. Juist die ontbrak tot vandaag. Moonshot had de voorwaarden half juli nog steeds niet gepubliceerd en zegt ze samen met de gewichten uit te brengen, waardoor de commerciële bruikbaarheid tot aan de release onbevestigd blijft.

Voor een Nederlands bedrijf is dat het eerste wat je vanmiddag nakijkt, nog vóór de benchmarks. Een licentie kan gebruik in commerciële producten toestaan, beperken tot onderzoek, of voorwaarden stellen aan doorlevering en aan wat je met de uitvoer mag doen. Zonder die tekst weet je niet of een proef ooit productie mag worden.

Zelf draaien vraagt tientallen versnellers

De tweede rem is fysiek. In het 4-bits MXFP4-formaat beslaan de gewichten alleen al ongeveer 1,4 terabyte, tegen ruwweg 5,6 terabyte bij 16 bits. Northflank rekent voor dat een serieuze opstelling 64 of meer versnellers vraagt en dat geen enkele H100, H200 of B200 het model in zijn eentje kan dragen. Daar komt nog geheugen voor de cache en de context bovenop.

Vier Nvidia H100-versnellerkaarten naast elkaar opgesteld. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)
Vier Nvidia H100-versnellerkaarten naast elkaar opgesteld. Bron: 极客湾Geekerwan / Wikimedia Commons (CC BY 3.0)

Voor vrijwel elk Nederlands bedrijf betekent dat: de gewichten zijn openbaar, maar het model draaien besteed je uit aan een hostingpartij. Daarmee komt een deel van de leveranciersafhankelijkheid gewoon terug, alleen bij een andere partij. Via de API blijft de rekensom voorlopig eenvoudiger, met drie dollar per miljoen invoertokens en vijftien dollar per miljoen uitvoertokens, waarmee K3 op ongeveer de helft van de kosten per taak van Anthropics Opus 4.8 uitkomt.

De grote clouds houden zich nog afzijdig

De distributie loopt daarmee achter op de vraag. Bloomberg Intelligence-analisten Mandeep Singh en William Tong schrijven dat de adoptie van open-gewicht modellen een omslagpunt bereikt, maar dat het verdienmodel afhangt van distributie via de grote cloudaanbieders. Amazon Bedrock, Azure Foundry en Google Vertex AI ondersteunen deze Chinese open modellen nog niet, terwijl hun aandeel in het tokenverkeer na de lanceringen van K3 en GLM-5.2 op 68 procent uitkwam.

Achter de schermen beweegt het wel. Microsoft onderzoekt of K3 Copilot-functies kan overnemen en daarmee tot 600 miljoen dollar aan inferentiekosten kan schelen, voorlopig als evaluatie en niet als uitrol. Zolang de hyperscalers het model niet standaard aanbieden, loopt de weg naar K3 voor de meeste bedrijven via routeringsdiensten of een gespecialiseerde hoster.

Een model dat je kunt bewaren

De release valt in een ongemakkelijke week. Vijf dagen geleden beschuldigde het Witte Huis Moonshot ervan Anthropics Fable-model te hebben gedistilleerd voor de ontwikkeling van K3, en vorige week kwam daar de aantijging bij dat het model op verboden Nvidia-chips is getraind. Moonshot reageerde niet op vragen daarover.

Dat is precies wat vanmiddag verandert. Een API kun je afsluiten, een exportregel kan een dienst blokkeren, maar een bestand van 1,4 terabyte dat eenmaal is gedownload, staat er. De juridische en politieke onzekerheid rond Moonshot verdwijnt daarmee niet, want onder de Chinese National Intelligence Law uit 2017 moet elke organisatie meewerken aan het nationale inlichtingenwerk, en die weegt mee zodra je het model als gehoste dienst afneemt in plaats van zelf draait. Maar de keuze verschuift wel: van vertrouwen op een leverancier naar een afweging die je zelf kunt maken, mits je de hardware en de licentie op orde hebt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Open modellen praktisch inzetten

Of je nu een open model als Kimi K3 overweegt of bij een gesloten API blijft, ik help je van afweging tot werkende opstelling: meedenken over de keuze, het ontwerp maken, bouwen en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

OpenAI tekent alsnog de open-weight-brief, Anthropic en Google blijven weg
Nieuws
4 min

25 jul 10:15

OpenAI tekent alsnog de open-weight-brief, Anthropic en Google blijven weg

OpenAI staat sinds vrijdagavond alsnog op de open-weight-brief aan Washington, die inmiddels 35 ondertekenaars telt. Anthropic en Google blijven als enige grote frontier-aanbieders buiten de coalitie die pleit tegen beperkingen op open modellen.

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington
Nieuws
4 min

24 jul 18:21

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington

Voor het eerst zetten de grootste Amerikaanse AI-leveranciers zelf, niet alleen startups, gezamenlijk hun gewicht achter open modellen. In een brief aan Washington vragen Nvidia, Microsoft, Meta en Palantir om geen beperkingen op open-weight AI.

VS breidt dreiging tegen Chinese AI-modellen uit en plant AI-top met China
Nieuws
4 min

23 jul 10:13

VS breidt dreiging tegen Chinese AI-modellen uit en plant AI-top met China

Handelsvertegenwoordiger Greer sluit zich aan bij de Amerikaanse dreiging tegen Chinese open modellen Kimi K3 en GLM-5.2, en volgens Reuters plannen de VS en China voor het eerst AI-overleg in september. Voor Nederlandse teams groeit het jurisdictierisico.

Meta metselt zich in, en de open fakkel verhuist
Signaal
7 min

17 jul 16:01

Meta metselt zich in, en de open fakkel verhuist

Meta ruilde zijn open Llama in voor een gesloten Muse Spark en metselt er een eigen chip, cloud en app-laag omheen. Los is het bedrijfsnieuws, samen een beweging. En de open fakkel? Die verhuist gewoon.

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze
Nieuws
6 min

3 jul 04:10

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze

GitHub heeft Kimi K2.7 Code algemeen beschikbaar gemaakt in de Copilot-modelkeuze. Het is het eerste open-weight model in de picker, fors goedkoper dan de frontier-modellen, en je devteam kan vandaag overstappen zonder tooling te wijzigen.

Witte Huis neigt naar beperkingen per Chinees AI-model, niet naar een breed verbod
Nieuws
4 min

26 jul 12:11

Witte Huis neigt naar beperkingen per Chinees AI-model, niet naar een breed verbod

Amerikaanse functionarissen neigen naar beperkingen per Chinees AI-model in plaats van een breed verbod, meldt The New York Times. Silicon Valley ligt er openlijk over overhoop, met Nvidia, Microsoft en Meta tegenover OpenAI en Anthropic.