Open-weightmodellen uit Chinese labs lopen volgens Mozilla's v1.1-rapport nog ongeveer 4,4 maanden achter op gesloten Amerikaanse frontiermodellen; Kimi K3 haalt bijna dezelfde indexscore voor 30 procent van de prijs.
Voor een Nederlandse organisatie verschuift daarmee de inkoopvraag. Een open model is inmiddels ook een serieuze kandidaat voor routinewerk en kortere agenttaken. Gesloten frontiermodellen blijven relevant voor expertwerk, lange context en opdrachten die nu 8 tot 12 uur menselijk werk vragen. Self-hosting en jurisdictie worden dus onderdeel van dezelfde keuze.

De vier maanden zijn een gemiddelde
Mozilla publiceerde versie 1.1 op 15 september. De meting gebruikt een momentopname van 1 september: Artificial Analysis Intelligence Index v4.1.1, de Epoch Capabilities Index en METR's Time Horizon 1.1. De 4,4 maanden zijn geen rechtstreeks verschil tussen twee modellen op één benchmark, maar een berekening van Mozilla op basis van de taakduur die modellen betrouwbaar aankunnen.
Op de Epoch-index is de gemiddelde kloof acht punten, omgerekend ongeveer vier maanden. In de METR-benadering voert een gesloten model nu taken uit die acht tot twaalf uur menselijk werk vragen; open modellen bereiken die grens naar schatting vier maanden later. Onder acht uur kunnen beide modeltypen de taak aan, boven twaalf uur geen van beide betrouwbaar.
Dat maakt de claim bruikbaar als trendmeting, niet als belofte voor elke nieuwe release. De kloof begint bij iedere modelcyclus opnieuw. De rapportage van de benchmarkdatum is daarom net zo belangrijk als het getal zelf.
Prijs wint, maar niet overal
Kimi K3 staat in de Artificial Analysis-meting twee punten achter Anthropic's Fable 5, terwijl de prijs volgens het rapport ongeveer 30 procent bedraagt van die van het gesloten model. In een neutrale Terminal-Bench 2.1-evaluatie kwam het Chinese GLM-5.2 binnen één punt van Claude Opus 4.7 uit, bij ongeveer vijf keer lagere kosten per afgeronde taak, zo beschrijft Ars Technica de vergelijking.
De achterstand zit wel op precies de plekken waarvoor organisaties vaak extra betalen. Op GDPval-AA v2 leidt Fable 5 Kimi K3 met 92 Elo, bij professioneel kenniswerk. Ook lange context, hoogwaardige terugzoekopdrachten en de kant-en-klare combinatie van ondersteuning, compliance en aansprakelijkheid blijven sterke punten van gesloten aanbieders.
De praktische grens loopt daarmee niet tussen open en gesloten als twee kampen. Voor een korte, herhaalbare taak kan het prijsvoordeel zwaarder wegen dan een klein scoreverschil. Voor een opdracht met veel context, specialistische beoordeling of een harde deadline kan vier maanden voorsprong wel degelijk waarde hebben.
Open gewichten zijn nog geen eigen server
Het woord open vraagt extra precisie. Mozilla telt zestien opvallende open releases, maar geen daarvan levert volgens zijn analyse ook de volledige datareceptuur die de Open Source Initiative-definitie van open source vraagt. Open-weight betekent hier vooral dat de modelgewichten te downloaden zijn.
Zelfs dat is niet hetzelfde als eenvoudig self-hosted draaien. Tom's Hardware beschrijft een Kimi K3-configuratie met ongeveer 1,56 terabyte geheugen over 96 shards; de servingconfiguratie van Mozilla noemt 64 of meer accelerators. Op één GPU ligt de beste open score in de rapportgrafiek 23 punten onder de top. Voor de meeste Nederlandse organisaties betekent open daarom voorlopig een API of een gespecialiseerde hoster, niet een model dat op een bestaande bedrijfsserver draait.
Dat verandert ook de jurisdictiekeuze. Wie alleen een API afneemt, krijgt wel de prijs en de modelkeuze van open weights, maar houdt een leverancier nodig voor datalocatie, logging, support en toegang. Alleen wanneer de gewichten en de volledige servinglaag onder eigen beheer komen, wordt de afhankelijkheid van de uitgever technisch kleiner.
De survey van Mozilla en SlashData laat dezelfde uitvoeringskloof zien: open modellen komen twaalf procentpunten minder vaak in productie dan gesloten modellen. In West-Europa loopt gesloten gebruik zelfs nog voor. De bottleneck ligt bij modelkwaliteit én infrastructuur, beheer en integratie.
Inkoop wordt een portfolio
De eerdere Kimi K3-release van Moonshot met 2,8 biljoen parameters en een contextvenster van één miljoen tokens was al een concreet signaal dat open modellen het prijsdebat naar frontier-niveau trekken. Mozilla maakt daar nu een bredere meetreeks van: acht van de tien modellen met de meeste tokens op OpenRouter hadden in augustus open gewichten, waarvan zeven uit China kwamen.
Voor modelinkoop ontstaat daardoor een taakgerichte verdeling. Open modellen schuiven naar voren waar kosten, aanpasbaarheid of eigen beheer zwaar wegen. Gesloten modellen houden hun plaats waar professionele kwaliteit, lange context en geleverde waarborgen het verschil maken.
De viermaandenclaim maakt de premie voor een gesloten frontiermodel kleiner, maar wist de uitvoerings- en governancekosten van open AI niet uit. De echte verschuiving zit daarom niet in één nieuwe winnaar, maar in een markt waarin het model steeds vaker een vervangbaar onderdeel van de architectuur wordt.
Veelgestelde vragen
Modellen kiezen zonder lock-in
Ik help je de modelkeuze vertalen naar een systeem dat past bij je data, budget en gewenste hosting. Van meedenken en ontwerp tot realiseren en automatiseren bouw ik de keten end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
