Open-weight modellen verwerkten op 22 augustus 62 procent van alle tokens op Vercels AI Gateway, tegen 28,4 procent op 24 juni, meldt Vercel-topman Guillermo Rauch.
Voor een Nederlands team met een oplopende AI-rekening verschuift daarmee de vraag. Niet langer of open modellen het productiewerk aankunnen, maar welk deel van het eigen verkeer meeverhuist en wat dat oplevert. AT&T haalde met een modelrouter en open modellen tot 56 procent van de kosten van codeer- en andere geavanceerde AI-taken weg, en op een gateway is het omleggen van een route zelden meer dan een regel configuratie.
Van 36 procent in juli naar 62 procent op één dag
De maandelijkse index van dezelfde gateway staat een stuk lager. Open-weight modellen gingen daarin van 11 procent van het tokenvolume in april naar 29 procent in juni en 36 procent in juli. Dat cijfer en de 62 procent van 22 augustus meten alleen niet hetzelfde. De index telt uitsluitend vier open-weight labs mee die hun eigen modellen op schaal serveren: DeepSeek, MiniMax, Moonshot en Z.ai. Het dagelijkse dashboard telt elk model waarvan de gewichten te downloaden zijn.
Dat verschil verklaart een flink deel van de sprong. Step 3.7 Flash van het Chinese StepFun stond op 23 augustus op 16,9 procent van alle tokens, het op een na grootste model op de gateway. Het is een model van 198 miljard parameters dat er ongeveer 11 miljard per token activeert en dat onder de Apache 2.0-licentie te downloaden is, maar binnen de vier labs die de maandindex telt valt het buiten de meting.
Ook zonder dat verschil beweegt de onderkant hard. DeepSeek V4 Flash was op 23 augustus met 18,7 procent het grootste model op de gateway. Een maand eerder draaide DeepSeek een kwart van het julivolume en zakte Google in één maand van 24,0 naar 10,7 procent. Op zondag 23 augustus stond de teller op het dashboard op 60,7 procent open tegen 39,3 procent gesloten, een dag na de recordstand.
Het volume verschuift, de rekening nog niet
Op de uitgavenlijst ziet dezelfde gateway er omgekeerd uit. Claude Opus 5 nam op 23 augustus 30,6 procent van alle uitgaven voor zijn rekening en Claude Opus 4.8 nog eens 15,2 procent, terwijl die twee samen 11,1 procent van de tokens draaiden. DeepSeek V4 Flash en Step 3.7 Flash, samen goed voor ruim 35 procent van het volume, halen de top tien van de uitgaven niet.
Dat patroon zat al in de maandcijfers. Open-weight modellen kwamen in juli op 36 procent van het volume en op 8,6 procent van de uitgaven, het hoogste in de geschiedenis van de index en nog altijd geen negen cent van elke dollar. Anthropic hield 65,1 procent van alle uitgaven vast op 30 procent van het volume.

Het verschil zit in waar de dure tokens zitten. In codeeragenten, de grootste werkstroom op de gateway gemeten in tokens, incasseerde Anthropic in juli meer dan 80 procent van de uitgaven, terwijl DeepSeek er bijna een derde van het volume draaide. Bulkwerk, classificatie en achtergrondtaken verhuizen als eerste; de zwaarste redeneerstappen blijven voorlopig staan waar ze stonden.
Waar teams de overstap al maken
Het routeren zelf is inmiddels een product. Router.com van het Amerikaanse Ramp stuurt elk verzoek naar het goedkoopste model dat de taak nog aankan en scheelt klanten gemiddeld 40 procent op hun inferentiekosten, voorlopig alleen in de Verenigde Staten.
Rauch tekent bij zijn eigen cijfer aan dat de zakelijke markt hier nog vroeg in zit en dat harnassen, CLI's, IDE's en SDK's nog modelonafhankelijk gemaakt moeten worden. Daar zit het echte werk voor een team dat wil verhuizen: niet in het model, maar in de laag eromheen die nu nog aan één aanbieder vastzit.
Wat één recorddag niet zegt
De cijfers komen van één platform. Vercel meet geanonimiseerd routeringsverkeer van de eigen AI Gateway, dagelijks geaggregeerd en gepubliceerd onder CC BY 4.0, waardeert verzoeken tegen de lijstprijzen van de labs en ziet geen verkeer dat via Azure, Bedrock of een directe koppeling loopt.
De recordstand viel bovendien op een zaterdag, wanneer het verkeer meer naar experimenteren neigt dan naar productie, en het is nog geen cijfer uit een gepubliceerde maandindex. Een dag later stond de teller al 1,3 punt lager.
Vrijwel alle modellen die de verschuiving dragen komen uit Chinese labs. Dat open gewichten uit Beijing hun eigen jurisdictie- en leveranciersrisico meebrengen verdwijnt niet doordat een model gratis te downloaden is.
Wat de recorddag markeert, is niet dat open modellen goedkoper zijn; dat waren ze al. Het is dat ze het werk aankunnen waarvoor tot voor kort automatisch een gesloten model werd aangeroepen. In juli noemde Vercel GLM 5.2 en Kimi K3 de eerste open modellen die een serieus deel van dat werk overnemen; op 22 augustus liep bijna twee van elke drie tokens over open gewichten. De prijs per token daalt daardoor sneller dan de rekening zelf, want het goedkoop te verplaatsen deel van de mix gaat als eerste en het dure deel blijft staan. Een AI-begroting die niet meebeweegt, wijst daarmee eerder op de eigen routeringstabel dan op de markt.
Veelgestelde vragen
Slimmer routeren, lagere AI-rekening
Ik zoek met je uit welk deel van je AI-verkeer naar een open model kan en bouw de routering en de laag eromheen, van meedenken en ontwerp tot realiseren en automatiseren. Self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
