Rijen groene printplaten met chips in een rek, met een zwarte kabel die naar de voorste kaart loopt.
Nieuws24 augustus · 02:115 min leestijd

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.

Open-weight modellen verwerkten op 22 augustus 62 procent van alle tokens op Vercels AI Gateway, tegen 28,4 procent op 24 juni, meldt Vercel-topman Guillermo Rauch.

Voor een Nederlands team met een oplopende AI-rekening verschuift daarmee de vraag. Niet langer of open modellen het productiewerk aankunnen, maar welk deel van het eigen verkeer meeverhuist en wat dat oplevert. AT&T haalde met een modelrouter en open modellen tot 56 procent van de kosten van codeer- en andere geavanceerde AI-taken weg, en op een gateway is het omleggen van een route zelden meer dan een regel configuratie.

Van 36 procent in juli naar 62 procent op één dag

De maandelijkse index van dezelfde gateway staat een stuk lager. Open-weight modellen gingen daarin van 11 procent van het tokenvolume in april naar 29 procent in juni en 36 procent in juli. Dat cijfer en de 62 procent van 22 augustus meten alleen niet hetzelfde. De index telt uitsluitend vier open-weight labs mee die hun eigen modellen op schaal serveren: DeepSeek, MiniMax, Moonshot en Z.ai. Het dagelijkse dashboard telt elk model waarvan de gewichten te downloaden zijn.

Dat verschil verklaart een flink deel van de sprong. Step 3.7 Flash van het Chinese StepFun stond op 23 augustus op 16,9 procent van alle tokens, het op een na grootste model op de gateway. Het is een model van 198 miljard parameters dat er ongeveer 11 miljard per token activeert en dat onder de Apache 2.0-licentie te downloaden is, maar binnen de vier labs die de maandindex telt valt het buiten de meting.

Ook zonder dat verschil beweegt de onderkant hard. DeepSeek V4 Flash was op 23 augustus met 18,7 procent het grootste model op de gateway. Een maand eerder draaide DeepSeek een kwart van het julivolume en zakte Google in één maand van 24,0 naar 10,7 procent. Op zondag 23 augustus stond de teller op het dashboard op 60,7 procent open tegen 39,3 procent gesloten, een dag na de recordstand.

Het volume verschuift, de rekening nog niet

Op de uitgavenlijst ziet dezelfde gateway er omgekeerd uit. Claude Opus 5 nam op 23 augustus 30,6 procent van alle uitgaven voor zijn rekening en Claude Opus 4.8 nog eens 15,2 procent, terwijl die twee samen 11,1 procent van de tokens draaiden. DeepSeek V4 Flash en Step 3.7 Flash, samen goed voor ruim 35 procent van het volume, halen de top tien van de uitgaven niet.

Dat patroon zat al in de maandcijfers. Open-weight modellen kwamen in juli op 36 procent van het volume en op 8,6 procent van de uitgaven, het hoogste in de geschiedenis van de index en nog altijd geen negen cent van elke dollar. Anthropic hield 65,1 procent van alle uitgaven vast op 30 procent van het volume.

Lijndiagram van Vercel met het open-weight aandeel in tokens en in uitgaven op de AI Gateway van april tot en met juli 2026. De tokenlijn klimt van 11 naar 36 procent terwijl de uitgavenlijn onder de 9 procent blijft. Bron: Vercel
Lijndiagram van Vercel met het open-weight aandeel in tokens en in uitgaven op de AI Gateway van april tot en met juli 2026. De tokenlijn klimt van 11 naar 36 procent terwijl de uitgavenlijn onder de 9 procent blijft. Bron: Vercel

Het verschil zit in waar de dure tokens zitten. In codeeragenten, de grootste werkstroom op de gateway gemeten in tokens, incasseerde Anthropic in juli meer dan 80 procent van de uitgaven, terwijl DeepSeek er bijna een derde van het volume draaide. Bulkwerk, classificatie en achtergrondtaken verhuizen als eerste; de zwaarste redeneerstappen blijven voorlopig staan waar ze stonden.

Aandeel in tokenvolume tegenover aandeel in uitgaven op de Vercel AI Gateway, 23 augustus 2026 (bron: Vercel AI Gateway leaderboard, CC BY 4.0)

Waar teams de overstap al maken

Het routeren zelf is inmiddels een product. Router.com van het Amerikaanse Ramp stuurt elk verzoek naar het goedkoopste model dat de taak nog aankan en scheelt klanten gemiddeld 40 procent op hun inferentiekosten, voorlopig alleen in de Verenigde Staten.

Rauch tekent bij zijn eigen cijfer aan dat de zakelijke markt hier nog vroeg in zit en dat harnassen, CLI's, IDE's en SDK's nog modelonafhankelijk gemaakt moeten worden. Daar zit het echte werk voor een team dat wil verhuizen: niet in het model, maar in de laag eromheen die nu nog aan één aanbieder vastzit.

Wat één recorddag niet zegt

De cijfers komen van één platform. Vercel meet geanonimiseerd routeringsverkeer van de eigen AI Gateway, dagelijks geaggregeerd en gepubliceerd onder CC BY 4.0, waardeert verzoeken tegen de lijstprijzen van de labs en ziet geen verkeer dat via Azure, Bedrock of een directe koppeling loopt.

De recordstand viel bovendien op een zaterdag, wanneer het verkeer meer naar experimenteren neigt dan naar productie, en het is nog geen cijfer uit een gepubliceerde maandindex. Een dag later stond de teller al 1,3 punt lager.

Vrijwel alle modellen die de verschuiving dragen komen uit Chinese labs. Dat open gewichten uit Beijing hun eigen jurisdictie- en leveranciersrisico meebrengen verdwijnt niet doordat een model gratis te downloaden is.

Wat de recorddag markeert, is niet dat open modellen goedkoper zijn; dat waren ze al. Het is dat ze het werk aankunnen waarvoor tot voor kort automatisch een gesloten model werd aangeroepen. In juli noemde Vercel GLM 5.2 en Kimi K3 de eerste open modellen die een serieus deel van dat werk overnemen; op 22 augustus liep bijna twee van elke drie tokens over open gewichten. De prijs per token daalt daardoor sneller dan de rekening zelf, want het goedkoop te verplaatsen deel van de mix gaat als eerste en het dure deel blijft staan. Een AI-begroting die niet meebeweegt, wijst daarmee eerder op de eigen routeringstabel dan op de markt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Slimmer routeren, lagere AI-rekening

Ik zoek met je uit welk deel van je AI-verkeer naar een open model kan en bouw de routering en de laag eromheen, van meedenken en ontwerp tot realiseren en automatiseren. Self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

DeepSeek passeert Google in tokenvolume, prijs per token daalt 13,6 procent
Nieuws
5

13 aug 08:33

DeepSeek passeert Google in tokenvolume, prijs per token daalt 13,6 procent

DeepSeek verwerkte in juli een kwart van het tokenverkeer op Vercels AI Gateway en passeerde daarmee Google, terwijl de gemiddelde prijs per token 13,6 procent daalde. Die daling komt volledig uit de modelkeuze van bedrijven zelf.

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager
Nieuws
5 min

15 aug 06:10

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager

Klanten van OpenAI en Anthropic betalen sinds midden juli bijna een kwart minder per miljoen tokens. Anthropic schrapte bovendien een verhoging die op 1 september zou ingaan, terwijl de topmodellen onveranderd duur blijven.

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag
Signaal
7 min

27 jul 12:04

Washington, Beijing en Stripe grijpen alledrie naar dezelfde laag

In tien dagen greep iedereen naar dezelfde laag in de AI-keten, en dat was niet het model. Het schaarse goed blijkt de capaciteit om een model te serveren, en daar verschuift de macht nu naartoe.

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur
Nieuws
4 min

27 jul 08:15

Moonshot publiceert de gewichten van Kimi K3 vandaag om 17.00 uur

Moonshot zet de gewichten van Kimi K3 vandaag om 17.00 uur op Hugging Face. Wat er dan vrijkomt, waarom de licentie nog ontbreekt en hoeveel hardware zelf draaien echt vraagt.

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld
Nieuws
4 min

18 jul 06:11

Moonshot lanceert Kimi K3, het grootste open AI-model ter wereld

Moonshot AI bracht Kimi K3 uit, met 2,8 biljoen parameters het grootste open-weight model ter wereld. De benchmarks zetten het vlak achter Claude en GPT, tegen een fractie van de prijs.

China evenaart Anthropic in cybersecurity: Z.ai vindt kwetsbaarheden net zo goed als Mythos
Nieuws
4 min

28 jun 14:37

China evenaart Anthropic in cybersecurity: Z.ai vindt kwetsbaarheden net zo goed als Mythos

Volgens het Wall Street Journal evenaart een nieuw Chinees model van Z.ai de Amerikaanse top in het vinden van beveiligingslekken. Dat zet vraagtekens bij het nut van de exportrem op AI.