Rijen groene printplaten met chips in een rek, met een zwarte kabel die naar de voorste kaart loopt.
Nieuws24 augustus · 02:115 min leestijd

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.

Open-weight modellen verwerkten op 22 augustus 62 procent van alle tokens op Vercels AI Gateway, tegen 28,4 procent op 24 juni, meldt Vercel-topman Guillermo Rauch.

Voor een Nederlands team met een oplopende AI-rekening verschuift daarmee de vraag. Niet langer of open modellen het productiewerk aankunnen, maar welk deel van het eigen verkeer meeverhuist en wat dat oplevert. AT&T haalde met een modelrouter en open modellen tot 56 procent van de kosten van codeer- en andere geavanceerde AI-taken weg, en op een gateway is het omleggen van een route zelden meer dan een regel configuratie.

Van 36 procent in juli naar 62 procent op één dag

De maandelijkse index van dezelfde gateway staat een stuk lager. Open-weight modellen gingen daarin van 11 procent van het tokenvolume in april naar 29 procent in juni en 36 procent in juli. Dat cijfer en de 62 procent van 22 augustus meten alleen niet hetzelfde. De index telt uitsluitend vier open-weight labs mee die hun eigen modellen op schaal serveren: DeepSeek, MiniMax, Moonshot en Z.ai. Het dagelijkse dashboard telt elk model waarvan de gewichten te downloaden zijn.

Dat verschil verklaart een flink deel van de sprong. Step 3.7 Flash van het Chinese StepFun stond op 23 augustus op 16,9 procent van alle tokens, het op een na grootste model op de gateway. Het is een model van 198 miljard parameters dat er ongeveer 11 miljard per token activeert en dat onder de Apache 2.0-licentie te downloaden is, maar binnen de vier labs die de maandindex telt valt het buiten de meting.

Ook zonder dat verschil beweegt de onderkant hard. DeepSeek V4 Flash was op 23 augustus met 18,7 procent het grootste model op de gateway. Een maand eerder draaide DeepSeek een kwart van het julivolume en zakte Google in één maand van 24,0 naar 10,7 procent. Op zondag 23 augustus stond de teller op het dashboard op 60,7 procent open tegen 39,3 procent gesloten, een dag na de recordstand.

Het volume verschuift, de rekening nog niet

Op de uitgavenlijst ziet dezelfde gateway er omgekeerd uit. Claude Opus 5 nam op 23 augustus 30,6 procent van alle uitgaven voor zijn rekening en Claude Opus 4.8 nog eens 15,2 procent, terwijl die twee samen 11,1 procent van de tokens draaiden. DeepSeek V4 Flash en Step 3.7 Flash, samen goed voor ruim 35 procent van het volume, halen de top tien van de uitgaven niet.

Dat patroon zat al in de maandcijfers. Open-weight modellen kwamen in juli op 36 procent van het volume en op 8,6 procent van de uitgaven, het hoogste in de geschiedenis van de index en nog altijd geen negen cent van elke dollar. Anthropic hield 65,1 procent van alle uitgaven vast op 30 procent van het volume.

Lijndiagram van Vercel met het open-weight aandeel in tokens en in uitgaven op de AI Gateway van april tot en met juli 2026. De tokenlijn klimt van 11 naar 36 procent terwijl de uitgavenlijn onder de 9 procent blijft. Bron: Vercel
Lijndiagram van Vercel met het open-weight aandeel in tokens en in uitgaven op de AI Gateway van april tot en met juli 2026. De tokenlijn klimt van 11 naar 36 procent terwijl de uitgavenlijn onder de 9 procent blijft. Bron: Vercel

Het verschil zit in waar de dure tokens zitten. In codeeragenten, de grootste werkstroom op de gateway gemeten in tokens, incasseerde Anthropic in juli meer dan 80 procent van de uitgaven, terwijl DeepSeek er bijna een derde van het volume draaide. Bulkwerk, classificatie en achtergrondtaken verhuizen als eerste; de zwaarste redeneerstappen blijven voorlopig staan waar ze stonden.

Aandeel in tokenvolume tegenover aandeel in uitgaven op de Vercel AI Gateway, 23 augustus 2026 (bron: Vercel AI Gateway leaderboard, CC BY 4.0)

Waar teams de overstap al maken

Het routeren zelf is inmiddels een product. Router.com van het Amerikaanse Ramp stuurt elk verzoek naar het goedkoopste model dat de taak nog aankan en scheelt klanten gemiddeld 40 procent op hun inferentiekosten, voorlopig alleen in de Verenigde Staten.

Rauch tekent bij zijn eigen cijfer aan dat de zakelijke markt hier nog vroeg in zit en dat harnassen, CLI's, IDE's en SDK's nog modelonafhankelijk gemaakt moeten worden. Daar zit het echte werk voor een team dat wil verhuizen: niet in het model, maar in de laag eromheen die nu nog aan één aanbieder vastzit.

Wat één recorddag niet zegt

De cijfers komen van één platform. Vercel meet geanonimiseerd routeringsverkeer van de eigen AI Gateway, dagelijks geaggregeerd en gepubliceerd onder CC BY 4.0, waardeert verzoeken tegen de lijstprijzen van de labs en ziet geen verkeer dat via Azure, Bedrock of een directe koppeling loopt.

De recordstand viel bovendien op een zaterdag, wanneer het verkeer meer naar experimenteren neigt dan naar productie, en het is nog geen cijfer uit een gepubliceerde maandindex. Een dag later stond de teller al 1,3 punt lager.

Vrijwel alle modellen die de verschuiving dragen komen uit Chinese labs. Dat open gewichten uit Beijing hun eigen jurisdictie- en leveranciersrisico meebrengen verdwijnt niet doordat een model gratis te downloaden is.

Wat de recorddag markeert, is niet dat open modellen goedkoper zijn; dat waren ze al. Het is dat ze het werk aankunnen waarvoor tot voor kort automatisch een gesloten model werd aangeroepen. In juli noemde Vercel GLM 5.2 en Kimi K3 de eerste open modellen die een serieus deel van dat werk overnemen; op 22 augustus liep bijna twee van elke drie tokens over open gewichten. De prijs per token daalt daardoor sneller dan de rekening zelf, want het goedkoop te verplaatsen deel van de mix gaat als eerste en het dure deel blijft staan. Een AI-begroting die niet meebeweegt, wijst daarmee eerder op de eigen routeringstabel dan op de markt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Slimmer routeren, lagere AI-rekening

Ik zoek met je uit welk deel van je AI-verkeer naar een open model kan en bouw de routering en de laag eromheen, van meedenken en ontwerp tot realiseren en automatiseren. Self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

DeepSeek passeert Google in tokenvolume, prijs per token daalt 13,6 procent
Nieuws
5

13 aug 08:33

DeepSeek passeert Google in tokenvolume, prijs per token daalt 13,6 procent

DeepSeek verwerkte in juli een kwart van het tokenverkeer op Vercels AI Gateway en passeerde daarmee Google, terwijl de gemiddelde prijs per token 13,6 procent daalde. Die daling komt volledig uit de modelkeuze van bedrijven zelf.

Chinese AI-ontwikkelaars publiceren testresultaten bij 3,6% van modelreleases
Nieuws
5 min

9 okt 16:17

Chinese AI-ontwikkelaars publiceren testresultaten bij 3,6% van modelreleases

Een telling van negen Chinese AI-aanbieders vond bij 31 van 857 releases een gepubliceerde testuitslag per modelversie. Het cijfer gaat over openbare documentatie, niet over alle interne tests.

DeepSeek voert Vercels AI Gateway-ranglijst aan
Nieuws
2 min

26 sep 09:47

DeepSeek voert Vercels AI Gateway-ranglijst aan

DeepSeek is goed voor 25,4 procent van OpenRouters tekstverzoeken. Op Vercels AI Gateway verwerkt DeepSeek V4.1 Flash 51,7 procent van het tokenvolume. Beide ranglijsten meten alleen hun eigen platform.

Moonshot dient vertrouwelijk beursaanvraag in Hongkong in voor 3 miljard dollar
Nieuws
4 min

3 sep 14:24

Moonshot dient vertrouwelijk beursaanvraag in Hongkong in voor 3 miljard dollar

Moonshot heeft volgens drie ingewijden bij Reuters vertrouwelijk een beursaanvraag in Hongkong ingediend voor 3 miljard dollar. Voor de aanvraag brak het lab zijn buitenlandse structuur af en vestigde het zich in China.

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager
Nieuws
5 min

15 aug 06:10

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager

Klanten van OpenAI en Anthropic betalen sinds midden juli bijna een kwart minder per miljoen tokens. Anthropic schrapte bovendien een verhoging die op 1 september zou ingaan, terwijl de topmodellen onveranderd duur blijven.

Bolt.new lanceert Forge met open modellen en 50x gebruik
Nieuws
3 min

14 sep 20:42

Bolt.new lanceert Forge met open modellen en 50x gebruik

Bolt.new lanceert Forge, een agent op open modellen met voor individuele Pro-abonnees tot 14 oktober vijftig keer meer gebruik. De ruil: opt-in voor geanonimiseerde bouwsessies die open modellen helpen trainen.