Vercel meldt dat open-weight-modellen in augustus 56 procent van alle AI Gateway-tokens verwerken, terwijl Anthropic 64 procent van de uitgaven behoudt.
Voor een Nederlandse ondernemer verschuift de rekensom daardoor van één modelabonnement naar routering per taak: goedkoop werk kan naar open modellen, terwijl complexe stappen bij een duurder model blijven. Dat verlaagt de gemiddelde tokenprijs, maar de leverancier met de zwaarste workloads houdt het grootste deel van de rekening. Modelkeuze raakt daarmee tegelijk AI-kosten en afhankelijkheid van één aanbieder.
Volume en uitgaven lopen uiteen
De maandindex van Vercel gaat over het verkeer dat AI Gateway tot en met augustus verwerkte. Het aandeel open-weight-modellen steeg van 7 procent in december 2025 naar 56 procent in augustus, de eerste maand waarin open modellen meer dan de helft van het tokenvolume draaiden. In juli stond de maandmeting nog op 36 procent.
Dat is een andere meeteenheid dan de losse dagmeting van 62 procent open tokenverkeer op 22 augustus. De nieuwe index maakt vooral zichtbaar dat de recorddag geen uitschieter op zichzelf was, maar onderdeel is van een oplopende maandtrend.
De uitgaven volgen die beweging veel minder snel. Open-weight-modellen verwerkten in augustus 56 procent van de tokens, maar waren goed voor 14 procent van de geschatte uitgaven. Die kloof ontstaat doordat open modellen doorgaans goedkoper zijn en vooral veel bulkwerk verwerken.

Anthropic houdt de dure laag
Anthropic incasseerde in augustus 64 cent van elke dollar die via AI Gateway aan modellen werd uitgegeven. Het aandeel van de maker van Claude kwam sinds december in geen enkele maand onder 61 procent en de modellen van het bedrijf bezetten telkens de eerste twee plekken op de uitgavenranglijst.
Binnen die positie verschuift de mix wel. Het aandeel van Fable 5 in de uitgaven daalde van 13,2 procent in juli naar 4,9 procent in augustus. Het goedkopere Opus 5 steeg tegelijk naar 22,5 procent. Negen op de tien teams die Fable gebruikten, verminderden hun gebruik; meer teams brachten dat werk onder bij Opus 5 dan bij een ander model.
Voor Anthropic betekent dat geen vertrek van dezelfde klanten, maar een overstap naar een goedkoper model binnen dezelfde catalogus. Voor een bedrijf dat meerdere modellen kan aanroepen, laat het zien dat routing meer is dan een technische laag. De route bepaalt welke taken tegen welk tarief blijven lopen.
De router wordt de kostenlaag
De gemiddelde prijs per token op AI Gateway daalde in augustus met 23,2 procent, de derde maand op rij. Bij teams die in juli en augustus meer dan 10 miljoen tokens verwerkten, lag de mediane prijs per token 7,6 procent lager.
Die daling maakt modelrouting relevant voor meer dan grote platformbedrijven. Een team dat classificatie, samenvattingen of achtergrondtaken naar passende open modellen verplaatst, krijgt meer verwerking voor hetzelfde budget. Het zware redeneerwerk kan intussen bij een duurder model blijven zonder dat elke eenvoudige taak die prijs meedraagt.
De meting is geen volledig marktaandeel. Vercel ziet alleen geanonimiseerd verkeer door zijn eigen gateway, niet de rechtstreekse API-aanroepen of het verkeer via andere cloudplatforms. Toch is de richting duidelijk: tokenvolume en uitgaven lopen steeds verder uit elkaar. Wie alleen naar volume kijkt, ziet open modellen al als meerderheid. Wie naar euro’s kijkt, ziet dat de duurste beslissingen nog sterk bij één lab liggen.
Daarmee verschuift de waarde van modelkeuze naar de laag die werk kan meten, verdelen en opnieuw routeren. Niet het goedkoopste model voor elke taak bepaalt de rekening, maar de combinatie van taak, model en route.
Veelgestelde vragen
AI-kosten slim verdelen
Ik help je modelkeuze vertalen naar een werkende AI-keten: van meedenken en ontwerp tot bouwen, koppelen en automatiseren. Waar het kan richt ik die omgeving self-hosted in, zodat je minder afhankelijk wordt van één leverancier.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
