Handen typen op een laptop op een houten tafel
Nieuws18 september · 16:264 min leestijd

Open modellen halen 56 procent van AI Gateway-tokens

Open-weight-modellen verwerken voor het eerst meer dan de helft van de tokens op Vercels AI Gateway. Toch gaat 64 procent van de uitgaven naar Anthropic, wat modelrouting tot een kostenkeuze maakt.

Vercel meldt dat open-weight-modellen in augustus 56 procent van alle AI Gateway-tokens verwerken, terwijl Anthropic 64 procent van de uitgaven behoudt.

Voor een Nederlandse ondernemer verschuift de rekensom daardoor van één modelabonnement naar routering per taak: goedkoop werk kan naar open modellen, terwijl complexe stappen bij een duurder model blijven. Dat verlaagt de gemiddelde tokenprijs, maar de leverancier met de zwaarste workloads houdt het grootste deel van de rekening. Modelkeuze raakt daarmee tegelijk AI-kosten en afhankelijkheid van één aanbieder.

Volume en uitgaven lopen uiteen

De maandindex van Vercel gaat over het verkeer dat AI Gateway tot en met augustus verwerkte. Het aandeel open-weight-modellen steeg van 7 procent in december 2025 naar 56 procent in augustus, de eerste maand waarin open modellen meer dan de helft van het tokenvolume draaiden. In juli stond de maandmeting nog op 36 procent.

Dat is een andere meeteenheid dan de losse dagmeting van 62 procent open tokenverkeer op 22 augustus. De nieuwe index maakt vooral zichtbaar dat de recorddag geen uitschieter op zichzelf was, maar onderdeel is van een oplopende maandtrend.

De uitgaven volgen die beweging veel minder snel. Open-weight-modellen verwerkten in augustus 56 procent van de tokens, maar waren goed voor 14 procent van de geschatte uitgaven. Die kloof ontstaat doordat open modellen doorgaans goedkoper zijn en vooral veel bulkwerk verwerken.

Lijngrafiek van Vercel met het aandeel open-weight-tokens en uitgaven tot augustus 2026, bron: Vercel
Lijngrafiek van Vercel met het aandeel open-weight-tokens en uitgaven tot augustus 2026, bron: Vercel

Anthropic houdt de dure laag

Anthropic incasseerde in augustus 64 cent van elke dollar die via AI Gateway aan modellen werd uitgegeven. Het aandeel van de maker van Claude kwam sinds december in geen enkele maand onder 61 procent en de modellen van het bedrijf bezetten telkens de eerste twee plekken op de uitgavenranglijst.

Binnen die positie verschuift de mix wel. Het aandeel van Fable 5 in de uitgaven daalde van 13,2 procent in juli naar 4,9 procent in augustus. Het goedkopere Opus 5 steeg tegelijk naar 22,5 procent. Negen op de tien teams die Fable gebruikten, verminderden hun gebruik; meer teams brachten dat werk onder bij Opus 5 dan bij een ander model.

Voor Anthropic betekent dat geen vertrek van dezelfde klanten, maar een overstap naar een goedkoper model binnen dezelfde catalogus. Voor een bedrijf dat meerdere modellen kan aanroepen, laat het zien dat routing meer is dan een technische laag. De route bepaalt welke taken tegen welk tarief blijven lopen.

De router wordt de kostenlaag

De gemiddelde prijs per token op AI Gateway daalde in augustus met 23,2 procent, de derde maand op rij. Bij teams die in juli en augustus meer dan 10 miljoen tokens verwerkten, lag de mediane prijs per token 7,6 procent lager.

Die daling maakt modelrouting relevant voor meer dan grote platformbedrijven. Een team dat classificatie, samenvattingen of achtergrondtaken naar passende open modellen verplaatst, krijgt meer verwerking voor hetzelfde budget. Het zware redeneerwerk kan intussen bij een duurder model blijven zonder dat elke eenvoudige taak die prijs meedraagt.

De meting is geen volledig marktaandeel. Vercel ziet alleen geanonimiseerd verkeer door zijn eigen gateway, niet de rechtstreekse API-aanroepen of het verkeer via andere cloudplatforms. Toch is de richting duidelijk: tokenvolume en uitgaven lopen steeds verder uit elkaar. Wie alleen naar volume kijkt, ziet open modellen al als meerderheid. Wie naar euro’s kijkt, ziet dat de duurste beslissingen nog sterk bij één lab liggen.

Daarmee verschuift de waarde van modelkeuze naar de laag die werk kan meten, verdelen en opnieuw routeren. Niet het goedkoopste model voor elke taak bepaalt de rekening, maar de combinatie van taak, model en route.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI-kosten slim verdelen

Ik help je modelkeuze vertalen naar een werkende AI-keten: van meedenken en ontwerp tot bouwen, koppelen en automatiseren. Waar het kan richt ik die omgeving self-hosted in, zodat je minder afhankelijk wordt van één leverancier.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Google laat engineers Claude Opus 5 gebruiken via Antigravity
Nieuws
4 min

15 sep 06:39

Google laat engineers Claude Opus 5 gebruiken via Antigravity

Google laat engineers Claude Opus 5 gebruiken voor intern codeerwerk via Antigravity, maar houdt Gemini als basis en begrenst het rivaliserende model met quota. De stap toont modelvrijheid binnen gecontroleerde grenzen, niet een algemene klantlancering.

Anthropic verlaagt cache reads van Claude Fable 5.1 met 75 procent
Nieuws
5 min

1 sep 22:09

Anthropic verlaagt cache reads van Claude Fable 5.1 met 75 procent

Anthropic maakt cache reads voor Claude Fable 5.1 75 procent goedkoper, naar 0,25 dollar per miljoen tokens. Het tokentarief zelf blijft gelijk, dus je besparing hangt af van hoeveel context je herleest.

AI-tokenindex zakt voor het eerst onder een dollar per miljoen tokens
Nieuws
5 min

1 sep 20:09

AI-tokenindex zakt voor het eerst onder een dollar per miljoen tokens

De verbruiksgewogen tokenindex van Silicon Data sloot op 97 dollarcent per miljoen tokens, 8,6 procent lager dan een week eerder. Op de prijslijsten van de labs staat een heel ander getal.

Anthropic geeft Claude Cowork een eigen browser in de desktop-app
Nieuws
4 min

27 aug 14:23

Anthropic geeft Claude Cowork een eigen browser in de desktop-app

Claude Cowork heeft sinds 26 augustus een eigen browser in de desktop-app, los van je tabbladen, bookmarks en wachtwoorden. Logins gaan er per site heen, bank, mail en single sign-on standaard niet.

Anthropic: biologiefilter stond elf maanden uit bij 133 miljoen contractorgesprekken
Nieuws
6 min

16 aug 10:08

Anthropic: biologiefilter stond elf maanden uit bij 133 miljoen contractorgesprekken

Elf maanden lang liep al het contractorverkeer bij Anthropic zonder blokkerende biologische classifiers: 50.000 ingehuurde krachten, 133 miljoen uitwisselingen. Eén interne vlag zette naast het blokkeren ook de logging van signalen uit.

Anthropic houdt sterker model binnen en tilt eigen misalignment-risico naar 'low'
Nieuws
6 min

16 aug 00:09

Anthropic houdt sterker model binnen en tilt eigen misalignment-risico naar 'low'

Anthropic houdt een intern model dat capabeler is dan Mythos 5 binnenshuis en tilt zijn eigen inschatting van catastrofaal misalignment-risico van very low naar low. Het rapport beschrijft ook twee eigen agentincidenten die buiten de monitoring vielen.