DeepSeek verwerkte in juli een kwart van al het tokenverkeer op Vercels AI Gateway, ruim twee keer zoveel als Google, en de gemiddelde prijs per token daalde 13,6 procent, meldt Vercel.
Die daling komt niet doordat de labs hun prijslijsten hebben verlaagd. Vercel rekende voor dat de gemiddelde prijs vrijwel vlak zou zijn gebleven als bedrijven in juli dezelfde modelmix hadden aangeroepen als in juni. Het hele verschil zit in wat teams zelf routeren. Voor een Nederlands team met een AI-begroting is dat de kern: zakt jouw prijs per token niet mee, dan ligt dat aan je eigen modelkeuze en niet aan de markt.
Van minder dan 1 procent naar een kwart
In april liep bijna 40 procent van het tokenverkeer op de gateway naar Google en minder dan 1 procent naar DeepSeek. In juli draaide DeepSeek een kwart van het volume tegen 11 procent voor Google. In een maand tijd zakte Google van 24,0 naar 10,7 procent. Anthropic gaf twee punten prijs en bleef met 29,8 procent de grootste, OpenAI klom naar 12,8 procent.
Eén model draagt het grootste deel van die verschuiving. DeepSeek V4 Flash, het goedkoopste model van het lab, verwerkte in juli in zijn eentje meer tokens dan heel Google: bijna een vijfde van alles wat over de gateway ging, en 70 procent meer dan het eerstvolgende model. De omslag zit vooral in consumentgerichte toepassingen. Het aandeel van Google in de tokens van persoonlijke assistenten liep in een maand met meer dan de helft terug, en het grootste deel van wat Google daar verloor ging naar DeepSeek.

Drie maanden eerder zag die ranglijst er nog omgekeerd uit. In de mei-editie van dezelfde index stond Google op 38 procent van het aprilvolume en Anthropic op 26 procent, met OpenAI op 13 en xAI op 10 procent. DeepSeek werd in die uitsplitsing niet eens apart genoemd.
De prijsdaling zit in de routering, niet in de prijslijst
Bedrijven kochten in juli meer inferentie en draaiden meer daarvan op goedkope modellen. Het volume groeide 59 procent, de uitgaven groeiden 37 procent, en de gemiddelde prijs per token zakte 13,6 procent. In mei ging die prijs nog bijna 20 procent omhoog en in juni bleef hij vlak.
OpenAI laat zien hoe dat mechanisme werkt. De gemiddelde kosten van een OpenAI-token daalden tot 58 procent van het juniniveau, doordat 85 procent van het volume dat erbij kwam naar GPT-5-Nano ging, het goedkoopste model in de GPT-5-reeks.
Dat herschikken gebeurt breed. Van de duizenden teams die in beide maanden meer dan 10 miljoen tokens draaiden, veranderde drie op de vier minstens een tiende van de modelmix en drie op de vijf minstens een kwart. De mediane klant zag de kosten per token 2,9 procent dalen, maar slechts een op de zes bleef binnen vijf procent van waar hij begon. Een kwart sneed er meer dan 30 procent af, meestal teams die boven het gemiddelde betaalden. Een ander kwart ging juist minstens 20 procent meer betalen.
Het geld gaat nog altijd naar Anthropic
Anthropic incasseerde 65,1 procent van alle uitgaven op de gateway, op 30 procent van het volume. De gemiddelde prijs van een Anthropic-token lag 4,4 keer boven het gemiddelde van alle andere labs samen, tegen 3,4 keer in juni. In codeeragenten, de grootste werkstroom van de gateway gemeten in tokens, ging meer dan vier van elke vijf dollar naar Anthropic, terwijl DeepSeek er bijna een derde van het volume draaide.
Het prijsverschil per laag verklaart waarom die twee ranglijsten uit elkaar lopen. Haiku 4.5, het goedkoopste model van Anthropic, kost ruim tweederde van de gemiddelde tokenprijs op de gateway. GPT-5-Nano kost een zesde van dat gemiddelde en DeepSeek V4 Flash een zestiende. Wie op OpenAI of Google wil besparen, blijft binnen dezelfde catalogus. Wie op Anthropic wil besparen, moet Anthropic verlaten.
Ook de open modellen schoven op. Hun aandeel in het volume ging van 11 procent in april en 29 procent in juni naar 36 procent in juli, en hun aandeel in de uitgaven verdubbelde ruim naar 8,6 procent, het hoogste in de geschiedenis van de index. Ruim 90 procent van die groei komt van Moonshot en Z.ai, met Kimi K3 en GLM 5.2: volgens Vercel de eerste open modellen die een serieus deel van het werk overnemen dat tot nu toe bij gesloten labs lag. Het gezamenlijke aandeel van de vier grootste frontier-labs in de uitgaven zakte daardoor naar 89 procent, na zeven maanden waarin het nooit onder 93 procent kwam.
Hetzelfde beeld tekende zich eerder al af op het andere grote routeringsplatform. Op OpenRouter bezetten Chinese modellen acht van de tien drukste plekken, met Anthropic als enige Amerikaanse aanbieder in de top tien.
Wat deze index niet meet
De cijfers komen van één platform. Vercel meet geanonimiseerd routeringsverkeer van de eigen AI Gateway, waardeert elk verzoek tegen de gepubliceerde lijstprijs van het lab en tekent er zelf bij aan dat eerdere maanden bij methodewijzigingen worden herzien. Wie via Azure, Bedrock of een directe koppeling met een lab werkt, zit niet in deze steekproef. Het is een maandindex van één gateway, geen marktaandeel.
De prijsdaling leunt bovendien op een aanbieder die zijn eigen tarieven al heeft aangekondigd te verhogen. DeepSeek zette begin augustus in een voetnoot bij zijn prijstabel dat een brede verhoging van de API-tarieven eraan komt, zonder bedrag of ingangsdatum. Die aankondiging valt buiten de julidata. In de prijslijst is er nog niets van te zien: DeepSeek-V4-Pro kwam deze week uit preview tegen dezelfde 0,435 en 0,87 dollar per miljoen in- en uitvoertokens als in de previewperiode.
Wat de index vooral laat zien, is hoe snel de onderkant van de markt kantelt. 81 procent van de tokens in juli liep op modellen die een halfjaar eerder nog niet op de gateway stonden, en overstappen kost op zo'n platform één regel code. Tegelijk hield Anthropic twee van elke drie dollars vast, dus de prijsconcurrentie speelt zich af in het deel van de markt waar het minste geld omgaat. Modelkeuze is daarmee geen beslissing die je één keer neemt, maar een begrotingspost die maandelijks opnieuw geprijsd wordt. En een lagere prijs per token is niet hetzelfde als een lagere rekening: de uitgaven op de gateway liggen 74 procent hoger dan in mei, terwijl elke dollar meer tokens koopt. Dat is precies het patroon dat eerder zichtbaar werd bij AI-agenten die de tokenrekening opdrijven terwijl de prijs per token al jaren daalt.
Veelgestelde vragen
Slimmer routeren, lagere rekening
Ik help je je AI-opstelling zo inrichten dat elke taak naar het model gaat dat er echt voor nodig is, van meedenken over de keuze tot het bouwen en automatiseren ervan. Self-hosted waar dat kan, zodat je niet aan één aanbieder vastzit.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
