Amerikaanse AI-labs verlagen hun tarieven zo snel dat klanten sinds midden juli bijna een kwart minder per miljoen tokens betalen, meldt de Financial Times op basis van de tokenprijsindex van Silicon Data.
Dat verandert de aard van een daling die Nederlandse teams al maanden op hun AI-rekening zien. Tot nu toe zakte de prijs per token vooral doordat teams zelf naar goedkopere modellen routeerden. Nu bewegen de prijslijsten zelf, en Anthropic haalde deze week een verhoging van tafel die op 1 september zou ingaan. Wie zijn AI-budget voor het najaar daarop had opgehoogd, kan die post terugdraaien. Wie een volumeafspraak of een jaarcontract heeft lopen, onderhandelt vanaf nu tegen een markt die een maand geleden nog een kwart duurder was.
Wat er precies goedkoper werd
De verlagingen raken de middenklasse van beide catalogi. OpenAI bracht op 30 juli GPT-5.6 Luna van 1 naar 0,20 dollar per miljoen invoertokens en van 6 naar 1,20 dollar per miljoen uitvoertokens, een verlaging van 80 procent, terwijl topmodel Sol op 5 en 30 dollar bleef staan.
Anthropic prijsde Claude Opus 5 op 5 dollar invoer en 25 dollar uitvoer per miljoen tokens, exact de helft van Fable 5, dat op 10 en 50 dollar staat. Deze week trok het bedrijf daarnaast een aangekondigde verhoging in. Sonnet 5 kwam in juni uit met een introductietarief van 2 en 10 dollar dat tot en met 31 augustus zou gelden, waarna 3 en 15 dollar zou ingaan. In de eigen prijsdocumentatie staat nu dat dat introductietarief de standaardprijs is geworden en de verhoging per 1 september niet doorgaat.
De index meet wat klanten betalen, niet de prijslijst
Silicon Data telt niet simpelweg de tarieven op een prijspagina op. De index publiceert dagelijks een genormaliseerd gemengd tarief dat de werkelijke kostprijs van inferentie weergeeft en niet de lijstprijs van één aanbieder, gecorrigeerd voor de verhouding tussen invoer- en uitvoertokens, de lengte van het contextvenster, batching en betrouwbaarheid. De weging volgt waar het gebruik zich concentreert: twintig modellen in de dagelijkse mand, geput uit ruim vierhonderd gevolgde modellen en meer dan twintig prijs- en volumebronnen, samen naar eigen zeggen goed voor meer dan 90 procent van de wereldwijde uitgaven aan inferentie.
Die opzet verklaart waarom dit cijfer hoger uitvalt dan wat routeringsplatforms meten. Op Vercels AI Gateway daalde de gemiddelde prijs per token in juli 13,6 procent, volledig doordat teams hun eigen modelmix verschoven en niet doordat de labs hun tarieven aanpasten. Die index rekent elk verzoek af tegen de gepubliceerde lijstprijs, dus prijsrondes van de labs zelf vallen er per definitie buiten. Bij Silicon Data tellen beide bewegingen mee: goedkoper routeren én goedkopere tarieven.
De onderkant zakt, de top wordt verdedigd
Aan de bovenkant gebeurt het omgekeerde. Fable 5 staat onveranderd op 10 en 50 dollar, en de Fast mode van Opus 5 kost per token evenveel als dat topmodel. Mantas Lukauskas, AI tech lead bij hostingbedrijf Hostinger, noemt de prijzen voor de allerbeste modellen vlak tot stijgend en ziet deze ronde als de eerste echte test of de labs hun duurste laag kunnen beschermen. Zijn samenvatting: de Amerikaanse labs hebben het midden weggesneden en verdedigen de top.
Een lager tokentarief is bovendien niet hetzelfde als lagere kosten per taak. Een sterker model rondt dezelfde opdracht soms af met minder tokens of minder pogingen, en vrijwel elk model draait op verschillende effort-standen die het verbruik fors laten schommelen. Benchmarkpartij Artificial Analysis zet Opus 5 op zijn hoogste effort-stand op 63 punten in zijn intelligentie-index tegen 60 voor Kimi K3 van het Chinese Moonshot, bij een gemengd tarief van 3,85 tegen 2,31 dollar per miljoen tokens. Dezelfde metingen, aangehaald door de Financial Times, laten zien dat Opus 5 op de stand medium qua prestatie en kosten per taak in de buurt van Kimi K3 op maximale stand komt, en dat GPT-5.6 Luna op maximale stand vergelijkbaar presteert met DeepSeek V4 Flash maar per taak bijna twee keer zoveel kost.
Waarom de labs nu bewegen
De directe aanleiding zijn Chinese open modellen, die vrij te downloaden en aan te passen zijn en waarvan de prestatiekloof met de Amerikaanse top smal is geworden. DoorDash en Airbnb hebben allebei gezegd dat ze Chinese modellen zijn gaan inzetten om hun rekening te drukken. Op de routeringsplatforms was dat patroon al eerder zichtbaar: op OpenRouter bezetten Chinese modellen acht van de tien drukste plekken, met Anthropic als enige Amerikaanse aanbieder in de top tien.
Tegelijk schuiven Anthropic en OpenAI een deel van hun zakelijke klanten van een vast abonnement naar afrekenen per verbruik, waarbij de rekening meebeweegt met de rekenkracht die je aanspreekt. Een deel van die bedrijven reageerde op de oplopende kosten met een plafond op het AI-gebruik of met een proef op goedkopere alternatieven. Dat alles speelt terwijl beide labs een beursgang bij een waardering rond een biljoen dollar voorbereiden en investeerders voor Anthropic zelfs op 2 biljoen dollar rekenen. Aan Chinese kant loopt de beweging niet één kant op: DeepSeek voerde een piekuurtarief in dat het standaardtarief verviervoudigt, al blijft het daarmee onder de Amerikaanse concurrentie.
Beide labs wilden tegenover de Financial Times niet reageren. Een ingewijde bij Anthropic zei dat Opus 5 onder Fable 5 geprijsd staat omdat de modelfamilie nu eenmaal zo is opgebouwd, zonder verband met wat concurrenten doen.
Waar de korting landt
De verschuiving zit niet in de korting zelf maar in waar hij neerkomt. De concurrentie tussen de labs gaat allang niet meer over welk model het slimst is, maar over wat een afgeronde taak kost, en dat gevecht wordt uitgevochten in de middenlaag. De duurste modellen staan precies waar ze stonden.
Voor wie de factuur betaalt, betekent dat twee dingen tegelijk. De onderhandelingsruimte is echt, maar ze zit op de regels waar per token het minste geld omgaat, terwijl de zwaarste modellen de rekening blijven bepalen. En goedkoper per token blijft iets anders dan goedkoper in totaal: op de Vercel-gateway lagen de uitgaven in juli 74 procent boven het niveau van mei, juist omdat elke dollar meer tokens kocht. Agentprocessen jagen het tokenverbruik omhoog terwijl de prijs per token al jaren daalt, en die twee krachten trekken nog altijd aan hetzelfde budget.
Veelgestelde vragen
Grip op je AI-kosten
Een tariefronde levert pas iets op als je systeem per stap een ander model kan aanwijzen. Ik denk mee over die opzet, ontwerp hem en bouw hem ook, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
