Rode kortingsborden met 50 procent en 30 procent boven de kledingtafels in een winkel.
Nieuws15 augustus · 06:105 min leestijd

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager

Klanten van OpenAI en Anthropic betalen sinds midden juli bijna een kwart minder per miljoen tokens. Anthropic schrapte bovendien een verhoging die op 1 september zou ingaan, terwijl de topmodellen onveranderd duur blijven.

Amerikaanse AI-labs verlagen hun tarieven zo snel dat klanten sinds midden juli bijna een kwart minder per miljoen tokens betalen, meldt de Financial Times op basis van de tokenprijsindex van Silicon Data.

Dat verandert de aard van een daling die Nederlandse teams al maanden op hun AI-rekening zien. Tot nu toe zakte de prijs per token vooral doordat teams zelf naar goedkopere modellen routeerden. Nu bewegen de prijslijsten zelf, en Anthropic haalde deze week een verhoging van tafel die op 1 september zou ingaan. Wie zijn AI-budget voor het najaar daarop had opgehoogd, kan die post terugdraaien. Wie een volumeafspraak of een jaarcontract heeft lopen, onderhandelt vanaf nu tegen een markt die een maand geleden nog een kwart duurder was.

Wat er precies goedkoper werd

De verlagingen raken de middenklasse van beide catalogi. OpenAI bracht op 30 juli GPT-5.6 Luna van 1 naar 0,20 dollar per miljoen invoertokens en van 6 naar 1,20 dollar per miljoen uitvoertokens, een verlaging van 80 procent, terwijl topmodel Sol op 5 en 30 dollar bleef staan.

Anthropic prijsde Claude Opus 5 op 5 dollar invoer en 25 dollar uitvoer per miljoen tokens, exact de helft van Fable 5, dat op 10 en 50 dollar staat. Deze week trok het bedrijf daarnaast een aangekondigde verhoging in. Sonnet 5 kwam in juni uit met een introductietarief van 2 en 10 dollar dat tot en met 31 augustus zou gelden, waarna 3 en 15 dollar zou ingaan. In de eigen prijsdocumentatie staat nu dat dat introductietarief de standaardprijs is geworden en de verhoging per 1 september niet doorgaat.

API-tarief per miljoen tokens, stand augustus 2026, in dollar (bron: Anthropic-prijsdocumentatie en OpenAI)

De index meet wat klanten betalen, niet de prijslijst

Silicon Data telt niet simpelweg de tarieven op een prijspagina op. De index publiceert dagelijks een genormaliseerd gemengd tarief dat de werkelijke kostprijs van inferentie weergeeft en niet de lijstprijs van één aanbieder, gecorrigeerd voor de verhouding tussen invoer- en uitvoertokens, de lengte van het contextvenster, batching en betrouwbaarheid. De weging volgt waar het gebruik zich concentreert: twintig modellen in de dagelijkse mand, geput uit ruim vierhonderd gevolgde modellen en meer dan twintig prijs- en volumebronnen, samen naar eigen zeggen goed voor meer dan 90 procent van de wereldwijde uitgaven aan inferentie.

Die opzet verklaart waarom dit cijfer hoger uitvalt dan wat routeringsplatforms meten. Op Vercels AI Gateway daalde de gemiddelde prijs per token in juli 13,6 procent, volledig doordat teams hun eigen modelmix verschoven en niet doordat de labs hun tarieven aanpasten. Die index rekent elk verzoek af tegen de gepubliceerde lijstprijs, dus prijsrondes van de labs zelf vallen er per definitie buiten. Bij Silicon Data tellen beide bewegingen mee: goedkoper routeren én goedkopere tarieven.

De onderkant zakt, de top wordt verdedigd

Aan de bovenkant gebeurt het omgekeerde. Fable 5 staat onveranderd op 10 en 50 dollar, en de Fast mode van Opus 5 kost per token evenveel als dat topmodel. Mantas Lukauskas, AI tech lead bij hostingbedrijf Hostinger, noemt de prijzen voor de allerbeste modellen vlak tot stijgend en ziet deze ronde als de eerste echte test of de labs hun duurste laag kunnen beschermen. Zijn samenvatting: de Amerikaanse labs hebben het midden weggesneden en verdedigen de top.

Een lager tokentarief is bovendien niet hetzelfde als lagere kosten per taak. Een sterker model rondt dezelfde opdracht soms af met minder tokens of minder pogingen, en vrijwel elk model draait op verschillende effort-standen die het verbruik fors laten schommelen. Benchmarkpartij Artificial Analysis zet Opus 5 op zijn hoogste effort-stand op 63 punten in zijn intelligentie-index tegen 60 voor Kimi K3 van het Chinese Moonshot, bij een gemengd tarief van 3,85 tegen 2,31 dollar per miljoen tokens. Dezelfde metingen, aangehaald door de Financial Times, laten zien dat Opus 5 op de stand medium qua prestatie en kosten per taak in de buurt van Kimi K3 op maximale stand komt, en dat GPT-5.6 Luna op maximale stand vergelijkbaar presteert met DeepSeek V4 Flash maar per taak bijna twee keer zoveel kost.

Waarom de labs nu bewegen

De directe aanleiding zijn Chinese open modellen, die vrij te downloaden en aan te passen zijn en waarvan de prestatiekloof met de Amerikaanse top smal is geworden. DoorDash en Airbnb hebben allebei gezegd dat ze Chinese modellen zijn gaan inzetten om hun rekening te drukken. Op de routeringsplatforms was dat patroon al eerder zichtbaar: op OpenRouter bezetten Chinese modellen acht van de tien drukste plekken, met Anthropic als enige Amerikaanse aanbieder in de top tien.

Tegelijk schuiven Anthropic en OpenAI een deel van hun zakelijke klanten van een vast abonnement naar afrekenen per verbruik, waarbij de rekening meebeweegt met de rekenkracht die je aanspreekt. Een deel van die bedrijven reageerde op de oplopende kosten met een plafond op het AI-gebruik of met een proef op goedkopere alternatieven. Dat alles speelt terwijl beide labs een beursgang bij een waardering rond een biljoen dollar voorbereiden en investeerders voor Anthropic zelfs op 2 biljoen dollar rekenen. Aan Chinese kant loopt de beweging niet één kant op: DeepSeek voerde een piekuurtarief in dat het standaardtarief verviervoudigt, al blijft het daarmee onder de Amerikaanse concurrentie.

Beide labs wilden tegenover de Financial Times niet reageren. Een ingewijde bij Anthropic zei dat Opus 5 onder Fable 5 geprijsd staat omdat de modelfamilie nu eenmaal zo is opgebouwd, zonder verband met wat concurrenten doen.

Waar de korting landt

De verschuiving zit niet in de korting zelf maar in waar hij neerkomt. De concurrentie tussen de labs gaat allang niet meer over welk model het slimst is, maar over wat een afgeronde taak kost, en dat gevecht wordt uitgevochten in de middenlaag. De duurste modellen staan precies waar ze stonden.

Voor wie de factuur betaalt, betekent dat twee dingen tegelijk. De onderhandelingsruimte is echt, maar ze zit op de regels waar per token het minste geld omgaat, terwijl de zwaarste modellen de rekening blijven bepalen. En goedkoper per token blijft iets anders dan goedkoper in totaal: op de Vercel-gateway lagen de uitgaven in juli 74 procent boven het niveau van mei, juist omdat elke dollar meer tokens kocht. Agentprocessen jagen het tokenverbruik omhoog terwijl de prijs per token al jaren daalt, en die twee krachten trekken nog altijd aan hetzelfde budget.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je AI-kosten

Een tariefronde levert pas iets op als je systeem per stap een ander model kan aanwijzen. Ik denk mee over die opzet, ontwerp hem en bouw hem ook, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.

DeepSeek kondigt een brede prijsverhoging aan voor zijn API
Nieuws
5 min

6 aug 12:11

DeepSeek kondigt een brede prijsverhoging aan voor zijn API

DeepSeek kondigt op zijn eigen prijspagina een brede verhoging aan van alle API-tarieven, zonder bedrag of datum. De eerder aangekondigde piektarieven zijn van die pagina verdwenen, en elke tokenbegroting die op prijs rustte moet opnieuw door de rekenmachine.

DeepSeek voert Vercels AI Gateway-ranglijst aan
Nieuws
2 min

26 sep 09:47

DeepSeek voert Vercels AI Gateway-ranglijst aan

DeepSeek is goed voor 25,4 procent van OpenRouters tekstverzoeken. Op Vercels AI Gateway verwerkt DeepSeek V4.1 Flash 51,7 procent van het tokenvolume. Beide ranglijsten meten alleen hun eigen platform.

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway
Nieuws
5 min

24 aug 02:11

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.

Open-weightmodellen verkorten achterstand op Amerikaanse frontier tot 4,4 maanden
Nieuws
4 min

16 sep 14:14

Open-weightmodellen verkorten achterstand op Amerikaanse frontier tot 4,4 maanden

Mozilla meet de achterstand tussen open-weight- en gesloten AI-modellen op 4,4 maanden. De prijs-prestatieverhouding verschuift, maar hardware, hosting en professioneel kenniswerk blijven bepalend voor modelkeuze.

Astra blokkeert directe prompt-injecties, verstopte lukken in 8,5 procent
Nieuws
5 min

4 sep 20:10

Astra blokkeert directe prompt-injecties, verstopte lukken in 8,5 procent

Gray Swan kreeg GPT-6 Astra in 8,5 procent van de scenario's toch zover dat het instructies uitvoerde die in een document verstopt zaten, tegen 4,8 procent bij Claude Opus 5. Directe injecties blokkeert het model wel.