Iemand aan een bureau met een rekenmachine en een notitieblok
Nieuws18 augustus · 10:105 min leestijd

Gartner: inferentiekosten per agentische AI-workflow vervijfvoudigen tot 2028

Gartner voorspelt dat de inferentiekosten per agentische AI-workflow tot 2028 meer dan vervijfvoudigen, terwijl de tokenprijs blijft dalen. De eenheid waarin je je AI-budget berekent verschuift van prijs per token naar kosten per afgeronde workflow.

De inferentiekosten per agentische AI-workflow vervijfvoudigen tot 2028, voorspelt Gartner in een persbericht van 17 augustus, terwijl de prijs per token gewoon blijft dalen.

Voor een Nederlands bedrijf dat agents in productie heeft, verschuift daarmee de eenheid waarin je moet rekenen. Op de begroting staat nu meestal een tarief per miljoen tokens: een getal dat je bij je leverancier kunt opzoeken en dat al twee jaar zakt. Gartner zegt in feite dat dat getal steeds minder over je factuur zegt, omdat niet het tarief beweegt maar het aantal stappen dat een agent per opdracht zet. Wie op tokenprijs begroot, begroot op de enige variabele die de goede kant op gaat.

Drie krachten eten de prijsdaling op

Gartner noemt drie trends die tegelijk spelen. De kostprijs van basismodellen verbetert snel. Juist die efficiëntie maakt het aantrekkelijk om zwaardere en duurdere modellen in te zetten voor waardevoller, complexer werk. En dat complexere werk verstookt veel meer tokens dan een chatgesprek. Netto worden tokens goedkoper, maar niet zo snel als de mogelijkheden en de kosten daarvan toenemen.

"Productleiders kunnen een efficiëntere tokeneconomie niet gebruiken om hun AI-kosten goed te praten", zegt Will Sommer, Sr. Director Analyst bij Gartner. "Elke volgende generatie AI-capaciteit vraagt meer, en vaak duurdere, tokens. Er is geen betrouwbaar, zuinig model in zicht dat overal op past."

Gartner-grafiek: de kostencurve per jaar zakt, maar de inzet van frontiermodellen schuift sneller omhoog langs de as van modelcapaciteit (bron: Gartner, augustus 2026)
Gartner-grafiek: de kostencurve per jaar zakt, maar de inzet van frontiermodellen schuift sneller omhoog langs de as van modelcapaciteit (bron: Gartner, augustus 2026)

Dat verschijnsel doopt Gartner de inferentieparadox: betere kosten per eenheid die de totale AI-rekening juist opjagen, zonder een helder pad naar navenante waarde. De cijfers achter de voorspelling maken het concreet. Geavanceerde redenerende agents kosten per taak tot 150 keer meer dan een basischatbot, en ze hebben 5 tot 30 keer meer tokens nodig voor vergelijkbaar werk. De hardware om een middelgroot agentmodel met redeneervermogen te trainen kost 2,5 keer zoveel als voor een even grote chatbot. Gartner bouwde er een tokenomics-model voor over twaalf modeltypen en komt uit op een verschil van 8 tot 10 keer tussen een basisworkflow en een taak waarin het model plant en leert. Ondertussen verwacht het bureau dat de kosten per token tot 2030 met 95 procent dalen. Sommer en collega-analist Sabine Zimmerhansl vatten die kloof samen als een tokendeflatie-illusie: kopers nemen aan dat de besparingen van aanbieders vanzelf op hun eigen begroting landen, en dat gebeurt niet.

Van prijs per token naar kosten per afgeronde taak

De markt beweegt intussen precies zoals Gartner beschrijft. Bij de Amerikaanse labs zakte de prijs per miljoen tokens sinds midden juli bijna een kwart, en toch dalen de facturen niet mee. Microsoft mat bij een upgrade naar Claude Sonnet 5 dat het tokenverbruik op code- en architectuurtaken tot twaalf keer kon oplopen. Modelbouwers beginnen daarom zelf in de nieuwe eenheid te praten: Writer bracht deze maand Palmyra X6 uit met 52 procent lagere kosten per agenttaak terwijl het tarief per token juist omhoog ging.

Bain leverde in juni de terugblik bij hetzelfde patroon: de tokenprijs halveerde tussen december 2024 en december 2025 terwijl het verbruik 4,5 keer hoger lag. Gartner zet daar nu een vooruitblik naast, met een factor en een einddatum.

Routeren in plaats van standaard het zwaarste model

Rendement halen uit redenerende agents kan volgens Gartner op twee manieren: uitzonderlijk veel meer opbrengst per taak, of scherp gekalibreerde inferentie. Dat tweede noemt het bureau inference-tiering, en het komt neer op werk toewijzen aan het goedkoopste model dat de klus aankan, met routering en orkestratie eromheen in plaats van één model voor alles. "Wie standaard kiest voor generieke autonome intelligentie, krijgt onbegrensde kosten die orden van grootte hoger liggen dan die van geoptimaliseerde productecosystemen", zegt Sommer.

Goedkoop is dat niet. Sommer stelt dat een concurrerend AI-product vraagt om het bouwen en onderhouden van complexe ecosystemen met meerdere modellen naast elkaar, en dat kost engineeringtijd die je nu vaak nog in prompts steekt. Voor een kleiner team begint het bij de basis: harde budgetlimieten per agent, prompt caching en een routeringstabel van taak naar model.

Gartner voorspelde eerder al dat vier op de tien organisaties hun AI-agents terugschroeven of uitzetten vanwege technische problemen, en dat minstens de helft van de generatieve-AI-projecten door zwakke architectuurkeuzes en gebrek aan expertise over het budget gaat. De kostenvoorspelling van deze week legt daar de rekening onder.

De voorspelling gaat dan ook niet over een prijsstijging, maar over een verschuiving in wat je koopt: niet één antwoord op één vraag, maar een reeks stappen die het model zelf uitzet. Zolang die reeks langer wordt, is elke aankondiging over goedkopere tokens tegelijk waar en irrelevant voor de factuur. De organisaties die hier over twee jaar niet door verrast worden, zijn de organisaties die vandaag al kunnen zeggen wat één afgeronde workflow kost.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agents met een kostenplafond

Ik denk met je mee over welk werk een agent echt moet doen, ontwerp de routering naar het goedkoopste model dat de klus aankan en bouw er harde limieten per workflow omheen, tot en met beheer in productie. Self-hosted waar dat kan, zodat je rekening niet aan een externe meter hangt.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna
Nieuws
4 min

22 sep 22:12

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna

OpenAI brengt GPT-6 Sol en Luna uit met lagere API-tarieven: 2 en 10 dollar voor Sol, 0,10 en 0,50 dollar voor Luna per miljoen tokens. Voor Nederlandse teams wordt modelkeuze per taak belangrijker.

Open-weightmodellen verkorten achterstand op Amerikaanse frontier tot 4,4 maanden
Nieuws
4 min

16 sep 14:14

Open-weightmodellen verkorten achterstand op Amerikaanse frontier tot 4,4 maanden

Mozilla meet de achterstand tussen open-weight- en gesloten AI-modellen op 4,4 maanden. De prijs-prestatieverhouding verschuift, maar hardware, hosting en professioneel kenniswerk blijven bepalend voor modelkeuze.

AI-tokenindex zakt voor het eerst onder een dollar per miljoen tokens
Nieuws
5 min

1 sep 20:09

AI-tokenindex zakt voor het eerst onder een dollar per miljoen tokens

De verbruiksgewogen tokenindex van Silicon Data sloot op 97 dollarcent per miljoen tokens, 8,6 procent lager dan een week eerder. Op de prijslijsten van de labs staat een heel ander getal.

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur
Nieuws
6 min

31 aug 16:47

Broadcom lanceert VMware Private AI Cloud met meer dan 150 modellen op eigen infrastructuur

Broadcom bundelt AI-inferentie, agents en klassieke workloads op VMware Cloud Foundation en valideert vijf modellen voor eigen datacenters. AgentMinder is er nu, de AI Gateway en de agentbeveiliging volgen later.

Microsoft-medewerkers melden mediaan 300 dollar AI-verbruik per maand
Nieuws
4 min

25 aug 14:24

Microsoft-medewerkers melden mediaan 300 dollar AI-verbruik per maand

Een interne loonspreadsheet bij Microsoft toont voor het eerst gerealiseerde AI-uitgaven per medewerker: mediaan zo'n 300 dollar over 28 dagen, met een uitschieter van 28.000 dollar en grote verschillen per team.

Snowflake stuurt AI-taken automatisch naar het goedkoopste model dat volstaat
Nieuws
5 min

18 aug 16:20

Snowflake stuurt AI-taken automatisch naar het goedkoopste model dat volstaat

Snowflake kondigt dynamic model routing aan in Cortex AI Gateway: per taak automatisch het goedkoopste model dat de kwaliteit haalt. De functie zit nog niet in private preview en een prijs ontbreekt.