Iemand aan een bureau met een rekenmachine en een notitieblok
Nieuws18 augustus · 10:105 min leestijd

Gartner: inferentiekosten per agentische AI-workflow vervijfvoudigen tot 2028

Gartner voorspelt dat de inferentiekosten per agentische AI-workflow tot 2028 meer dan vervijfvoudigen, terwijl de tokenprijs blijft dalen. De eenheid waarin je je AI-budget berekent verschuift van prijs per token naar kosten per afgeronde workflow.

De inferentiekosten per agentische AI-workflow vervijfvoudigen tot 2028, voorspelt Gartner in een persbericht van 17 augustus, terwijl de prijs per token gewoon blijft dalen.

Voor een Nederlands bedrijf dat agents in productie heeft, verschuift daarmee de eenheid waarin je moet rekenen. Op de begroting staat nu meestal een tarief per miljoen tokens: een getal dat je bij je leverancier kunt opzoeken en dat al twee jaar zakt. Gartner zegt in feite dat dat getal steeds minder over je factuur zegt, omdat niet het tarief beweegt maar het aantal stappen dat een agent per opdracht zet. Wie op tokenprijs begroot, begroot op de enige variabele die de goede kant op gaat.

Drie krachten eten de prijsdaling op

Gartner noemt drie trends die tegelijk spelen. De kostprijs van basismodellen verbetert snel. Juist die efficiëntie maakt het aantrekkelijk om zwaardere en duurdere modellen in te zetten voor waardevoller, complexer werk. En dat complexere werk verstookt veel meer tokens dan een chatgesprek. Netto worden tokens goedkoper, maar niet zo snel als de mogelijkheden en de kosten daarvan toenemen.

"Productleiders kunnen een efficiëntere tokeneconomie niet gebruiken om hun AI-kosten goed te praten", zegt Will Sommer, Sr. Director Analyst bij Gartner. "Elke volgende generatie AI-capaciteit vraagt meer, en vaak duurdere, tokens. Er is geen betrouwbaar, zuinig model in zicht dat overal op past."

Gartner-grafiek: de kostencurve per jaar zakt, maar de inzet van frontiermodellen schuift sneller omhoog langs de as van modelcapaciteit (bron: Gartner, augustus 2026)
Gartner-grafiek: de kostencurve per jaar zakt, maar de inzet van frontiermodellen schuift sneller omhoog langs de as van modelcapaciteit (bron: Gartner, augustus 2026)

Dat verschijnsel doopt Gartner de inferentieparadox: betere kosten per eenheid die de totale AI-rekening juist opjagen, zonder een helder pad naar navenante waarde. De cijfers achter de voorspelling maken het concreet. Geavanceerde redenerende agents kosten per taak tot 150 keer meer dan een basischatbot, en ze hebben 5 tot 30 keer meer tokens nodig voor vergelijkbaar werk. De hardware om een middelgroot agentmodel met redeneervermogen te trainen kost 2,5 keer zoveel als voor een even grote chatbot. Gartner bouwde er een tokenomics-model voor over twaalf modeltypen en komt uit op een verschil van 8 tot 10 keer tussen een basisworkflow en een taak waarin het model plant en leert. Ondertussen verwacht het bureau dat de kosten per token tot 2030 met 95 procent dalen. Sommer en collega-analist Sabine Zimmerhansl vatten die kloof samen als een tokendeflatie-illusie: kopers nemen aan dat de besparingen van aanbieders vanzelf op hun eigen begroting landen, en dat gebeurt niet.

Van prijs per token naar kosten per afgeronde taak

De markt beweegt intussen precies zoals Gartner beschrijft. Bij de Amerikaanse labs zakte de prijs per miljoen tokens sinds midden juli bijna een kwart, en toch dalen de facturen niet mee. Microsoft mat bij een upgrade naar Claude Sonnet 5 dat het tokenverbruik op code- en architectuurtaken tot twaalf keer kon oplopen. Modelbouwers beginnen daarom zelf in de nieuwe eenheid te praten: Writer bracht deze maand Palmyra X6 uit met 52 procent lagere kosten per agenttaak terwijl het tarief per token juist omhoog ging.

Bain leverde in juni de terugblik bij hetzelfde patroon: de tokenprijs halveerde tussen december 2024 en december 2025 terwijl het verbruik 4,5 keer hoger lag. Gartner zet daar nu een vooruitblik naast, met een factor en een einddatum.

Routeren in plaats van standaard het zwaarste model

Rendement halen uit redenerende agents kan volgens Gartner op twee manieren: uitzonderlijk veel meer opbrengst per taak, of scherp gekalibreerde inferentie. Dat tweede noemt het bureau inference-tiering, en het komt neer op werk toewijzen aan het goedkoopste model dat de klus aankan, met routering en orkestratie eromheen in plaats van één model voor alles. "Wie standaard kiest voor generieke autonome intelligentie, krijgt onbegrensde kosten die orden van grootte hoger liggen dan die van geoptimaliseerde productecosystemen", zegt Sommer.

Goedkoop is dat niet. Sommer stelt dat een concurrerend AI-product vraagt om het bouwen en onderhouden van complexe ecosystemen met meerdere modellen naast elkaar, en dat kost engineeringtijd die je nu vaak nog in prompts steekt. Voor een kleiner team begint het bij de basis: harde budgetlimieten per agent, prompt caching en een routeringstabel van taak naar model.

Gartner voorspelde eerder al dat vier op de tien organisaties hun AI-agents terugschroeven of uitzetten vanwege technische problemen, en dat minstens de helft van de generatieve-AI-projecten door zwakke architectuurkeuzes en gebrek aan expertise over het budget gaat. De kostenvoorspelling van deze week legt daar de rekening onder.

De voorspelling gaat dan ook niet over een prijsstijging, maar over een verschuiving in wat je koopt: niet één antwoord op één vraag, maar een reeks stappen die het model zelf uitzet. Zolang die reeks langer wordt, is elke aankondiging over goedkopere tokens tegelijk waar en irrelevant voor de factuur. De organisaties die hier over twee jaar niet door verrast worden, zijn de organisaties die vandaag al kunnen zeggen wat één afgeronde workflow kost.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agents met een kostenplafond

Ik denk met je mee over welk werk een agent echt moet doen, ontwerp de routering naar het goedkoopste model dat de klus aankan en bouw er harde limieten per workflow omheen, tot en met beheer in productie. Self-hosted waar dat kan, zodat je rekening niet aan een externe meter hangt.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Snowflake stuurt AI-taken automatisch naar het goedkoopste model dat volstaat
Nieuws
5 min

18 aug 16:20

Snowflake stuurt AI-taken automatisch naar het goedkoopste model dat volstaat

Snowflake kondigt dynamic model routing aan in Cortex AI Gateway: per taak automatisch het goedkoopste model dat de kwaliteit haalt. De functie zit nog niet in private preview en een prijs ontbreekt.

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak
Nieuws
5 min

14 aug 00:15

Writer lanceert Palmyra X6 en claimt 52 procent lagere kosten per agenttaak

Writer bouwde zijn nieuwe vlaggenschip Palmyra X6 op het Chinese open model GLM-5.2 en meet 52 procent lagere kosten per agenttaak. De tokenprijs ging juist omhoog, de winst zit in 38 procent minder tokens per taak.

Agents leveren 64 procent van de uitvoertokens bij zakelijke OpenAI-klanten
Nieuws
5 min

13 aug 00:30

Agents leveren 64 procent van de uitvoertokens bij zakelijke OpenAI-klanten

Agents leverden in juni 64 procent van de uitvoertokens bij zakelijke OpenAI-klanten. Een leverancierscijfer over de eigen markt, maar het verschuift wel je kostenraming, de toegangsrechten van agents en het toezicht erop.

Anthropic watermerkt alle tekst van Claude, wereldwijd
Nieuws
5 min

11 aug 02:10

Anthropic watermerkt alle tekst van Claude, wereldwijd

Anthropic weeft een onzichtbaar watermerk in alle tekst die Claude genereert, wereldwijd en op modelniveau, vanaf modellen van na 2 augustus 2026. Dat verandert de herkomst van je output, niet je eigen meldplicht als ondernemer.

Microsoft legt eigen engineers een tokenbudget op en zet goedkoper model als standaard
Nieuws
4 min

5 aug 00:39

Microsoft legt eigen engineers een tokenbudget op en zet goedkoper model als standaard

Microsoft legt zijn engineers een tokenbudget op en zet het goedkopere GPT-5.6 als standaardmodel. Uit de interne mail van EVP Jay Parikh blijkt ook hoeveel een engineer maandelijks aan tokens verstookt.

Google dicht 1.072 Chrome-lekken in twee releases met AI-hulp
Nieuws
3 min

31 jul 12:39

Google dicht 1.072 Chrome-lekken in twee releases met AI-hulp

Google dicht 1.072 beveiligingslekken in Chrome 149 en 150, meer dan in de 23 versies ervoor samen, en schrijft dat toe aan AI-agents. Tegelijk gaat de browser naar wekelijkse beveiligingsupdates.