SpaceXAI brengt Grok 4.6 uit, een model dat 61 punten haalt op de Artificial Analysis Intelligence Index en daarmee GPT-5.6 Sol evenaart, tegen dezelfde tokenprijs als zijn voorganger.
Dat maakt de afweging voor teams die agents lang laten doorwerken vooral een rekensom. Grok 4.5 stond op 56 punten en kostte 2 dollar per miljoen inputtokens en 6 dollar per miljoen outputtokens. Grok 4.6 wint vijf punten en houdt precies dat tarief. Claude Opus 5, dat met 63 punten de hoogste score op die index houdt, rekent 5 dollar input en 25 dollar output per miljoen tokens. Per miljoen outputtokens ligt Grok 4.6 daarmee ruim vier keer lager, voor twee indexpunten minder.
Vijf punten winst, vooral op agenttaken
De winst zit geconcentreerd in de tests die meerstapswerk meten. Op DeepSWE 1.1 gaat Grok 4.6 van 54 naar 65,9 procent, op APEX-Agents van 47,1 naar 57,5 procent en op Terminal-Bench 3.0 van 15,7 naar 26 procent. SpaceXAI schrijft dat het model op langere trajecten vaker zijn eigen werk nakijkt voordat het verdergaat.
Het patroon dat zichtbaar werd bij Grok 4.5, dat voor 2 dollar per miljoen inputtokens tegen de Opus-klasse werd gezet maar op de zwaarste coding-benchmarks achterbleef, staat nog overeind. GPT-5.6 Sol haalt op DeepSWE 1.1 73 procent en Fable 5 70 procent, tegen 65,9 voor Grok 4.6. Op Terminal-Bench 3.0 zitten die twee rond de 34 procent, tegen 26. De inhaalslag is fors, de achterstand op de zwaarste agenttests is niet weg.

Waar de rekening alsnog oploopt
Het tarief van 2 en 6 dollar geldt tot 200.000 tokens context. De modeldocumentatie zet alles daarboven op 4 dollar input en 12 dollar output per miljoen tokens, binnen een venster van 500.000 tokens. Juist een agent die lang doorloopt sleept zijn context mee en groeit vanzelf over die grens heen. De prijs per token verdubbelt dan halverwege de klus, zonder dat iemand een instelling aanraakt. Gecachete inputtokens kosten 0,50 dollar per miljoen, wat het herhaald meesturen van dezelfde context wel goedkoper maakt.
Daar staat een efficiëntievoordeel tegenover. Grok 4.6 rondt complexe taken af in ongeveer 53 stappen, waar Claude Opus 5 er ruwweg 103 nodig heeft, tekent The Decoder aan bij de GDPval-AA-test, waarop Grok 4.6 met 1753 punten tweede staat achter Opus 5. Minder stappen betekent minder beurten en minder tokens, en dat drukt de kosten per afgeronde taak sterker dan het tarief alleen. Waar dat geld in zo'n loop precies weglekt en hoe je het meet, staat in de meetaanpak voor tokenkosten van agenten, die in productie harder oplopen dan een proof of concept doet vermoeden.
Het model draait op Amerikaanse clusters
Grok 4.6 is vanaf vandaag te gebruiken in Cursor, in Grok Build en via de SpaceXAI-API, met OpenRouter, Vercel en Cloudflare als partners en de eerste week dubbel inbegrepen verbruik in Grok Build en Cursor. Anders dan bij de lancering van 4.5, die in geen enkel SpaceXAI-product in de EU beschikbaar was, noemt de aankondiging nu geen regio die buiten de boot valt.
Eén beperking staat wel zwart op wit in de documentatie. Als draairegio's voor grok-4.6 zijn alleen us-east-1 en us-west-2 vermeld. Wie het model via de API in een proces hangt, stuurt zijn invoer dus naar Amerikaanse datacenters. Bij een dossier met persoonsgegevens of klantcontracten is dat een afweging die los staat van de prijs per token.
Van prijs per token naar verbruik per taak
Tussen Grok 4.5 en Grok 4.6 is de prijs het enige dat niet bewoog. Vijf weken geleden was die tokenprijs zelf het nieuws, nu is hij het uitgangspunt en gaat het over hoeveel stappen een model per euro volhoudt zonder vast te lopen. Dezelfde verschuiving zit in OpenAI's claim dat GPT-5.6 Sol op agentic coding 54 procent minder tokens verbruikt: niet goedkoper per token, maar zuiniger per taak. Voor wie agents inkoopt verschuift de vraag daarmee van het tarief op de prijslijst naar het verbruik van één echte opdracht, en dat cijfer staat op geen enkele leverancierspagina.
Veelgestelde vragen
Van modelkeuze naar werkend proces
Een scherpe tokenprijs zegt weinig zolang de agent zelf niet af is. Ik denk mee over welk model bij jouw taak past, ontwerp de workflow eromheen en bouw hem tot hij draait, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
