SpaceXAI lanceert Grok 4.7 voor coding en kenniswerk, meldt het bedrijf, met dezelfde API-prijs als Grok 4.6 maar een gemengde benchmarkpositie tegenover Claude Fable 5.1 en GPT-6 Astra.
Voor een Nederlandse organisatie die een coding-agent of documentagent inkoopt, verschuift daarmee de vergelijkingsbasis. Grok 4.7 is vandaag beschikbaar via de xAI-API, Cursor en Grok Build, vanaf 2 dollar per miljoen inputtokens en 6 dollar per miljoen outputtokens. De documentatie noemt 500.000 tokens context en een snelle variant die alleen in Cursor en Grok Build beschikbaar is tegen twee keer het standaardtarief. Dat tarief zegt iets over de prijslijst, niet over de kosten van een afgeronde taak met veel stappen, herhaalde context en controles.
Dezelfde prijs, meer verschil per test
De officiële vergelijking van SpaceXAI zet Grok 4.7 op CursorBench 4.0 op 46,3 procent, tegen 40,4 procent voor Grok 4.6, 41,7 procent voor GPT-5.6 Sol en 51,8 procent voor Claude Fable 5.1. Op Terminal-Bench 4.0, voor langdurig terminalwerk, rapporteert het bedrijf 38,0 procent, tegenover 20,3 procent voor Grok 4.6. De instellingen zijn niet identiek: Grok 4.7 draait op xhigh, Grok 4.6 op high en de twee concurrenten op max.
Cursor's live evaluatie rapporteert 46,3 procent bij een gemiddelde taakprijs van 6,01 dollar voor Grok 4.7 xhigh, tegenover 51,8 procent en 17,28 dollar voor Fable 5.1 Max. De test komt van een partij die Grok 4.7 samen met SpaceXAI aanbiedt. Cursor waarschuwt zelf dat kleine scoreverschillen kunnen variëren.

Onafhankelijke agenttest houdt de grens zichtbaar
Artificial Analysis geeft Grok 4.7 in Intelligence Index v4.3.2 een score van 46 punten. Claude Fable 5.1 en GPT-6 Astra staan op 53 punten en 53 punten. De index combineert tien evaluaties, waaronder AA-Briefcase, GDPval-AA en Terminal-Bench 4.0.
In de onafhankelijke Terminal-Bench 4.0-run zet Artificial Analysis Grok 4.7 op 25,8 procent, tegenover 59,6 procent voor GPT-6 Astra en 55,1 procent voor Claude Fable 5.1. Artificial Analysis draait daar 66 taken met het mini-swe-agent-harnas, rapporteert pass@1 en herhaalt elke taak drie keer. Dat is lager dan de 38,0 procent in de tabel van SpaceXAI. Het verschil laat vooral zien dat agentbenchmarks de gebruikte harnas, instellingen en herhalingen meerekenen.
De release loopt rechtstreeks door op de vorige stap: Grok 4.6 klom naar 61 punten op de Artificial Analysis-index terwijl de tokenprijs op 2 en 6 dollar bleef staan, maar bleef op de zwaarste agenttests achter. Grok 4.7 verbetert de officiële en partnerbenchmarks, terwijl de onafhankelijke terminalmeting laat zien dat een lage tokenprijs geen vervanging is voor een taaktest in de eigen omgeving.
De prijsstrijd is daarmee veranderd van een tariefvergelijking naar een kostenvergelijking per werkende agentloop. Voor Nederlandse inkopers komt een model niet als winnaar uit de bus door 2 dollar input alleen, maar door de combinatie van slagingskans, benodigde stappen, contextverbruik en de gegevensvoorwaarden van de gekozen dienst.
Veelgestelde vragen
Van modelkeuze naar systeem
Ik help je modelkeuzes toetsen aan echte taken en bouw het hele traject mee uit, van meedenken en ontwerp tot realiseren en automatiseren. Self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

