OpenAI zet GPT-5.6 Sol vanaf vandaag in Ultrafast, een nieuwe servicelaag die tot veertien keer sneller antwoordt dan de standaard en 750 uitvoertokens per seconde haalt op chips van Cerebras, meldt het bedrijf.
Daarmee komt er naast prijs een tweede variabele bij in de inkoop van AI: snelheid. Op GDP-Val, een test met economisch nuttig kenniswerk, zakte de gemiddelde doorlooptijd van een taak van 7,7 minuten naar 83 seconden, zonder dat de kwaliteit terugliep. Voor een agent die meedraait in klantcontact of in een storingsdienst is dat het verschil tussen een gesprek dat stilvalt en een gesprek dat doorloopt. Bestellen kun je het vandaag alleen niet: Ultrafast is een besloten preview en er is nog geen tarief bekend.
Wat er gemeten is, en door wie
De cijfers komen van de chipmaker zelf. Cerebras liet GPT-5.6 Sol op Ultrafast de 2.500 vragen van Humanity's Last Exam beantwoorden in 11 uur en 11 minuten, tegen 78 uur en 27 minuten voor Claude Fable 5 bij vergelijkbare nauwkeurigheid. Die test draaide op 10 juli voor Sol en op 13 tot 15 juli voor Fable 5, in elk geval met de codeeromgeving van de eigen leverancier. Het is een eigen meting van de partij die de hardware verkoopt, geen onafhankelijke benchmark.
De GDP-Val-meting van 31 juli is voor een zakelijke lezer de bruikbaarste, omdat die de hele doorlooptijd van een taak pakt en niet alleen de rekentijd van het model.

De winst zit vrijwel volledig in de modelaanroep zelf: 68,1 seconden tegen 7,5 minuten. Het werk eromheen, zoals bestanden openen en gereedschappen aanroepen, blijft rond de 14 seconden hangen. Wie een flow heeft waarin het model maar een klein deel van de tijd opsnoept, koopt met snelheid dus veel minder dan het cijfer van veertien keer suggereert. Dat is de eerste rekensom om zelf te maken voordat je op een wachtlijst gaat staan.
Drie snelheidsklassen, nul prijskaartjes
In de grafiek bij de aankondiging staan drie klassen naast elkaar: Standard op 1x, Priority op 2,5x en Ultrafast op 14x. Het model is in alle drie hetzelfde. Wat verschilt is de hardware eronder en wat je ervoor betaalt, en juist dat laatste ontbreekt.

Geen van de betrokken partijen noemt een bedrag per miljoen tokens. TechCrunch schrijft dat de laag alleen opengaat voor een kleine groep klanten en meebeweegt met de capaciteit die erbij komt. Jane Street, Podium, Basis en Rogo testen mee. Anthropic heeft met zijn Fast-modus iets vergelijkbaars, maar haalt volgens Cerebras' eigen vergelijking niet dezelfde uitvoersnelheid.
Het contrast met dezelfde dag is scherp. Google maakte Gemini 3.7 Flash direct algemeen beschikbaar en zette er tot 31 december een halve tokenprijs op van 0,75 dollar per miljoen invoertokens, terwijl OpenAI's snelste laag op uitnodiging blijft. Goedkoper is vandaag te koop. Sneller nog niet.
Waarom een wafer dit kan
De versnelling komt niet uit een nieuw model. GPT-5.6 Sol is hetzelfde zware model dat bij zijn brede uitrol 54 procent minder tokens claimde op agentic coding. Cerebras propt 44 GB SRAM op één chip ter grootte van een wafer, waardoor de modelgewichten op de chip blijven staan in plaats van bij elke token heen en weer te reizen naar extern geheugen. Dat geheugenverkeer is op GPU's de rem.
De basis daarvoor ligt er al langer. OpenAI tekende in januari een meerjarige afspraak om 750 megawatt aan rekenkracht met lage latentie aan zijn platform toe te voegen, in tranches tot en met 2028. Voor Europese afnemers is relevant waar die capaciteit landt: Cerebras bouwt tegen eind 2027 200 megawatt aan Europese rekenkracht, met een eerste datacenter in Frankrijk en uitbreiding naar Noorwegen en Finland. Latentie is deels een natuurkundig probleem, en een antwoord dat over de oceaan moet reizen blijft trager dan een antwoord uit Parijs.
De modellenrace ging eerst over wie het slimst was en daarna over wie het goedkoopst was. Er komt nu een derde as bij, en die verandert welke taken je überhaupt aan een model durft te geven. Een storingsanalyse of een controle tijdens het afrekenen heeft weinig aan een antwoord dat zeven minuten later komt. Zolang de snelste laag achter een wachtlijst zit en zonder tarief, is de vraag die je vandaag wél kunt beantwoorden hoeveel van je doorlooptijd nu echt bij het model ligt. Bij de meeste flows blijkt dat minder te zijn dan gedacht.
Veelgestelde vragen
Snelheid begint bij je koppelingen
Bij de meeste AI-flows die ik tegenkom zit de vertraging niet in het model, maar in het overtypen en wachten eromheen. Ik denk met je mee, ontwerp de keten en bouw hem af, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
