Close-up van een prototype siliciumwafer waarop computerchips worden gemaakt
Nieuws13 augustus · 22:264 min leestijd

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips

OpenAI brengt GPT-5.6 Sol in een nieuwe servicelaag die tot veertien keer sneller antwoordt, op chips van Cerebras. De toegang loopt via een besloten preview en een tarief is er nog niet.

OpenAI zet GPT-5.6 Sol vanaf vandaag in Ultrafast, een nieuwe servicelaag die tot veertien keer sneller antwoordt dan de standaard en 750 uitvoertokens per seconde haalt op chips van Cerebras, meldt het bedrijf.

Daarmee komt er naast prijs een tweede variabele bij in de inkoop van AI: snelheid. Op GDP-Val, een test met economisch nuttig kenniswerk, zakte de gemiddelde doorlooptijd van een taak van 7,7 minuten naar 83 seconden, zonder dat de kwaliteit terugliep. Voor een agent die meedraait in klantcontact of in een storingsdienst is dat het verschil tussen een gesprek dat stilvalt en een gesprek dat doorloopt. Bestellen kun je het vandaag alleen niet: Ultrafast is een besloten preview en er is nog geen tarief bekend.

Wat er gemeten is, en door wie

De cijfers komen van de chipmaker zelf. Cerebras liet GPT-5.6 Sol op Ultrafast de 2.500 vragen van Humanity's Last Exam beantwoorden in 11 uur en 11 minuten, tegen 78 uur en 27 minuten voor Claude Fable 5 bij vergelijkbare nauwkeurigheid. Die test draaide op 10 juli voor Sol en op 13 tot 15 juli voor Fable 5, in elk geval met de codeeromgeving van de eigen leverancier. Het is een eigen meting van de partij die de hardware verkoopt, geen onafhankelijke benchmark.

De GDP-Val-meting van 31 juli is voor een zakelijke lezer de bruikbaarste, omdat die de hele doorlooptijd van een taak pakt en niet alleen de rekentijd van het model.

Grafiek van Cerebras met de doorlooptijd op GDP-Val. GPT-5.6 Sol Ultrafast komt op 83,0 seconden totaal, GPT-5.6 Sol standaard op 7,7 minuten. Bron: Cerebras Systems
Grafiek van Cerebras met de doorlooptijd op GDP-Val. GPT-5.6 Sol Ultrafast komt op 83,0 seconden totaal, GPT-5.6 Sol standaard op 7,7 minuten. Bron: Cerebras Systems

De winst zit vrijwel volledig in de modelaanroep zelf: 68,1 seconden tegen 7,5 minuten. Het werk eromheen, zoals bestanden openen en gereedschappen aanroepen, blijft rond de 14 seconden hangen. Wie een flow heeft waarin het model maar een klein deel van de tijd opsnoept, koopt met snelheid dus veel minder dan het cijfer van veertien keer suggereert. Dat is de eerste rekensom om zelf te maken voordat je op een wachtlijst gaat staan.

Drie snelheidsklassen, nul prijskaartjes

In de grafiek bij de aankondiging staan drie klassen naast elkaar: Standard op 1x, Priority op 2,5x en Ultrafast op 14x. Het model is in alle drie hetzelfde. Wat verschilt is de hardware eronder en wat je ervoor betaalt, en juist dat laatste ontbreekt.

Staafgrafiek van OpenAI met drie servicelagen voor GPT-5.6 Sol. Ultrafast staat op 14x, Priority op 2,5x en Standard op 1x. Bron: Cerebras Systems
Staafgrafiek van OpenAI met drie servicelagen voor GPT-5.6 Sol. Ultrafast staat op 14x, Priority op 2,5x en Standard op 1x. Bron: Cerebras Systems

Geen van de betrokken partijen noemt een bedrag per miljoen tokens. TechCrunch schrijft dat de laag alleen opengaat voor een kleine groep klanten en meebeweegt met de capaciteit die erbij komt. Jane Street, Podium, Basis en Rogo testen mee. Anthropic heeft met zijn Fast-modus iets vergelijkbaars, maar haalt volgens Cerebras' eigen vergelijking niet dezelfde uitvoersnelheid.

Het contrast met dezelfde dag is scherp. Google maakte Gemini 3.7 Flash direct algemeen beschikbaar en zette er tot 31 december een halve tokenprijs op van 0,75 dollar per miljoen invoertokens, terwijl OpenAI's snelste laag op uitnodiging blijft. Goedkoper is vandaag te koop. Sneller nog niet.

Waarom een wafer dit kan

De versnelling komt niet uit een nieuw model. GPT-5.6 Sol is hetzelfde zware model dat bij zijn brede uitrol 54 procent minder tokens claimde op agentic coding. Cerebras propt 44 GB SRAM op één chip ter grootte van een wafer, waardoor de modelgewichten op de chip blijven staan in plaats van bij elke token heen en weer te reizen naar extern geheugen. Dat geheugenverkeer is op GPU's de rem.

De basis daarvoor ligt er al langer. OpenAI tekende in januari een meerjarige afspraak om 750 megawatt aan rekenkracht met lage latentie aan zijn platform toe te voegen, in tranches tot en met 2028. Voor Europese afnemers is relevant waar die capaciteit landt: Cerebras bouwt tegen eind 2027 200 megawatt aan Europese rekenkracht, met een eerste datacenter in Frankrijk en uitbreiding naar Noorwegen en Finland. Latentie is deels een natuurkundig probleem, en een antwoord dat over de oceaan moet reizen blijft trager dan een antwoord uit Parijs.

De modellenrace ging eerst over wie het slimst was en daarna over wie het goedkoopst was. Er komt nu een derde as bij, en die verandert welke taken je überhaupt aan een model durft te geven. Een storingsanalyse of een controle tijdens het afrekenen heeft weinig aan een antwoord dat zeven minuten later komt. Zolang de snelste laag achter een wachtlijst zit en zonder tarief, is de vraag die je vandaag wél kunt beantwoorden hoeveel van je doorlooptijd nu echt bij het model ligt. Bij de meeste flows blijkt dat minder te zijn dan gedacht.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Snelheid begint bij je koppelingen

Bij de meeste AI-flows die ik tegenkom zit de vertraging niet in het model, maar in het overtypen en wachten eromheen. Ik denk met je mee, ontwerp de keten en bouw hem af, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Cerebras lanceert CS-4 en claimt dertig keer meer tokens per seconde dan GPU's
Nieuws
4 min

19 aug 04:39

Cerebras lanceert CS-4 en claimt dertig keer meer tokens per seconde dan GPU's

Cerebras lanceert de CS-4, een rack met drie wafer-grote chips dat volgens eigen metingen tot dertig keer meer tokens per seconde haalt dan GPU's. Een onafhankelijke benchmark ontbreekt en een prijs is er niet.

Cerebras legt 165 megawatt AI-capaciteit vast in het Finse Mikkeli
Nieuws
4 min

1 sep 16:21

Cerebras legt 165 megawatt AI-capaciteit vast in het Finse Mikkeli

Cerebras legt onder zevenjarige contracten 165 megawatt AI-capaciteit vast in Mikkeli, Finland, samen met Compute Nordic. De eerste 50 megawatt is in aanbouw. Wat dat betekent voor rekenkracht binnen de EU.

OpenAI verlaagt prijs GPT-5.6 Sol tijdelijk naar 4 en 20 dollar per miljoen tokens
Nieuws
4 min

22 aug 00:10

OpenAI verlaagt prijs GPT-5.6 Sol tijdelijk naar 4 en 20 dollar per miljoen tokens

OpenAI zet GPT-5.6 Sol drie maanden lang op 4 dollar invoer en 20 dollar uitvoer per miljoen tokens. De uitvoerprijs zakt een derde, precies de post waar agentprocessen het meeste verbruiken.

OpenAI groeit harder dan Anthropic in zakelijke AI-uitgaven: 82 tegen 76 procent
Nieuws
5 min

21 aug 12:12

OpenAI groeit harder dan Anthropic in zakelijke AI-uitgaven: 82 tegen 76 procent

Tokendata van betaalbedrijf Ramp laten zien dat OpenAI dit kwartaal harder groeit in zakelijke AI-uitgaven dan Anthropic, 82 tegen 76 procent. In adoptie ligt Anthropic nog voor, maar de rangorde kantelt per modelrelease.

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna
Nieuws
4 minBijgewerkt om 00:38

22 sep 22:12

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna

OpenAI brengt GPT-6 Sol en Luna uit met lagere API-tarieven: 2 en 10 dollar voor Sol, 0,10 en 0,50 dollar voor Luna per miljoen tokens. Voor Nederlandse teams wordt modelkeuze per taak belangrijker.

Astra blokkeert directe prompt-injecties, verstopte lukken in 8,5 procent
Nieuws
5 min

4 sep 20:10

Astra blokkeert directe prompt-injecties, verstopte lukken in 8,5 procent

Gray Swan kreeg GPT-6 Astra in 8,5 procent van de scenario's toch zover dat het instructies uitvoerde die in een document verstopt zaten, tegen 4,8 procent bij Claude Opus 5. Directe injecties blokkeert het model wel.