Close-up van een prototype siliciumwafer waarop computerchips worden gemaakt
Nieuws13 augustus · 22:264 min leestijd

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips

OpenAI brengt GPT-5.6 Sol in een nieuwe servicelaag die tot veertien keer sneller antwoordt, op chips van Cerebras. De toegang loopt via een besloten preview en een tarief is er nog niet.

OpenAI zet GPT-5.6 Sol vanaf vandaag in Ultrafast, een nieuwe servicelaag die tot veertien keer sneller antwoordt dan de standaard en 750 uitvoertokens per seconde haalt op chips van Cerebras, meldt het bedrijf.

Daarmee komt er naast prijs een tweede variabele bij in de inkoop van AI: snelheid. Op GDP-Val, een test met economisch nuttig kenniswerk, zakte de gemiddelde doorlooptijd van een taak van 7,7 minuten naar 83 seconden, zonder dat de kwaliteit terugliep. Voor een agent die meedraait in klantcontact of in een storingsdienst is dat het verschil tussen een gesprek dat stilvalt en een gesprek dat doorloopt. Bestellen kun je het vandaag alleen niet: Ultrafast is een besloten preview en er is nog geen tarief bekend.

Wat er gemeten is, en door wie

De cijfers komen van de chipmaker zelf. Cerebras liet GPT-5.6 Sol op Ultrafast de 2.500 vragen van Humanity's Last Exam beantwoorden in 11 uur en 11 minuten, tegen 78 uur en 27 minuten voor Claude Fable 5 bij vergelijkbare nauwkeurigheid. Die test draaide op 10 juli voor Sol en op 13 tot 15 juli voor Fable 5, in elk geval met de codeeromgeving van de eigen leverancier. Het is een eigen meting van de partij die de hardware verkoopt, geen onafhankelijke benchmark.

De GDP-Val-meting van 31 juli is voor een zakelijke lezer de bruikbaarste, omdat die de hele doorlooptijd van een taak pakt en niet alleen de rekentijd van het model.

Grafiek van Cerebras met de doorlooptijd op GDP-Val. GPT-5.6 Sol Ultrafast komt op 83,0 seconden totaal, GPT-5.6 Sol standaard op 7,7 minuten. Bron: Cerebras Systems
Grafiek van Cerebras met de doorlooptijd op GDP-Val. GPT-5.6 Sol Ultrafast komt op 83,0 seconden totaal, GPT-5.6 Sol standaard op 7,7 minuten. Bron: Cerebras Systems

De winst zit vrijwel volledig in de modelaanroep zelf: 68,1 seconden tegen 7,5 minuten. Het werk eromheen, zoals bestanden openen en gereedschappen aanroepen, blijft rond de 14 seconden hangen. Wie een flow heeft waarin het model maar een klein deel van de tijd opsnoept, koopt met snelheid dus veel minder dan het cijfer van veertien keer suggereert. Dat is de eerste rekensom om zelf te maken voordat je op een wachtlijst gaat staan.

Drie snelheidsklassen, nul prijskaartjes

In de grafiek bij de aankondiging staan drie klassen naast elkaar: Standard op 1x, Priority op 2,5x en Ultrafast op 14x. Het model is in alle drie hetzelfde. Wat verschilt is de hardware eronder en wat je ervoor betaalt, en juist dat laatste ontbreekt.

Staafgrafiek van OpenAI met drie servicelagen voor GPT-5.6 Sol. Ultrafast staat op 14x, Priority op 2,5x en Standard op 1x. Bron: Cerebras Systems
Staafgrafiek van OpenAI met drie servicelagen voor GPT-5.6 Sol. Ultrafast staat op 14x, Priority op 2,5x en Standard op 1x. Bron: Cerebras Systems

Geen van de betrokken partijen noemt een bedrag per miljoen tokens. TechCrunch schrijft dat de laag alleen opengaat voor een kleine groep klanten en meebeweegt met de capaciteit die erbij komt. Jane Street, Podium, Basis en Rogo testen mee. Anthropic heeft met zijn Fast-modus iets vergelijkbaars, maar haalt volgens Cerebras' eigen vergelijking niet dezelfde uitvoersnelheid.

Het contrast met dezelfde dag is scherp. Google maakte Gemini 3.7 Flash direct algemeen beschikbaar en zette er tot 31 december een halve tokenprijs op van 0,75 dollar per miljoen invoertokens, terwijl OpenAI's snelste laag op uitnodiging blijft. Goedkoper is vandaag te koop. Sneller nog niet.

Waarom een wafer dit kan

De versnelling komt niet uit een nieuw model. GPT-5.6 Sol is hetzelfde zware model dat bij zijn brede uitrol 54 procent minder tokens claimde op agentic coding. Cerebras propt 44 GB SRAM op één chip ter grootte van een wafer, waardoor de modelgewichten op de chip blijven staan in plaats van bij elke token heen en weer te reizen naar extern geheugen. Dat geheugenverkeer is op GPU's de rem.

De basis daarvoor ligt er al langer. OpenAI tekende in januari een meerjarige afspraak om 750 megawatt aan rekenkracht met lage latentie aan zijn platform toe te voegen, in tranches tot en met 2028. Voor Europese afnemers is relevant waar die capaciteit landt: Cerebras bouwt tegen eind 2027 200 megawatt aan Europese rekenkracht, met een eerste datacenter in Frankrijk en uitbreiding naar Noorwegen en Finland. Latentie is deels een natuurkundig probleem, en een antwoord dat over de oceaan moet reizen blijft trager dan een antwoord uit Parijs.

De modellenrace ging eerst over wie het slimst was en daarna over wie het goedkoopst was. Er komt nu een derde as bij, en die verandert welke taken je überhaupt aan een model durft te geven. Een storingsanalyse of een controle tijdens het afrekenen heeft weinig aan een antwoord dat zeven minuten later komt. Zolang de snelste laag achter een wachtlijst zit en zonder tarief, is de vraag die je vandaag wél kunt beantwoorden hoeveel van je doorlooptijd nu echt bij het model ligt. Bij de meeste flows blijkt dat minder te zijn dan gedacht.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Snelheid begint bij je koppelingen

Bij de meeste AI-flows die ik tegenkom zit de vertraging niet in het model, maar in het overtypen en wachten eromheen. Ik denk met je mee, ontwerp de keten en bouw hem af, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Gemini-app passeert een miljard maandelijkse gebruikers
Nieuws
4 min

11 aug 22:24

Gemini-app passeert een miljard maandelijkse gebruikers

De Gemini-app telt een miljard maandelijkse gebruikers, evenveel als ChatGPT. Interessanter dan het getal is wat eronder ligt: wie Workspace Business of Enterprise afneemt, betaalt al voor deze assistent.

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027
Nieuws
3 min

10 jul 06:24

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027

Cerebras bouwt tegen eind 2027 200 megawatt aan AI-rekenkracht in Europa, met datacenters in Frankrijk, Noorwegen en Finland. Een lokaal alternatief voor de Nvidia-infrastructuur waar bijna alle Europese AI-fabrieken op draaien, maar hoe soeverein is het?

OpenAI lanceert GPT-5.6 met Sol, Terra en Luna, onder toezicht van Washington
Nieuws
7

26 jun 20:41

OpenAI lanceert GPT-5.6 met Sol, Terra en Luna, onder toezicht van Washington

Nog geen dag na de aankondiging is GPT-5.6 er. OpenAI brengt drie scherp geprijsde modellen uit, Sol, Terra en Luna, met een nieuw record voor programmeerwerk en hetzelfde werk voor minder tokens, maar voorlopig alleen voor klanten die de Trump-regering per geval goedkeurt.

Figma Config 2026: code, animatie en AI op het canvas
Nieuws
5 min

24 jun 20:27

Figma Config 2026: code, animatie en AI op het canvas

Op Config 2026 kreeg Figma een code-laag, ingebouwde animatie, 3D en door AI gegenereerde shaders. De grootste verschuiving zit niet in de functies, maar in wie de AI eronder levert.

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Anthropic zet Claude Code per 14 augustus standaard in auto mode
Nieuws
6 min

8 aug 18:08

Anthropic zet Claude Code per 14 augustus standaard in auto mode

Vanaf 14 augustus start elke nieuwe Claude Code-sessie op Pro, Max en Team in auto mode, waarin een classifier goedkeurt. Wat dat betekent voor teams die handmatige goedkeuring als controlemaatregel hebben vastgelegd.