Macro-opname van een siliciumwafer waarop de afzonderlijke chips als vierkanten zichtbaar zijn
Nieuws19 augustus · 04:394 min leestijd

Cerebras lanceert CS-4 en claimt dertig keer meer tokens per seconde dan GPU's

Cerebras lanceert de CS-4, een rack met drie wafer-grote chips dat volgens eigen metingen tot dertig keer meer tokens per seconde haalt dan GPU's. Een onafhankelijke benchmark ontbreekt en een prijs is er niet.

Cerebras lanceert de CS-4, een rack-systeem met drie wafer-grote chips dat volgens het bedrijf zelf tot dertig keer meer tokens per seconde per gebruiker haalt dan GPU-oplossingen. De eerste systemen gaan dit kwartaal de deur uit.

Daarmee krijgt snelheid als inkoopvariabele een tweede serieuze leverancier naast Nvidia. Wie klantcontact of een storingsdienst met agents laat draaien, betaalt vandaag per token en neemt de doorlooptijd erbij zoals die is. Een aanbieder die specifiek op latentie mikt, verschuift welke taken je aan een model durft te geven. Aan je factuur verandert voorlopig niets: er is geen prijs bekend, en je koopt zo'n rack niet zelf maar huurt de capaciteit bij een partij die hem neerzet.

Waar die dertig keer vandaan komt

Het cijfer is een eigen meting van de verkoper. Cerebras zette de CS-4 naast een GPU-systeem op GPT-OSS-120B, gaf beide dezelfde prompts en kwam uit op meer dan 4.400 tokens per seconde per gebruiker. Welk GPU-systeem de tegenpartij was, staat er niet bij. Een onafhankelijke benchmark van de claim is er niet, en in een voetnoot onder het persbericht staat dat de werkelijke doorvoer afhangt van modelarchitectuur, contextlengte, precisie en serveerconfiguratie.

Die dertig keer is bovendien een bovengrens die op één model wordt gehaald. In de eigen grafiek van Cerebras staan zeven modellen naast elkaar, en de zwaardere daarvan (GLM 4.7-355B, Kimi K2.7 1T en GPT-5.6 Sol) blijven duidelijk onder de 4.400 van GPT-OSS-120B. Voor de allergrootste modellen claimt het bedrijf op zijn productpagina meer dan 1.000 tokens per seconde bij meer dan 10 biljoen parameters. Ter vergelijking: de Ultrafast-laag van OpenAI haalt 750 uitvoertokens per seconde voor GPT-5.6 Sol op de huidige Cerebras-hardware, ook een cijfer dat Cerebras zelf mat.

Staafgrafiek van Cerebras met tokens per seconde per gebruiker voor zeven modellen, waarbij de CS-4 op GPT-OSS-120B het hoogst uitkomt en de GPU-staven laag blijven. Bron: Cerebras Systems
Staafgrafiek van Cerebras met tokens per seconde per gebruiker voor zeven modellen, waarbij de CS-4 op GPT-OSS-120B het hoogst uitkomt en de GPU-staven laag blijven. Bron: Cerebras Systems

Wat er in het rack zit

De CS-4 is een rack met drie exemplaren van een nieuwe chip, de Wafer Scale Engine 3 Turbo. Elk exemplaar telt vier biljoen transistoren en 900.000 rekenkernen op 46.225 vierkante millimeter silicium, met 44 GB SRAM direct op de wafer. Per wafer verdubbelt Cerebras de rekenkracht naar 250 PFLOPS en de geheugenbandbreedte naar 43,2 petabyte per seconde. Voor het hele rack komt dat op 750 PFLOPS en 129,6 petabyte per seconde, tegen 125 PFLOPS en 21,6 petabyte per seconde voor één CS-3-wafer.

Die geheugenbandbreedte is het hele punt. Bij het genereren van tekst moet een model voor elke token zijn gewichten langs de rekeneenheden halen, en op GPU's is dat verkeer naar extern geheugen de rem. Cerebras houdt de gewichten op de wafer zelf staan. De rest van het ontwerp volgt daaruit: de stroomomzetting zit nu ongeveer 0,5 millimeter van de processor in plaats van de circa 50 millimeter op een gewone GPU-print, wat verlies op de print vrijwel wegneemt en dubbel zoveel vermogen bij de chip aflevert.

Zijaanzicht van een CS-4-rack met daarnaast de drie losse rekenmodules die achterop het rack worden gehangen, plus een uitvergroting van een module. Bron: Cerebras Systems
Zijaanzicht van een CS-4-rack met daarnaast de drie losse rekenmodules die achterop het rack worden gehangen, plus een uitvergroting van een module. Bron: Cerebras Systems

Praktischer voor wie zo'n systeem moet inpassen: de rekenmodule hangt als losse eenheid achterop het rack, met de helft minder onderdelen dan de vorige generatie, waardoor uitrol volgens Cerebras van dagen naar uren gaat. De wafers praten onderling met een latentie van twee microseconden, tegen vijf bij de CS-3. De koppeling naar bestaande apparatuur loopt over standaard RoCE v2 RDMA op ethernet, en het bedrijf noemt AMD Helios en AWS Trainium als systemen waarmee de CS-4 het werk kan verdelen. Het is dus niet ontworpen om een compleet datacenter te vervangen, maar om ernaast te komen staan.

Wanneer een Nederlandse afnemer er iets van merkt

Voorlopig indirect. Er is geen prijslijst, de eerste systemen worden in het derde kwartaal geleverd en die capaciteit landt bij grote afnemers en in de eigen cloud van Cerebras. Voor Europese gebruikers is de vraag vooral waar de racks komen te staan: Cerebras bouwt tegen eind 2027 200 megawatt aan Europese rekenkracht, met een eerste datacenter in Frankrijk en uitbreiding naar Noorwegen en Finland. Latentie is deels natuurkunde, en een antwoord dat de oceaan over moet blijft trager dan een antwoord uit Parijs.

Bij de lancering kondigde CEO Andrew Feldman de stap daarna al aan: het bedrijf wil tegen eind 2027 vier keer sneller zijn en twintig keer meer doorvoer halen, met 600 megawatt aan eigen rekencapaciteit. Dat moet betaald worden door een bedrijf dat vorig kwartaal een aangepast verlies van 6,9 miljoen dollar boekte op 180,1 miljoen dollar omzet, met een brutomarge die zakte van 46,5 naar 40,6 procent.

De modellenrace ging eerst over wie het slimst was en daarna over wie het goedkoopst was. Wat de CS-4 markeert, is dat snelheid nu een eigen hardwaregeneratie krijgt in plaats van een servicelaag bovenop bestaande capaciteit. Dat maakt die as bestendiger dan een tijdelijke actieprijs, maar niet controleerbaarder: zolang elke vergelijking uit de catalogus van de verkoper komt, is de bruikbare vraag niet hoeveel keer sneller een rack in Sunnyvale is, maar welk deel van jouw doorlooptijd nu echt bij het model ligt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Snelheid is een ontwerpkeuze

Of een agent bruikbaar is, hangt vaker af van hoe je de flow eromheen bouwt dan van de chip eronder. Ik denk mee over die keuze, ontwerp het proces en bouw en automatiseer het vervolgens end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027
Nieuws
3 min

10 jul 06:24

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027

Cerebras bouwt tegen eind 2027 200 megawatt aan AI-rekenkracht in Europa, met datacenters in Frankrijk, Noorwegen en Finland. Een lokaal alternatief voor de Nvidia-infrastructuur waar bijna alle Europese AI-fabrieken op draaien, maar hoe soeverein is het?

Cerebras legt 165 megawatt AI-capaciteit vast in het Finse Mikkeli
Nieuws
4 min

1 sep 16:21

Cerebras legt 165 megawatt AI-capaciteit vast in het Finse Mikkeli

Cerebras legt onder zevenjarige contracten 165 megawatt AI-capaciteit vast in Mikkeli, Finland, samen met Compute Nordic. De eerste 50 megawatt is in aanbouw. Wat dat betekent voor rekenkracht binnen de EU.

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips
Nieuws
4 min

13 aug 22:26

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips

OpenAI brengt GPT-5.6 Sol in een nieuwe servicelaag die tot veertien keer sneller antwoordt, op chips van Cerebras. De toegang loopt via een besloten preview en een tarief is er nog niet.

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer
Nieuws
4 min

20 jul 16:22

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer

AMD daagt Nvidia voor het eerst op systeemniveau uit met Helios, een rack-schaal AI-systeem van 72 versnellers, en strikt Microsoft als afnemer voor Azure. Hoe groot die afname is, maakten beide bedrijven niet bekend.

Google investeert 13 miljard euro in Finse digitale infrastructuur
Nieuws
4 min

9 sep 10:17

Google investeert 13 miljard euro in Finse digitale infrastructuur

Google steekt de komende twee jaar 13 miljard euro in Finse digitale infrastructuur, schone energie en lokale partnerschappen. Hamina biedt al Europese cloud- en AI-capaciteit, maar Google belooft klanten nog geen extra volume of nieuwe diensten.

Flower Labs lanceert Endeavor 1.0, een frontier-model dat je zelf kunt hosten
Nieuws
5 min

1 sep 14:10

Flower Labs lanceert Endeavor 1.0, een frontier-model dat je zelf kunt hosten

Flower Labs brengt Endeavor 1.0 uit, een frontier-model dat je zelf kunt hosten. Op de eigen benchmarks wint het een test van GPT-5.6 Sol en verliest het er twee. Onafhankelijke cijfers ontbreken.