Macro-opname van een siliciumwafer waarop de afzonderlijke chips als vierkanten zichtbaar zijn
Nieuws19 augustus · 04:394 min leestijd

Cerebras lanceert CS-4 en claimt dertig keer meer tokens per seconde dan GPU's

Cerebras lanceert de CS-4, een rack met drie wafer-grote chips dat volgens eigen metingen tot dertig keer meer tokens per seconde haalt dan GPU's. Een onafhankelijke benchmark ontbreekt en een prijs is er niet.

Cerebras lanceert de CS-4, een rack-systeem met drie wafer-grote chips dat volgens het bedrijf zelf tot dertig keer meer tokens per seconde per gebruiker haalt dan GPU-oplossingen. De eerste systemen gaan dit kwartaal de deur uit.

Daarmee krijgt snelheid als inkoopvariabele een tweede serieuze leverancier naast Nvidia. Wie klantcontact of een storingsdienst met agents laat draaien, betaalt vandaag per token en neemt de doorlooptijd erbij zoals die is. Een aanbieder die specifiek op latentie mikt, verschuift welke taken je aan een model durft te geven. Aan je factuur verandert voorlopig niets: er is geen prijs bekend, en je koopt zo'n rack niet zelf maar huurt de capaciteit bij een partij die hem neerzet.

Waar die dertig keer vandaan komt

Het cijfer is een eigen meting van de verkoper. Cerebras zette de CS-4 naast een GPU-systeem op GPT-OSS-120B, gaf beide dezelfde prompts en kwam uit op meer dan 4.400 tokens per seconde per gebruiker. Welk GPU-systeem de tegenpartij was, staat er niet bij. Een onafhankelijke benchmark van de claim is er niet, en in een voetnoot onder het persbericht staat dat de werkelijke doorvoer afhangt van modelarchitectuur, contextlengte, precisie en serveerconfiguratie.

Die dertig keer is bovendien een bovengrens die op één model wordt gehaald. In de eigen grafiek van Cerebras staan zeven modellen naast elkaar, en de zwaardere daarvan (GLM 4.7-355B, Kimi K2.7 1T en GPT-5.6 Sol) blijven duidelijk onder de 4.400 van GPT-OSS-120B. Voor de allergrootste modellen claimt het bedrijf op zijn productpagina meer dan 1.000 tokens per seconde bij meer dan 10 biljoen parameters. Ter vergelijking: de Ultrafast-laag van OpenAI haalt 750 uitvoertokens per seconde voor GPT-5.6 Sol op de huidige Cerebras-hardware, ook een cijfer dat Cerebras zelf mat.

Staafgrafiek van Cerebras met tokens per seconde per gebruiker voor zeven modellen, waarbij de CS-4 op GPT-OSS-120B het hoogst uitkomt en de GPU-staven laag blijven. Bron: Cerebras Systems
Staafgrafiek van Cerebras met tokens per seconde per gebruiker voor zeven modellen, waarbij de CS-4 op GPT-OSS-120B het hoogst uitkomt en de GPU-staven laag blijven. Bron: Cerebras Systems

Wat er in het rack zit

De CS-4 is een rack met drie exemplaren van een nieuwe chip, de Wafer Scale Engine 3 Turbo. Elk exemplaar telt vier biljoen transistoren en 900.000 rekenkernen op 46.225 vierkante millimeter silicium, met 44 GB SRAM direct op de wafer. Per wafer verdubbelt Cerebras de rekenkracht naar 250 PFLOPS en de geheugenbandbreedte naar 43,2 petabyte per seconde. Voor het hele rack komt dat op 750 PFLOPS en 129,6 petabyte per seconde, tegen 125 PFLOPS en 21,6 petabyte per seconde voor één CS-3-wafer.

Die geheugenbandbreedte is het hele punt. Bij het genereren van tekst moet een model voor elke token zijn gewichten langs de rekeneenheden halen, en op GPU's is dat verkeer naar extern geheugen de rem. Cerebras houdt de gewichten op de wafer zelf staan. De rest van het ontwerp volgt daaruit: de stroomomzetting zit nu ongeveer 0,5 millimeter van de processor in plaats van de circa 50 millimeter op een gewone GPU-print, wat verlies op de print vrijwel wegneemt en dubbel zoveel vermogen bij de chip aflevert.

Zijaanzicht van een CS-4-rack met daarnaast de drie losse rekenmodules die achterop het rack worden gehangen, plus een uitvergroting van een module. Bron: Cerebras Systems
Zijaanzicht van een CS-4-rack met daarnaast de drie losse rekenmodules die achterop het rack worden gehangen, plus een uitvergroting van een module. Bron: Cerebras Systems

Praktischer voor wie zo'n systeem moet inpassen: de rekenmodule hangt als losse eenheid achterop het rack, met de helft minder onderdelen dan de vorige generatie, waardoor uitrol volgens Cerebras van dagen naar uren gaat. De wafers praten onderling met een latentie van twee microseconden, tegen vijf bij de CS-3. De koppeling naar bestaande apparatuur loopt over standaard RoCE v2 RDMA op ethernet, en het bedrijf noemt AMD Helios en AWS Trainium als systemen waarmee de CS-4 het werk kan verdelen. Het is dus niet ontworpen om een compleet datacenter te vervangen, maar om ernaast te komen staan.

Wanneer een Nederlandse afnemer er iets van merkt

Voorlopig indirect. Er is geen prijslijst, de eerste systemen worden in het derde kwartaal geleverd en die capaciteit landt bij grote afnemers en in de eigen cloud van Cerebras. Voor Europese gebruikers is de vraag vooral waar de racks komen te staan: Cerebras bouwt tegen eind 2027 200 megawatt aan Europese rekenkracht, met een eerste datacenter in Frankrijk en uitbreiding naar Noorwegen en Finland. Latentie is deels natuurkunde, en een antwoord dat de oceaan over moet blijft trager dan een antwoord uit Parijs.

Bij de lancering kondigde CEO Andrew Feldman de stap daarna al aan: het bedrijf wil tegen eind 2027 vier keer sneller zijn en twintig keer meer doorvoer halen, met 600 megawatt aan eigen rekencapaciteit. Dat moet betaald worden door een bedrijf dat vorig kwartaal een aangepast verlies van 6,9 miljoen dollar boekte op 180,1 miljoen dollar omzet, met een brutomarge die zakte van 46,5 naar 40,6 procent.

De modellenrace ging eerst over wie het slimst was en daarna over wie het goedkoopst was. Wat de CS-4 markeert, is dat snelheid nu een eigen hardwaregeneratie krijgt in plaats van een servicelaag bovenop bestaande capaciteit. Dat maakt die as bestendiger dan een tijdelijke actieprijs, maar niet controleerbaarder: zolang elke vergelijking uit de catalogus van de verkoper komt, is de bruikbare vraag niet hoeveel keer sneller een rack in Sunnyvale is, maar welk deel van jouw doorlooptijd nu echt bij het model ligt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Snelheid is een ontwerpkeuze

Of een agent bruikbaar is, hangt vaker af van hoe je de flow eromheen bouwt dan van de chip eronder. Ik denk mee over die keuze, ontwerp het proces en bouw en automatiseer het vervolgens end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027
Nieuws
3 min

10 jul 06:24

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027

Cerebras bouwt tegen eind 2027 200 megawatt aan AI-rekenkracht in Europa, met datacenters in Frankrijk, Noorwegen en Finland. Een lokaal alternatief voor de Nvidia-infrastructuur waar bijna alle Europese AI-fabrieken op draaien, maar hoe soeverein is het?

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips
Nieuws
4 min

13 aug 22:26

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips

OpenAI brengt GPT-5.6 Sol in een nieuwe servicelaag die tot veertien keer sneller antwoordt, op chips van Cerebras. De toegang loopt via een besloten preview en een tarief is er nog niet.

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer
Nieuws
4 min

20 jul 16:22

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer

AMD daagt Nvidia voor het eerst op systeemniveau uit met Helios, een rack-schaal AI-systeem van 72 versnellers, en strikt Microsoft als afnemer voor Azure. Hoe groot die afname is, maakten beide bedrijven niet bekend.

Nebius boekt 582 miljoen dollar omzet, prijs per megawatt loopt op
Nieuws
4 min

12 aug 20:07

Nebius boekt 582 miljoen dollar omzet, prijs per megawatt loopt op

Nebius boekte 582,3 miljoen dollar omzet in het tweede kwartaal, 454 procent meer dan een jaar eerder. Achter dat cijfer zit vooral een prijssignaal voor iedereen die GPU-capaciteit inkoopt.

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait
Nieuws
4 min

11 aug 20:38

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait

IBM bouwt voor Together AI een inferentiecluster van 240 miljoen dollar op IBM Cloud, met ongeveer 2.000 Nvidia Blackwell-chips in de Verenigde Staten. De capaciteit komt naar verwachting in het eerste kwartaal van 2027 beschikbaar.

Anthropic bevestigt eigen chipteam voor Claude en werft siliciumingenieurs
Nieuws
4 min

5 aug 18:12

Anthropic bevestigt eigen chipteam voor Claude en werft siliciumingenieurs

Anthropic bevestigt dat het een eigen siliciumteam opbouwt om maatwerkchips voor Claude te ontwerpen, met vacatures tot 485.000 dollar. Chips van AWS, Google, Nvidia en AMD blijven volgens het bedrijf centraal staan.