Computermoederbord met een centrale processor en oplichtende schakelingen
Nieuws24 augustus · 18:104 min leestijd

Nvidia zet Groq 3 LPX in volle productie, Nebius neemt hem als eerste af

Nvidia's Groq 3 LPX is in volle productie: 256 LPU's per rack en 3.400 tokens per seconde voor één gebruiker. Het Amsterdamse Nebius biedt de capaciteit als eerste aan, zonder migratie en zonder bekende prijs.

Nvidia's inferenceversneller Groq 3 LPX is in volle productie, meldde het bedrijf maandag op Hot Chips, en het in Amsterdam gevestigde Nebius neemt de racks als eerste AI-cloud af.

Voor een Nederlands bedrijf dat agents in productie draait, verschuift daarmee de variabele waarop je inkoopt. Een agent zet tientallen modelaanroepen achter elkaar om één opdracht af te maken, en elke stap wacht op de vorige. Wat de doorlooptijd bepaalt is dan niet hoeveel rekenkracht je huurt, maar hoe snel er tokens uit het model komen. Groq 3 LPX is op dat ene getal gebouwd, en de eerste plek waar je die capaciteit kunt afnemen contracteert onder Nederlands recht.

Wat er in één LPX-rack zit

Groq 3 LPX is geen GPU. Het is een decode-versneller die naast Nvidia's Vera Rubin NVL72-systemen hangt en alleen het genereren van tokens overneemt. Eén rack koppelt 256 LPU-versnellers aan 128 gigabyte on-chip SRAM en 640 terabyte per seconde aan scale-up-bandbreedte, vloeistofgekoeld op Nvidia's MGX-architectuur. De GPU's verwerken de lange prompt en de context, terwijl de LPU's elke laag van het model doorrekenen voor elk uitgaand token en per token tussenresultaten met de GPU's uitwisselen.

Het getal waar het om draait is 3.400 uitgaande tokens per seconde voor één gebruiker. Artificial Analysis mat dat op het open model Gemma 4 31B met een context van 100.000 tokens, de snelste score die voor dat model is vastgelegd. Nvidia noemt het vier keer meer responsiviteit dan het dichtstbijzijnde alternatief en projecteert met Vera Rubin NVL72 erbij tot 35 keer meer inferentiedoorvoer per megawatt voor modellen van twee biljoen parameters dan GB200 NVL72. Dat laatste cijfer is een projectie van de fabrikant, geen gemeten benchmark.

Render van het Groq 3 LPX-rack met de vloeistofgekoelde trays vol LPU-versnellers (bron: NVIDIA)
Render van het Groq 3 LPX-rack met de vloeistofgekoelde trays vol LPU-versnellers (bron: NVIDIA)

Waar je de capaciteit kunt huren

Nebius brengt LPX naar Token Factory, zijn productieplatform voor inferentie, en begint met een deel van de modellen. Het toevoegen aan een latency-gevoelige workload is een kwestie van modelkeuze en geen migratie, zegt het bedrijf: dezelfde API, geen nieuwe SDK, geen nieuwe leveranciersrelatie, geen aparte facturatie. "Generatie is de fase van inferentie die bepaalt hoe responsief een AI-systeem echt is", zegt Nebius-CTO Danila Shtan daarover.

De Nederlandse kant zit in de kleine letters. Contractpartij is Nebius B.V., de verwerkersovereenkomst valt onder Nederlands recht, en realtime inferentie draait in datacenters in de EU (Finland en Frankrijk), Israël en de Verenigde Staten, per model zichtbaar aan een landvlag in het platform. Dat is het verschil tussen een snelle demo en iets waar een AVG-verplichting aan kan hangen.

Na Nebius volgt Groq zelf. Het bedrijf dat de LPU bedacht behoort tot de eerste afnemers van het rack waarin zijn eigen technologie verder leeft, en bedient met GroqCloud naar eigen zeggen zes miljoen ontwikkelaars. Een prijs noemt geen van beide partijen.

Van GPU-uren naar tokens per seconde

In maart was LPX nog een aankondiging met een datum: Nvidia zei toen dat de racks beschikbaar zouden komen in de tweede helft van dit jaar. Die belofte is nu ingelost, ruim vier maanden voor het einde van het venster.

De route ernaartoe liep via Groq. Nvidia sloot in december 2025 een niet-exclusieve licentie van 20 miljard dollar op de inferentietechnologie van Groq en haalde oprichter Jonathan Ross en president Sunny Madra binnen. Groq haalde daarna 350 miljoen dollar op bij een waardering van 3,5 miljard en bouwt zijn inference-cloud verder uit op Nvidia-hardware. De onafhankelijke uitdager van weleer is nu afnemer van zijn eigen uitvinding.

Dat snelheid een inkoopvariabele wordt, staat los van dit ene product. De inferentiekosten per agentische workflow vervijfvoudigen tot 2028 terwijl de prijs per token blijft dalen, voorspelt Gartner: niet het tarief beweegt, maar het aantal stappen dat een agent per opdracht zet. Elke stap die eerder klaar is, is wachttijd die zich niet opstapelt.

LPX is ook niet de enige die op dat ene getal mikt. Cerebras claimt met de CS-4 ruim 4.400 tokens per seconde per gebruiker op GPT-OSS-120B, al komt dat cijfer uit eigen metingen en ontbreekt een onafhankelijke benchmark. Nvidia liet een derde partij meten, maar noemt net zomin een prijs of een datum waarop je de capaciteit kunt aanzetten.

De inferentiemarkt splitst zich zo in twee soorten hardware: systemen die je koopt op doorvoer per megawatt, en systemen die je koopt op wachttijd per gebruiker. Wie een agent bouwt die tientallen keren op zichzelf terugvalt voordat er antwoord komt, zit in die tweede categorie. De vraag aan een leverancier verandert daarmee van hoeveel GPU's staan er klaar naar hoeveel tokens per seconde haalt dit endpoint, en dat is een getal dat in het contract hoort te staan.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agents die niet laten wachten

Snellere tokens helpen pas als de keten eromheen klopt. Ik denk met je mee over waar agents in jouw proces echt tijd winnen, ontwerp die keten en bouw en automatiseer hem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Nvidia ontkent plan voor China-specifieke inferentiechip
Nieuws
4

21 aug 04:20

Nvidia ontkent plan voor China-specifieke inferentiechip

Nvidia noemt het bericht dat het eind 2026 een China-specifieke inferentiechip levert onjuist, terwijl The Information zich op twee medewerkers beroept. De uitkomst bepaalt wie aanspraak maakt op schaarse inferentiecapaciteit.

Groq haalt 350 miljoen dollar op en bouwt zijn inference-cloud op Nvidia-hardware
Nieuws
4

17 aug 20:22

Groq haalt 350 miljoen dollar op en bouwt zijn inference-cloud op Nvidia-hardware

Groq haalt 350 miljoen dollar op bij een waardering van 3,5 miljard en bouwt zijn inference-cloud verder uit op Nvidia-hardware. De bekendste onafhankelijke uitdager van Nvidia is nu zelf klant, en dat raakt de prijs van snelle tokens.

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027
Nieuws
3 min

10 jul 06:24

Cerebras bouwt 200 megawatt Europese AI-rekenkracht tegen eind 2027

Cerebras bouwt tegen eind 2027 200 megawatt aan AI-rekenkracht in Europa, met datacenters in Frankrijk, Noorwegen en Finland. Een lokaal alternatief voor de Nvidia-infrastructuur waar bijna alle Europese AI-fabrieken op draaien, maar hoe soeverein is het?

Nvidia praat over investering in Perplexity bij waardering boven 30 miljard dollar
Nieuws
4 min

24 aug 06:09

Nvidia praat over investering in Perplexity bij waardering boven 30 miljard dollar

Nvidia praat over een investering in Perplexity bij een waardering boven 30 miljard dollar, meldt The Information. De geannualiseerde omzet van de AI-zoekmachine steeg dit jaar naar meer dan 750 miljoen dollar.

Anthropic haalt TPU-grondlegger Amir Salek binnen voor eigen chips
Nieuws
3 min

22 aug 12:25

Anthropic haalt TPU-grondlegger Amir Salek binnen voor eigen chips

Anthropic haalt Amir Salek binnen, de man die Googles TPU-programma opzette en zeven chipgeneraties afleverde. Hij versterkt het compute-team dat eigen silicium onder Claude moet leggen. Aan de Claude-factuur verandert vandaag niets.

Nvidia licentieert modelsoftware van Poolside voor 6 miljard dollar
Nieuws
4 min

21 aug 00:21

Nvidia licentieert modelsoftware van Poolside voor 6 miljard dollar

Nvidia betaalt naar verluidt 6 miljard dollar voor een niet-exclusieve licentie op de modelontwikkelsoftware van Poolside en steekt 1 miljard in het bedrijf bij een waardering van 12 miljard. Wat dat doet met het open codeermodel Laguna.