Nvidia's inferenceversneller Groq 3 LPX is in volle productie, meldde het bedrijf maandag op Hot Chips, en het in Amsterdam gevestigde Nebius neemt de racks als eerste AI-cloud af.
Voor een Nederlands bedrijf dat agents in productie draait, verschuift daarmee de variabele waarop je inkoopt. Een agent zet tientallen modelaanroepen achter elkaar om één opdracht af te maken, en elke stap wacht op de vorige. Wat de doorlooptijd bepaalt is dan niet hoeveel rekenkracht je huurt, maar hoe snel er tokens uit het model komen. Groq 3 LPX is op dat ene getal gebouwd, en de eerste plek waar je die capaciteit kunt afnemen contracteert onder Nederlands recht.
Wat er in één LPX-rack zit
Groq 3 LPX is geen GPU. Het is een decode-versneller die naast Nvidia's Vera Rubin NVL72-systemen hangt en alleen het genereren van tokens overneemt. Eén rack koppelt 256 LPU-versnellers aan 128 gigabyte on-chip SRAM en 640 terabyte per seconde aan scale-up-bandbreedte, vloeistofgekoeld op Nvidia's MGX-architectuur. De GPU's verwerken de lange prompt en de context, terwijl de LPU's elke laag van het model doorrekenen voor elk uitgaand token en per token tussenresultaten met de GPU's uitwisselen.
Het getal waar het om draait is 3.400 uitgaande tokens per seconde voor één gebruiker. Artificial Analysis mat dat op het open model Gemma 4 31B met een context van 100.000 tokens, de snelste score die voor dat model is vastgelegd. Nvidia noemt het vier keer meer responsiviteit dan het dichtstbijzijnde alternatief en projecteert met Vera Rubin NVL72 erbij tot 35 keer meer inferentiedoorvoer per megawatt voor modellen van twee biljoen parameters dan GB200 NVL72. Dat laatste cijfer is een projectie van de fabrikant, geen gemeten benchmark.

Waar je de capaciteit kunt huren
Nebius brengt LPX naar Token Factory, zijn productieplatform voor inferentie, en begint met een deel van de modellen. Het toevoegen aan een latency-gevoelige workload is een kwestie van modelkeuze en geen migratie, zegt het bedrijf: dezelfde API, geen nieuwe SDK, geen nieuwe leveranciersrelatie, geen aparte facturatie. "Generatie is de fase van inferentie die bepaalt hoe responsief een AI-systeem echt is", zegt Nebius-CTO Danila Shtan daarover.
De Nederlandse kant zit in de kleine letters. Contractpartij is Nebius B.V., de verwerkersovereenkomst valt onder Nederlands recht, en realtime inferentie draait in datacenters in de EU (Finland en Frankrijk), Israël en de Verenigde Staten, per model zichtbaar aan een landvlag in het platform. Dat is het verschil tussen een snelle demo en iets waar een AVG-verplichting aan kan hangen.
Na Nebius volgt Groq zelf. Het bedrijf dat de LPU bedacht behoort tot de eerste afnemers van het rack waarin zijn eigen technologie verder leeft, en bedient met GroqCloud naar eigen zeggen zes miljoen ontwikkelaars. Een prijs noemt geen van beide partijen.
Van GPU-uren naar tokens per seconde
In maart was LPX nog een aankondiging met een datum: Nvidia zei toen dat de racks beschikbaar zouden komen in de tweede helft van dit jaar. Die belofte is nu ingelost, ruim vier maanden voor het einde van het venster.
De route ernaartoe liep via Groq. Nvidia sloot in december 2025 een niet-exclusieve licentie van 20 miljard dollar op de inferentietechnologie van Groq en haalde oprichter Jonathan Ross en president Sunny Madra binnen. Groq haalde daarna 350 miljoen dollar op bij een waardering van 3,5 miljard en bouwt zijn inference-cloud verder uit op Nvidia-hardware. De onafhankelijke uitdager van weleer is nu afnemer van zijn eigen uitvinding.
Dat snelheid een inkoopvariabele wordt, staat los van dit ene product. De inferentiekosten per agentische workflow vervijfvoudigen tot 2028 terwijl de prijs per token blijft dalen, voorspelt Gartner: niet het tarief beweegt, maar het aantal stappen dat een agent per opdracht zet. Elke stap die eerder klaar is, is wachttijd die zich niet opstapelt.
LPX is ook niet de enige die op dat ene getal mikt. Cerebras claimt met de CS-4 ruim 4.400 tokens per seconde per gebruiker op GPT-OSS-120B, al komt dat cijfer uit eigen metingen en ontbreekt een onafhankelijke benchmark. Nvidia liet een derde partij meten, maar noemt net zomin een prijs of een datum waarop je de capaciteit kunt aanzetten.
De inferentiemarkt splitst zich zo in twee soorten hardware: systemen die je koopt op doorvoer per megawatt, en systemen die je koopt op wachttijd per gebruiker. Wie een agent bouwt die tientallen keren op zichzelf terugvalt voordat er antwoord komt, zit in die tweede categorie. De vraag aan een leverancier verandert daarmee van hoeveel GPU's staan er klaar naar hoeveel tokens per seconde haalt dit endpoint, en dat is een getal dat in het contract hoort te staan.
Veelgestelde vragen
Agents die niet laten wachten
Snellere tokens helpen pas als de keten eromheen klopt. Ik denk met je mee over waar agents in jouw proces echt tijd winnen, ontwerp die keten en bouw en automatiseer hem, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
