NVIDIA Vera Rubin NVL72 komt op 30 september beperkt beschikbaar op CoreWeave Cloud; Cognition meldt volgens CoreWeave tot 4,8× meer tokendoorvoer dan met GB200 NVL72 voor de SWE-2-inferentie van Devin.
Voor Nederlandse organisaties met zware AI-agenttaken of versterkingsleren komt er een extra cloudroute bij. De Rubin-capaciteit blijft voorlopig beperkt beschikbaar, dus toegang tot voldoende rekenkracht telt mee in de cloudkeuze.
Een rack, twee workloads
Volgens NVIDIA bestaat een Vera Rubin NVL72-rack uit 72 Rubin-GPU's en 36 Vera-CPU's. CoreWeave noemt Cognition, maker van programmeeragent Devin, als eerste klant die productie-AI-agenten op deze capaciteit draait.
De 4,8×-claim vergelijkt Cognitions SWE-2-inferentie met GB200 NVL72. De grafiek toont de relatieve tokendoorvoer per GPU bij verschillende interactiviteitsniveaus. Het gemarkeerde punt van 4,8× geldt bij gelijke interactiviteit.

Voor versterkingsleren noemt CoreWeave 3,8× meer uitvoertokendoorvoer per GPU dan op GB200 NVL72, eveneens bij gelijke interactiviteit.

De aankondiging noemt geen modelversie, absolute tokens per seconde of prijs per token. De cijfers beschrijven dus de geteste workloads en voorspellen niet rechtstreeks de snelheid of kosten voor andere modellen.
CoreWeave verhoogde in augustus de prijzen met 25 procent toen korte-termijncapaciteit uitverkocht was. Voor Nederlandse teams met zware agenttaken telt de gemeten doorvoer daarom samen met de vraag of die capaciteit werkelijk beschikbaar is.
Veelgestelde vragen
Je AI-agentworkload ontwerpen
Ik denk mee over de AI-workload, ontwerp de oplossing en realiseer en automatiseer het hele traject, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.



