Close-up van een elektronische printplaat met een gemonteerde chip
Nieuws11 september · 02:294 min leestijd

d-Matrix kiest Nvidia NVLink Fusion voor inference-racks

d-Matrix kiest Nvidia’s NVLink Fusion voor Raptor, een nieuwe inference-XPU die in dezelfde rackarchitectuur als Nvidia-GPU’s moet werken. De integratie belooft lage latency, maar eerste systemen komen pas in Q4 2027.

d-Matrix koppelt zijn volgende inference-XPU Raptor aan Nvidia’s NVLink Fusion en MGX-rackarchitectuur, met eerste geïntegreerde systemen verwacht in Q4 2027, meldt het bedrijf.

Voor een Nederlandse organisatie die AI-antwoorden in productie laat draaien, verandert daarmee voorlopig vooral de route naar lage wachttijd. Een gespecialiseerde XPU kan straks naast GPU’s in hetzelfde rack werken, terwijl Nvidia de verbinding, racklogica, koeling, stroomvoorziening en een groot deel van de toeleveringsketen levert. Dat opent een extra hardwarepad voor latencygevoelige agents, chatbots en spraakassistenten, maar geen capaciteit die je vandaag kunt bestellen.

Het nieuws is een architectuurkeuze

De samenwerking is een meerjarige productroadmap. d-Matrix wil Raptor verbinden via NVLink Fusion en gebruikt daarbij Nvidia’s Vera CPU’s, NVLink-switches, BlueField-4-DPU’s, ConnectX-9-SuperNIC’s en Spectrum-X-Ethernet. Astera Labs werkt mee aan maatwerk voor de gegevensverbindingen. De rackvariant krijgt modulaire, kabelvrije trays binnen Nvidia’s MGX-ecosysteem.

Raptor moet vóór eind 2026 tape-out gaan, het moment waarop het chipontwerp naar de fabriek wordt gestuurd. De chip wordt volgens d-Matrix al geëvalueerd bij AI-hyperscalers en frontierlabs en steunt op meer dan 100 patenten. Dat maakt de richting concreet, maar verandert de status niet: Raptor is nog geen productiechip en de geïntegreerde MGX-uitvoering is nog niet leverbaar. De eerste beschikbaarheid staat gepland voor Q4 2027.

NVIDIA-weergave van een d-Matrix Raptor-tray, NVLink-switchtray en MGX-rack met NVLink Fusion, Bron: NVIDIA
NVIDIA-weergave van een d-Matrix Raptor-tray, NVLink-switchtray en MGX-rack met NVLink Fusion, Bron: NVIDIA

Latency en energie zitten in de fabric

Bij inference kun je het werk verdelen. GPU’s verwerken de compute-intensieve prefill, waarbij het systeem de prompt en context leest. Raptor moet daarna de decode versnellen, het deel waarin het model token voor token antwoord geeft. Voor een agent die veel modelaanroepen achter elkaar doet, kan juist die wachttijd per stap de totale doorlooptijd bepalen.

Nvidia zegt dat zijn zesde generatie NVLink binnen een domein van 72 XPU’s drie keer lagere XPU-tot-XPU-latency, tien keer hogere packet rates en via NVLink-C2C tot zes keer hogere energie-efficiëntie dan PCIe biedt. Dit zijn platformclaims van Nvidia, geen onafhankelijke Raptor-benchmark en ook geen belofte dat een compleet rack zes keer zo zuinig wordt.

Een onafhankelijk verslag van The Register zet de beoogde schaal op maximaal 144 Raptor-accelerators in één all-to-all NVLink-fabric en schat de rackconfiguratie op circa 2,3 terabyte 3D-DRAM en 7,2 petabyte per seconde aan totale geheugenbandbreedte. Dat zijn gerapporteerde ontwerpdoelen, geen specificaties van hardware die nu te koop is.

Meer keuze in de chip, minder in de rest

Het aantrekkelijke van de route is dat één rackarchitectuur verschillende soorten rekenwerk kan dragen. Een datacenter hoeft voor een XPU niet automatisch een apart spoor voor rackontwerp, voeding, koeling en beheer op te zetten. Voor Nederlandse inkopers kan dat de integratie en latere opschaling vereenvoudigen, zodra de hardware daadwerkelijk beschikbaar is.

De keuzevrijheid verschuift tegelijk. Je krijgt een extra accelerator naast Nvidia-GPU’s, maar de interconnect, switches, netwerkkaarten, DPU’s, rackstandaard en toeleveringsketen blijven grotendeels onderdeel van Nvidia’s stack. The Register beschrijft dat klanten de Raptor-systemen daardoor op dezelfde racks en NVSwitch-fabrics kunnen inzetten als Nvidia’s eigen systemen. De chipkeuze wordt breder, de infrastructuur eromheen niet automatisch.

Dat staat los van Nvidia’s Groq 3 LPX, dat al in volle productie is en via het Amsterdamse Nebius als eerste AI-cloud wordt aangeboden. Daar ging het om productie en afname van een bestaande inferenceversneller. Bij Raptor gaat het nu om de volgende architectuur en de route om die in een Nvidia-rack te krijgen.

De aangekondigde winst zit voorlopig dus in de toekomstige opzet: GPU’s en gespecialiseerde XPU’s kunnen straks hetzelfde rackfundament delen. De concrete waarde voor een bedrijf komt pas na tape-out, productie, gevalideerde software, benchmarks, prijsinformatie en een leverbare Q4 2027-configuratie. NVLink Fusion is vandaag vooral een blauwdruk voor hoe AI-infrastructuur wordt samengesteld, geen capaciteit die je al kunt reserveren.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van architectuur naar werkende AI

Ik help je de juiste AI-architectuur kiezen en realiseren, van eerste ontwerp tot een werkend product en geautomatiseerde processen. Waar het kan bouw ik self-hosted, zodat je grip houdt op data, kosten en leveranciers.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

AWS zet twee miljoen extra Nvidia-GPU's neer in 2027 en 2028
Nieuws
5 min

27 aug 02:09

AWS zet twee miljoen extra Nvidia-GPU's neer in 2027 en 2028

Amazon en Nvidia verdrievoudigen hun afspraak: twee miljoen extra GPU's in 2027 en 2028, bovenop de miljoen van maart. Wie nu een meerjarig cloudcontract tekent, koopt capaciteit die nog gebouwd moet worden.

Nvidia zet Groq 3 LPX in volle productie, Nebius neemt hem als eerste af
Nieuws
4 min

24 aug 18:10

Nvidia zet Groq 3 LPX in volle productie, Nebius neemt hem als eerste af

Nvidia's Groq 3 LPX is in volle productie: 256 LPU's per rack en 3.400 tokens per seconde voor één gebruiker. Het Amsterdamse Nebius biedt de capaciteit als eerste aan, zonder migratie en zonder bekende prijs.

OpenAI meet Jalapeno op 1,9 keer meer tokens per watt dan Blackwell
Nieuws
5 min

27 aug 06:10

OpenAI meet Jalapeno op 1,9 keer meer tokens per watt dan Blackwell

OpenAI publiceerde de eerste gemeten resultaten van zijn Jalapeno-chip: 1,5 tot 1,9 keer meer AI-werk per watt dan de vergeleken Nvidia-systemen. Op kosten per token ontloopt hij Vera Rubin nauwelijks, en de productie loopt pas in 2027 op.

Nvidia ontkent plan voor China-specifieke inferentiechip
Nieuws
4

21 aug 04:20

Nvidia ontkent plan voor China-specifieke inferentiechip

Nvidia noemt het bericht dat het eind 2026 een China-specifieke inferentiechip levert onjuist, terwijl The Information zich op twee medewerkers beroept. De uitkomst bepaalt wie aanspraak maakt op schaarse inferentiecapaciteit.

Groq haalt 350 miljoen dollar op en bouwt zijn inference-cloud op Nvidia-hardware
Nieuws
4

17 aug 20:22

Groq haalt 350 miljoen dollar op en bouwt zijn inference-cloud op Nvidia-hardware

Groq haalt 350 miljoen dollar op bij een waardering van 3,5 miljard en bouwt zijn inference-cloud verder uit op Nvidia-hardware. De bekendste onafhankelijke uitdager van Nvidia is nu zelf klant, en dat raakt de prijs van snelle tokens.

NVIDIA zet open Nemotron-stack in voor eigen supply chain
Nieuws
4 min

10 sep 12:40

NVIDIA zet open Nemotron-stack in voor eigen supply chain

NVIDIA en Palantir zetten open Nemotron-modellen in op NVIDIA’s eigen supply chain. De stack koppelt Foundry, Ontology en cuOpt aan menselijke planners, met een gespecialiseerd model dat 86,7 procent scoort op een ontwikkelbenchmark.