d-Matrix koppelt zijn volgende inference-XPU Raptor aan Nvidia’s NVLink Fusion en MGX-rackarchitectuur, met eerste geïntegreerde systemen verwacht in Q4 2027, meldt het bedrijf.
Voor een Nederlandse organisatie die AI-antwoorden in productie laat draaien, verandert daarmee voorlopig vooral de route naar lage wachttijd. Een gespecialiseerde XPU kan straks naast GPU’s in hetzelfde rack werken, terwijl Nvidia de verbinding, racklogica, koeling, stroomvoorziening en een groot deel van de toeleveringsketen levert. Dat opent een extra hardwarepad voor latencygevoelige agents, chatbots en spraakassistenten, maar geen capaciteit die je vandaag kunt bestellen.
Het nieuws is een architectuurkeuze
De samenwerking is een meerjarige productroadmap. d-Matrix wil Raptor verbinden via NVLink Fusion en gebruikt daarbij Nvidia’s Vera CPU’s, NVLink-switches, BlueField-4-DPU’s, ConnectX-9-SuperNIC’s en Spectrum-X-Ethernet. Astera Labs werkt mee aan maatwerk voor de gegevensverbindingen. De rackvariant krijgt modulaire, kabelvrije trays binnen Nvidia’s MGX-ecosysteem.
Raptor moet vóór eind 2026 tape-out gaan, het moment waarop het chipontwerp naar de fabriek wordt gestuurd. De chip wordt volgens d-Matrix al geëvalueerd bij AI-hyperscalers en frontierlabs en steunt op meer dan 100 patenten. Dat maakt de richting concreet, maar verandert de status niet: Raptor is nog geen productiechip en de geïntegreerde MGX-uitvoering is nog niet leverbaar. De eerste beschikbaarheid staat gepland voor Q4 2027.

Latency en energie zitten in de fabric
Bij inference kun je het werk verdelen. GPU’s verwerken de compute-intensieve prefill, waarbij het systeem de prompt en context leest. Raptor moet daarna de decode versnellen, het deel waarin het model token voor token antwoord geeft. Voor een agent die veel modelaanroepen achter elkaar doet, kan juist die wachttijd per stap de totale doorlooptijd bepalen.
Nvidia zegt dat zijn zesde generatie NVLink binnen een domein van 72 XPU’s drie keer lagere XPU-tot-XPU-latency, tien keer hogere packet rates en via NVLink-C2C tot zes keer hogere energie-efficiëntie dan PCIe biedt. Dit zijn platformclaims van Nvidia, geen onafhankelijke Raptor-benchmark en ook geen belofte dat een compleet rack zes keer zo zuinig wordt.
Een onafhankelijk verslag van The Register zet de beoogde schaal op maximaal 144 Raptor-accelerators in één all-to-all NVLink-fabric en schat de rackconfiguratie op circa 2,3 terabyte 3D-DRAM en 7,2 petabyte per seconde aan totale geheugenbandbreedte. Dat zijn gerapporteerde ontwerpdoelen, geen specificaties van hardware die nu te koop is.
Meer keuze in de chip, minder in de rest
Het aantrekkelijke van de route is dat één rackarchitectuur verschillende soorten rekenwerk kan dragen. Een datacenter hoeft voor een XPU niet automatisch een apart spoor voor rackontwerp, voeding, koeling en beheer op te zetten. Voor Nederlandse inkopers kan dat de integratie en latere opschaling vereenvoudigen, zodra de hardware daadwerkelijk beschikbaar is.
De keuzevrijheid verschuift tegelijk. Je krijgt een extra accelerator naast Nvidia-GPU’s, maar de interconnect, switches, netwerkkaarten, DPU’s, rackstandaard en toeleveringsketen blijven grotendeels onderdeel van Nvidia’s stack. The Register beschrijft dat klanten de Raptor-systemen daardoor op dezelfde racks en NVSwitch-fabrics kunnen inzetten als Nvidia’s eigen systemen. De chipkeuze wordt breder, de infrastructuur eromheen niet automatisch.
Dat staat los van Nvidia’s Groq 3 LPX, dat al in volle productie is en via het Amsterdamse Nebius als eerste AI-cloud wordt aangeboden. Daar ging het om productie en afname van een bestaande inferenceversneller. Bij Raptor gaat het nu om de volgende architectuur en de route om die in een Nvidia-rack te krijgen.
De aangekondigde winst zit voorlopig dus in de toekomstige opzet: GPU’s en gespecialiseerde XPU’s kunnen straks hetzelfde rackfundament delen. De concrete waarde voor een bedrijf komt pas na tape-out, productie, gevalideerde software, benchmarks, prijsinformatie en een leverbare Q4 2027-configuratie. NVLink Fusion is vandaag vooral een blauwdruk voor hoe AI-infrastructuur wordt samengesteld, geen capaciteit die je al kunt reserveren.
Veelgestelde vragen
Van architectuur naar werkende AI
Ik help je de juiste AI-architectuur kiezen en realiseren, van eerste ontwerp tot een werkend product en geautomatiseerde processen. Waar het kan bouw ik self-hosted, zodat je grip houdt op data, kosten en leveranciers.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
