AMD toonde op IFA 2026 in Berlijn een prototype-werkstation, de Threadripper Halo Station, dat met 96 processorcores en twee Instinct-versnellers grote AI-modellen lokaal moet draaien.
Bestellen kan niet. AMD noemde geen prijs, geen OEM-partner en publiceerde geen benchmarks, en op zijn eigen productpagina staat dat de machine pas in 2027 op de markt komt. Voor een Nederlandse organisatie die AI-werk binnen de eigen muren wil houden verandert er deze maand dus niets. Wat wel verschuift is het plafond. Lokale AI betekende tot nu toe een machine met tientallen gigabytes geheugen en modellen die je flink moet inkrimpen. AMD zet nu 288 GB snel HBM3E-geheugen naast een processor op een bureau, met een pad naar 576 GB. Op die maat gaat de afweging tussen een cloud-API en eigen hardware er over twee jaar anders uitzien.
Wat er in de kast staat
De Halo Station is in feite een serverlade in een torenkast. Als host zit er een Ryzen Threadripper PRO 9995WX in: 96 Zen 5-cores, 192 threads, tot 5,4 GHz, acht DDR5-kanalen en 128 PCIe 5.0-lanes, bij een TDP van 350 watt. Ernaast staan twee Instinct MI350P-kaarten, elk met 128 CDNA 4-rekeneenheden en 144 GB HBM3E op maximaal 4 TB/s. Samen 288 GB. AMD spreekt van een pad naar vier kaarten, goed voor 576 GB.
Alles in de machine is vloeistofgekoeld, de versnellers inbegrepen. Dat is de eerste vloeistofgekoelde uitvoering van de MI350P die AMD aanbiedt, een kaart die tot nu toe alleen in rackservers zat. Op systeemniveau noemt AMD tot 2 TB DDR5-werkgeheugen, 2,6 TB totaal systeemgeheugen en 16,4 TB/s aan gecombineerde geheugenbandbreedte.
Het biljoen aan parameters is een geheugensom
AMD presenteerde de machine op het podium als het krachtigste werkstation ter wereld en zei dat hij modellen van meer dan een biljoen parameters lokaal draait. Dat getal is vooral rekenkunde. Een dicht model van een biljoen parameters vraagt in 16-bit ongeveer 2 TB alleen voor de gewichten, in 8-bit rond de 1 TB en in 4-bit ruwweg 500 GB, en daar komt nog werkgeheugen bovenop.
De opstelling die in Berlijn stond haalt dat met 288 GB niet zonder een fors deel van het model naar het veel tragere DDR5 te schuiven. De variant met vier kaarten en 576 GB komt wel in de buurt, mits het model zwaar gekwantiseerd is. Precies die vier-kaartsversie heeft AMD nog niet laten zien. Ook onafhankelijke benchmarks ontbreken, dus de superlatief blijft voorlopig een fabrikantsclaim.
De rekening: componenten en kilowatts
Omdat AMD geen prijs noemde, telde Tom's Hardware de losse onderdelen op en komt uit op ruim 100.000 dollar aan alleen de kerncomponenten. Een losse 9995WX kost rond 11.000 tot 12.000 dollar. Een MI350P gaat naar schatting voor 20.000 dollar per stuk en 2 TB DDR5 kost op dit moment ongeveer 50.000 dollar. Met opslag, voeding en koeling erbij loopt het richting 150.000 dollar.
Stroom is de tweede rem. Elke MI350P is gespecificeerd op maximaal 600 watt en de Threadripper op 350 watt, dus twee kaarten plus processor zitten al rond de 1.550 watt voordat je geheugen, opslag en ventilatoren meetelt. In de vier-kaartsopstelling gaat er 2,4 kilowatt naar de versnellers alleen. Een machine die zoveel warmte in een kantoorruimte dumpt, vraagt om een eigen groep en om koeling die verder gaat dan een raam openzetten.
Naast Nvidia's DGX Station
De vergelijking die AMD zelf trekt is met Nvidia's DGX Station. In de voetnoot bij die claim rekent AMD de vier-kaartsopstelling af tegen een DGX Station met een enkele GB300-superchip, 252 GB HBM3e en 496 GB LPDDR5X, en komt zo op tot 3,4 keer zoveel totaal systeemgeheugen.
Het architectuurverschil weegt daarbij zwaarder dan dat getal. Nvidia bouwt een geïntegreerde superchip; AMD zet losse PCIe-versnellers in een klassiek werkstationplatform met veel lanes en veel gewoon werkgeheugen. Dat is flexibeler, maar het maakt de machine niet vanzelf sneller op echt AI-werk. En AMD stuurt de kaarten aan met ROCm, niet met CUDA. Wie zijn hele stack op CUDA heeft staan, verhuist niet in een middag.
Waar dit naartoe wijst
De Halo Station past in een beweging die op dezelfde beurs zichtbaar werd. Nvidia bracht er PAIR uit, software die pc's op een netwerk koppelt maar uitdrukkelijk geen GPU-geheugen bundelt en geen model over machines knipt. Wat op geen enkele machine past, past gekoppeld ook nergens. AMD valt het omgekeerde uiteinde aan: geef een enkele machine zoveel geheugen dat het model er wel in past. Dezelfde MI350P die hier onder een waterblok ligt, zette AMD in juli nog neer als instapmodel van zijn Instinct-lijn met een claim van 4,2 keer meer tokens per seconde per dollar dan de concurrentie, bedoeld voor racks in datacenters.
Dat is de verschuiving die telt. Hardware die tot voor kort alleen als rack werd verkocht, komt als losse machine op de markt, en het geheugen dat een organisatie zelf kan bezitten groeit van tientallen naar honderden gigabytes. Voor wie data en modellen om juridische of contractuele redenen binnen het eigen pand houdt, is dat het verschil tussen een uitgeklede en een volwaardige modelkeuze. De prijs voor die vrijheid ligt in 2027 vermoedelijk boven de honderdduizend dollar, en dat maakt het voorlopig een verhaal over richting, niet over een offerte.
Veelgestelde vragen
AI op je eigen hardware
Of je AI nu in de cloud draait of straks op eigen ijzer, de winst zit in de keten eromheen. Ik denk mee over de opzet, ontwerp de werkstroom en bouw en automatiseer hem, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
