OceanStor M900, Huawei’s nieuwe contextgeheugenopslag, is op 17 september geïntroduceerd voor AI-inferentie in hyperscale datacenters, met tot 64 petabyte gedeelde KV-cache per cluster, meldt Huawei.
Voor een Nederlands AI-team dat lange contexten of meerstapsagenten zelf serveert, verschuift daarmee de infrastructuurvraag. De GPU bepaalt de snelheid en kosten niet als enige. Ook de geheugenlaag die eerdere context bewaart en opnieuw beschikbaar maakt, telt mee. Voor een bedrijf dat een AI-dienst via een API afneemt, blijft die keuze bij de leverancier.
De cache wordt infrastructuur
KV-cache is het werkgeheugen van een model tijdens inferentie. Het bewaart de key- en value-gegevens van eerdere tokens, zodat het systeem die context niet bij elk nieuw token opnieuw hoeft te berekenen. Bij lange contextvensters en meerstapsagenten groeit die cache snel en wordt toegang ertoe een infrastructuurprobleem.
Dit is een opslag- en netwerkverhaal, niet een nieuwe modelarchitectuur. DeepSeek verplaatst in V4.1-Flash een deel van de geheugenlast naar systeemgeheugen en koppelt dat aan een kleinere KV-cache; Huawei schuift de cache door naar een gedeelde laag over on-chip geheugen, DRAM en SSD’s. De OceanStor M900 gebruikt daarvoor Huawei’s UnifiedBus-netwerk en maakt de cache beschikbaar voor meerdere NPU’s in een SuperPoD.

De cijfers zijn vooral infrastructuurcijfers
Huawei zegt dat een cluster met de M900 tot 64 petabyte KV-cache kan leveren en de beschikbare cache per NPU van gigabytes naar terabytes brengt. De opslaglaag is volgens het bedrijf ontworpen voor hergebruik van context tussen inferentiesessies.
De aangekondigde architectuur combineert een CPU, netwerkcontroller en NAND-controller. Daardoor kan een NPU rechtstreeks met SSD’s communiceren, zonder protocolconversie en CPU-doorsturing. Huawei claimt dat de toegangslatentie daarmee daalt van milliseconden naar 60 microseconden, een reductie van 90 procent. Een cluster haalt volgens Huawei 40 TB/s aan toegangsbandbreedte, 1,5 keer de snelheid van vergelijkbare oplossingen. In typische AI-programmeerscenario’s zou de token-doorvoer verdubbelen en de tijd tot het eerste token halveren.
Dat zijn cijfers van de leverancier, geen onafhankelijke benchmark en geen prijskaartje. Ook de levensduur van de opslag krijgt een plek in de rekensom. Huawei zegt dat zijn KV-aware opslagtechniek tot 24 drive writes per day mogelijk maakt, de levensduur van SSD’s zestien keer verlengt en drie jaar stabiliteit biedt.
Waarom opslag nu meetelt
De ontwikkeling staat niet los van de rest van de infrastructuurmarkt. NVIDIA beschrijft KV-cache als een aparte contextlaag tussen schaars GPU-geheugen en gedeelde opslag, omdat lange contexten tegelijk meer capaciteit en snellere toegang vragen. In die benadering is KV-cache tijdelijke, opnieuw berekenbare data die niet dezelfde opslagregels nodig heeft als een klantdossier of financiële administratie.
Daarmee ontstaat een nieuwe middenlaag: sneller en dichter bij de GPU dan gewone opslag, maar veel ruimer dan HBM of DRAM. De winst zit niet in een nieuw model, maar in minder herberekening, minder wachttijd en meer gelijktijdige sessies op dezelfde rekenlaag.
De rekensom voor inkopers
Voor de meeste Nederlandse bedrijven betekent dit niet dat er morgen een M900 in het serverhok staat. Het directe effect zit in de criteria waarmee AI-inferentie wordt ingekocht of ontworpen. Naast GPU-prijs en modelkwaliteit tellen straks ook cache-hitratio, interconnect-latentie, aantal gelijktijdige sessies, token-doorvoer en SSD-slijtage mee.
Wie AI via een API gebruikt, merkt die laag vooral in responstijd en gebruikskosten. Wie zelf modellen draait, moet de volledige geheugenhiërarchie ontwerpen: welke context in HBM blijft, wat naar DRAM gaat en wat gedeeld op SSD’s staat. De introductie van de M900 laat zien dat AI-inferentie daardoor minder een losse chipkeuze wordt en meer een samenspel van model, netwerk en opslag.
Veelgestelde vragen
AI die blijft doorwerken
Ik help je AI van idee naar werkende infrastructuur brengen: ik denk mee over de architectuur, ontwerp de koppelingen en bouw en automatiseer het geheel, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
