Close-up van server- en netwerkkabels in een datacenter
Nieuws18 september · 01:324 min leestijd

Huawei introduceert OceanStor M900 voor AI-inferentie

Huawei introduceert OceanStor M900 voor AI-inferentie met gedeelde KV-cache tot 64 petabyte per cluster. De opslaglaag moet lange contexten sneller verwerken en de kosten van grootschalige inferentie verlagen.

OceanStor M900, Huawei’s nieuwe contextgeheugenopslag, is op 17 september geïntroduceerd voor AI-inferentie in hyperscale datacenters, met tot 64 petabyte gedeelde KV-cache per cluster, meldt Huawei.

Voor een Nederlands AI-team dat lange contexten of meerstapsagenten zelf serveert, verschuift daarmee de infrastructuurvraag. De GPU bepaalt de snelheid en kosten niet als enige. Ook de geheugenlaag die eerdere context bewaart en opnieuw beschikbaar maakt, telt mee. Voor een bedrijf dat een AI-dienst via een API afneemt, blijft die keuze bij de leverancier.

De cache wordt infrastructuur

KV-cache is het werkgeheugen van een model tijdens inferentie. Het bewaart de key- en value-gegevens van eerdere tokens, zodat het systeem die context niet bij elk nieuw token opnieuw hoeft te berekenen. Bij lange contextvensters en meerstapsagenten groeit die cache snel en wordt toegang ertoe een infrastructuurprobleem.

Dit is een opslag- en netwerkverhaal, niet een nieuwe modelarchitectuur. DeepSeek verplaatst in V4.1-Flash een deel van de geheugenlast naar systeemgeheugen en koppelt dat aan een kleinere KV-cache; Huawei schuift de cache door naar een gedeelde laag over on-chip geheugen, DRAM en SSD’s. De OceanStor M900 gebruikt daarvoor Huawei’s UnifiedBus-netwerk en maakt de cache beschikbaar voor meerdere NPU’s in een SuperPoD.

Serverracks voor Huawei’s contextgeheugenopslag, bron: Huawei
Serverracks voor Huawei’s contextgeheugenopslag, bron: Huawei

De cijfers zijn vooral infrastructuurcijfers

Huawei zegt dat een cluster met de M900 tot 64 petabyte KV-cache kan leveren en de beschikbare cache per NPU van gigabytes naar terabytes brengt. De opslaglaag is volgens het bedrijf ontworpen voor hergebruik van context tussen inferentiesessies.

De aangekondigde architectuur combineert een CPU, netwerkcontroller en NAND-controller. Daardoor kan een NPU rechtstreeks met SSD’s communiceren, zonder protocolconversie en CPU-doorsturing. Huawei claimt dat de toegangslatentie daarmee daalt van milliseconden naar 60 microseconden, een reductie van 90 procent. Een cluster haalt volgens Huawei 40 TB/s aan toegangsbandbreedte, 1,5 keer de snelheid van vergelijkbare oplossingen. In typische AI-programmeerscenario’s zou de token-doorvoer verdubbelen en de tijd tot het eerste token halveren.

Dat zijn cijfers van de leverancier, geen onafhankelijke benchmark en geen prijskaartje. Ook de levensduur van de opslag krijgt een plek in de rekensom. Huawei zegt dat zijn KV-aware opslagtechniek tot 24 drive writes per day mogelijk maakt, de levensduur van SSD’s zestien keer verlengt en drie jaar stabiliteit biedt.

Waarom opslag nu meetelt

De ontwikkeling staat niet los van de rest van de infrastructuurmarkt. NVIDIA beschrijft KV-cache als een aparte contextlaag tussen schaars GPU-geheugen en gedeelde opslag, omdat lange contexten tegelijk meer capaciteit en snellere toegang vragen. In die benadering is KV-cache tijdelijke, opnieuw berekenbare data die niet dezelfde opslagregels nodig heeft als een klantdossier of financiële administratie.

Daarmee ontstaat een nieuwe middenlaag: sneller en dichter bij de GPU dan gewone opslag, maar veel ruimer dan HBM of DRAM. De winst zit niet in een nieuw model, maar in minder herberekening, minder wachttijd en meer gelijktijdige sessies op dezelfde rekenlaag.

De rekensom voor inkopers

Voor de meeste Nederlandse bedrijven betekent dit niet dat er morgen een M900 in het serverhok staat. Het directe effect zit in de criteria waarmee AI-inferentie wordt ingekocht of ontworpen. Naast GPU-prijs en modelkwaliteit tellen straks ook cache-hitratio, interconnect-latentie, aantal gelijktijdige sessies, token-doorvoer en SSD-slijtage mee.

Wie AI via een API gebruikt, merkt die laag vooral in responstijd en gebruikskosten. Wie zelf modellen draait, moet de volledige geheugenhiërarchie ontwerpen: welke context in HBM blijft, wat naar DRAM gaat en wat gedeeld op SSD’s staat. De introductie van de M900 laat zien dat AI-inferentie daardoor minder een losse chipkeuze wordt en meer een samenspel van model, netwerk en opslag.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI die blijft doorwerken

Ik help je AI van idee naar werkende infrastructuur brengen: ik denk mee over de architectuur, ontwerp de koppelingen en bouw en automatiseer het geheel, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

DeepSeek verkleint GPU-druk met Engram in V4.1-Flash
Nieuws
4 min

11 sep 10:22

DeepSeek verkleint GPU-druk met Engram in V4.1-Flash

DeepSeek V4.1-Flash koppelt 196 miljard Engram-parameters aan een kleinere KV-cache. Daardoor verschuift de infrastructuur voor lange AI-agents van alleen GPU-geheugen naar een combinatie van GPU, systeemgeheugen en opslag.

Huawei plant Ascend 960DT en 960PR voor 2027
Nieuws
3 min

17 sep 08:41

Huawei plant Ascend 960DT en 960PR voor 2027

Huawei brengt de 960DT in Q1 2027 en de 960PR in Q3, eerder dan gepland. De roadmap maakt alternatieve AI-hardware concreter en legt voor Nederlandse organisaties de nadruk op software die tussen infrastructuren kan bewegen.

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code
Nieuws
4 min

10 sep 12:14

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code

DeepSeek brengt V4.1-Flash uit met native beeldinvoer, 1 miljoen tokens context en een tijdgebonden API-prijs. De modelkaart toont hogere scores op agentbenchmarks, terwijl caching en Nederlandse piekuren de werkelijke kosten bepalen.

DeepSeek wil 160.000 Huawei-chips in zijn nieuwe datacenter zetten
Nieuws
4

4 sep 12:12

DeepSeek wil 160.000 Huawei-chips in zijn nieuwe datacenter zetten

DeepSeek wil minstens 160.000 Huawei Ascend 950DT-chips in zijn gigawattdatacenter in Binnen-Mongolië zetten, meldt Bloomberg. De chip is pas eind 2026 leverbaar en het uitleveren van de order kan meer dan een jaar duren.

Nvidia versnelt Chinese open modellen en noemt een verbod erop een omzetrisico
Nieuws
4 min

28 aug 06:23

Nvidia versnelt Chinese open modellen en noemt een verbod erop een omzetrisico

Nvidia versnelt Qwen3.8-27B op zijn eigen RTX-kaarten en noemt in het kwartaalrapport van 26 augustus een verbod op DeepSeek, Qwen of Kimi een risico voor zijn resultaten. Die risicoparagraaf staat er al sinds februari.

Klanten van Nvidia krijgen prijsverhoging van meer dan 15 procent op AI-servers
Nieuws
4 min

22 aug 22:07

Klanten van Nvidia krijgen prijsverhoging van meer dan 15 procent op AI-servers

Grote klanten van Nvidia horen dat servers met zijn AI-chips in veel gevallen meer dan 15 procent duurder worden, door gestegen geheugenprijzen. Wat dat doet met je hardware- en cloudrekening voor 2027.