Een MSI-grafische kaart met drie ventilatoren in het gras.
Nieuws11 september · 10:224 min leestijd

DeepSeek verkleint GPU-druk met Engram in V4.1-Flash

DeepSeek V4.1-Flash koppelt 196 miljard Engram-parameters aan een kleinere KV-cache. Daardoor verschuift de infrastructuur voor lange AI-agents van alleen GPU-geheugen naar een combinatie van GPU, systeemgeheugen en opslag.

DeepSeek rust V4.1-Flash uit met 196 miljard Engram-parameters; The Register beschrijft hoe het model een deel van de geheugenlast naar systeemgeheugen kan verplaatsen tijdens inference.

Voor Nederlandse AI-teams verandert daarmee de rekensom achter zelf hosten. De totale omvang van een model zegt minder over het aantal GPU's dan de vraag welke parameters actief zijn, welke in hostgeheugen mogen staan en hoe groot de KV-cache bij lange contexten wordt. Voor een API-klant blijft de hardware verborgen; voor een organisatie die zelf serveert, verschuift het ontwerp naar de hele geheugenhiërarchie.

Engram zet vaste patronen naast de transformer

Een transformer berekent telkens opnieuw hoe tokens in hun context samenhangen. Engram probeert een ander soort werk apart te zetten: vaste patronen ophalen uit een grote tabel, zodat de transformer zijn rekenstappen kan gebruiken voor context en redenering.

Het onderzoeksartikel van DeepSeek beschrijft conditioneel geheugen dat lokale n-grams via deterministische hashing naar embeddingtabellen leidt. Per token worden enkele rijen opgehaald, door een poort met de actuele verborgen toestand gewogen en terug in de rekenstroom gebracht. Het gaat dus niet om kant-en-klare antwoorden, maar om vectoren die snel beschikbare patronen aan het model meegeven.

De technische modelkaart meldt dat Engram in V4.1-Flash 196 miljard parameters bevat, slechts via token-gebaseerde lookups wordt aangesproken en samenhangt met een globale KV-cache van 890 bytes per token. Die 196 miljard zijn daarom geen 196 miljard parameters die bij elk token actief rekenen.

Minder HBM, minder blijvende opslag

De winst zit voor lange agenttaken vooral in de cache. DeepSeek schrijft dat V4.1-Flash nog maar een kwart van het HBM-geheugen en een achtste van de SSD-opslag voor de KV-cache nodig heeft, vergeleken met de vorige generatie. HBM is het snelle geheugen naast de GPU; de SSD bewaart cachegegevens die een agent later opnieuw nodig kan hebben.

Officiële DeepSeek-grafiek vergelijkt de globale KV-cache per token, bron: DeepSeek
Officiële DeepSeek-grafiek vergelijkt de globale KV-cache per token, bron: DeepSeek

De architectuur verdeelt het werk ook anders over de modelonderdelen. V4.1-Flash heeft volgens DeepSeek een modelbasis van 552 miljard parameters, maar activeert 8 miljard parameters bij het inlezen van een prompt en 16 miljard bij het genereren van tekst. Engram vergroot daarmee de totale capaciteit zonder dat elke stap de volledige tabel door het GPU-geheugen hoeft te lezen.

Dat maakt vooral verschil bij agents die urenlang tooluitvoer, bronbestanden en tussenstappen meenemen. Een kleinere actieve cache kan meer gelijktijdige sessies op dezelfde geheugenpool toelaten. De modelwinst zit in meer dan tokens per seconde: het bepaalt hoeveel lange trajecten een server tegelijk kan vasthouden.

Waarom 567 GB geen productiespecificatie is

The Register rekent bij FP8 met ongeveer 763 miljard modelparameters en komt uit op circa 567 GB GPU-geheugen als de Engram-gewichten naar systeemgeheugen worden verplaatst. Dat getal is een afgeleide ondergrens voor de gewichten, geen door DeepSeek gepubliceerde minimale serverconfiguratie.

In productie komen de KV-cache, activaties, batchgrootte, parallelle gebruikers en ruimte voor de servingsoftware erbij. Ook moet het systeem de opgehaalde Engram-vectoren op tijd van hostgeheugen naar de GPU brengen. De winst verschuift de bottleneck daarmee van alleen HBM naar de combinatie van systeem-RAM, PCIe- of GPU-interconnect, opslag en geheugentoegang.

Het onderzoek achter Engram rapporteert in een vLLM-proef dat een tabel van 100 miljard parameters volledig in hostgeheugen kon staan met minder dan 3 procent doorvoerimpact. Dat is een onderzoeksresultaat met een eenvoudige implementatie, geen garantie voor elke server, contextlengte of verkeersmix.

Modelgrootte wordt een slechte hardwaremaat

V4.1-Flash combineert de geheugentruc met een contextvenster van 1 miljoen tokens en tijdsafhankelijke API-tarieven. Voor een organisatie die de API gebruikt, blijft de keuze vooral zichtbaar in latency, prijs en gegevensroute. Wie het model zelf serveert, moet ook vastleggen welk deel van de modelcapaciteit in GPU-geheugen staat, welk deel in systeemgeheugen past en hoe caches tussen sessies worden hergebruikt.

De technische betekenis van V4.1-Flash zit daarom niet in een groter getal op de modelkaart. DeepSeek maakt modelcapaciteit losser van GPU-geheugen. Als die aanpak navolging krijgt, wordt het aantal GPU's een steeds slechtere maat voor hoe groot een model werkelijk is en verschuift de kern van inference naar de architectuur van het hele geheugensysteem.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI-geheugen begint bij ontwerp

Ik denk mee over de architectuur, ontwerp de geheugen- en datastromen en bouw het hele AI-systeem end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code
Nieuws
4 min

10 sep 12:14

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code

DeepSeek brengt V4.1-Flash uit met native beeldinvoer, 1 miljoen tokens context en een tijdgebonden API-prijs. De modelkaart toont hogere scores op agentbenchmarks, terwijl caching en Nederlandse piekuren de werkelijke kosten bepalen.

DeepSeek zet experimenteel visiemodel live tegen Flash-tarief
Nieuws
5 min

21 aug 18:25

DeepSeek zet experimenteel visiemodel live tegen Flash-tarief

DeepSeek zet een experimenteel visiemodel live dat afbeeldingen leest voor het tarief van V4-Flash, met maximaal 384 tokens per afbeelding. De vergelijking met Claude Opus 4.8 komt uit DeepSeeks eigen benchmarktabel.

DeepSeek maakt V4 met DSpark tot 85% sneller, en zet de techniek open
Nieuws
5 min

27 jun 22:29

DeepSeek maakt V4 met DSpark tot 85% sneller, en zet de techniek open

DeepSeek bracht DSpark uit, een open techniek die zijn V4-modellen 60 tot 85 procent sneller laat antwoorden zonder kwaliteitsverlies. Voor bedrijven die het model draaien betekent dat lagere kosten per token, zelf-gehost of via de API.

DeepSeek zet gewichten van visiemodel V4-Flash-Vision-Exp online
Nieuws
4 min

1 sep 06:20

DeepSeek zet gewichten van visiemodel V4-Flash-Vision-Exp online

DeepSeek zette de gewichten van visiemodel V4-Flash-Vision-Exp onder de MIT-licentie op Hugging Face. Zelf hosten mag nu zonder regiobeperking, maar de repository weegt 167,8 gigabyte en is nagemeten op vier B200-kaarten.

Drie runs met een goedkoop AI-model vinden meer lekken dan één dure run
Nieuws
5 min

21 aug 12:22

Drie runs met een goedkoop AI-model vinden meer lekken dan één dure run

Aikido verbrandde 11,7 miljard tokens om tien AI-modellen op 32 verse CVE's te testen. Drie runs DeepSeek V4 Pro kosten 295 dollar en vinden er 28, meer dan een enkele pass van Opus 5 of Grok 4.6.

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.