DeepSeek rust V4.1-Flash uit met 196 miljard Engram-parameters; The Register beschrijft hoe het model een deel van de geheugenlast naar systeemgeheugen kan verplaatsen tijdens inference.
Voor Nederlandse AI-teams verandert daarmee de rekensom achter zelf hosten. De totale omvang van een model zegt minder over het aantal GPU's dan de vraag welke parameters actief zijn, welke in hostgeheugen mogen staan en hoe groot de KV-cache bij lange contexten wordt. Voor een API-klant blijft de hardware verborgen; voor een organisatie die zelf serveert, verschuift het ontwerp naar de hele geheugenhiërarchie.
Engram zet vaste patronen naast de transformer
Een transformer berekent telkens opnieuw hoe tokens in hun context samenhangen. Engram probeert een ander soort werk apart te zetten: vaste patronen ophalen uit een grote tabel, zodat de transformer zijn rekenstappen kan gebruiken voor context en redenering.
Het onderzoeksartikel van DeepSeek beschrijft conditioneel geheugen dat lokale n-grams via deterministische hashing naar embeddingtabellen leidt. Per token worden enkele rijen opgehaald, door een poort met de actuele verborgen toestand gewogen en terug in de rekenstroom gebracht. Het gaat dus niet om kant-en-klare antwoorden, maar om vectoren die snel beschikbare patronen aan het model meegeven.
De technische modelkaart meldt dat Engram in V4.1-Flash 196 miljard parameters bevat, slechts via token-gebaseerde lookups wordt aangesproken en samenhangt met een globale KV-cache van 890 bytes per token. Die 196 miljard zijn daarom geen 196 miljard parameters die bij elk token actief rekenen.
Minder HBM, minder blijvende opslag
De winst zit voor lange agenttaken vooral in de cache. DeepSeek schrijft dat V4.1-Flash nog maar een kwart van het HBM-geheugen en een achtste van de SSD-opslag voor de KV-cache nodig heeft, vergeleken met de vorige generatie. HBM is het snelle geheugen naast de GPU; de SSD bewaart cachegegevens die een agent later opnieuw nodig kan hebben.

De architectuur verdeelt het werk ook anders over de modelonderdelen. V4.1-Flash heeft volgens DeepSeek een modelbasis van 552 miljard parameters, maar activeert 8 miljard parameters bij het inlezen van een prompt en 16 miljard bij het genereren van tekst. Engram vergroot daarmee de totale capaciteit zonder dat elke stap de volledige tabel door het GPU-geheugen hoeft te lezen.
Dat maakt vooral verschil bij agents die urenlang tooluitvoer, bronbestanden en tussenstappen meenemen. Een kleinere actieve cache kan meer gelijktijdige sessies op dezelfde geheugenpool toelaten. De modelwinst zit in meer dan tokens per seconde: het bepaalt hoeveel lange trajecten een server tegelijk kan vasthouden.
Waarom 567 GB geen productiespecificatie is
The Register rekent bij FP8 met ongeveer 763 miljard modelparameters en komt uit op circa 567 GB GPU-geheugen als de Engram-gewichten naar systeemgeheugen worden verplaatst. Dat getal is een afgeleide ondergrens voor de gewichten, geen door DeepSeek gepubliceerde minimale serverconfiguratie.
In productie komen de KV-cache, activaties, batchgrootte, parallelle gebruikers en ruimte voor de servingsoftware erbij. Ook moet het systeem de opgehaalde Engram-vectoren op tijd van hostgeheugen naar de GPU brengen. De winst verschuift de bottleneck daarmee van alleen HBM naar de combinatie van systeem-RAM, PCIe- of GPU-interconnect, opslag en geheugentoegang.
Het onderzoek achter Engram rapporteert in een vLLM-proef dat een tabel van 100 miljard parameters volledig in hostgeheugen kon staan met minder dan 3 procent doorvoerimpact. Dat is een onderzoeksresultaat met een eenvoudige implementatie, geen garantie voor elke server, contextlengte of verkeersmix.
Modelgrootte wordt een slechte hardwaremaat
V4.1-Flash combineert de geheugentruc met een contextvenster van 1 miljoen tokens en tijdsafhankelijke API-tarieven. Voor een organisatie die de API gebruikt, blijft de keuze vooral zichtbaar in latency, prijs en gegevensroute. Wie het model zelf serveert, moet ook vastleggen welk deel van de modelcapaciteit in GPU-geheugen staat, welk deel in systeemgeheugen past en hoe caches tussen sessies worden hergebruikt.
De technische betekenis van V4.1-Flash zit daarom niet in een groter getal op de modelkaart. DeepSeek maakt modelcapaciteit losser van GPU-geheugen. Als die aanpak navolging krijgt, wordt het aantal GPU's een steeds slechtere maat voor hoe groot een model werkelijk is en verschuift de kern van inference naar de architectuur van het hele geheugensysteem.
Veelgestelde vragen
AI-geheugen begint bij ontwerp
Ik denk mee over de architectuur, ontwerp de geheugen- en datastromen en bouw het hele AI-systeem end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
