Computerscherm met broncode in blauw en groen licht
Nieuws10 september · 12:144 min leestijd

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code

DeepSeek brengt V4.1-Flash uit met native beeldinvoer, 1 miljoen tokens context en een tijdgebonden API-prijs. De modelkaart toont hogere scores op agentbenchmarks, terwijl caching en Nederlandse piekuren de werkelijke kosten bepalen.

DeepSeek brengt op 10 september V4.1-Flash uit als multimodaal model voor agents en code, met een nieuw tariefschema vanaf 04:00 UTC, meldt het bedrijf.

Voor een Nederlands bedrijf verschuift de rekensom op twee punten. Eén API-model verwerkt tekst, code en afbeeldingen met een contextvenster van 1 miljoen tokens. Tegelijk hangt de prijs af van het tijdstip en van hergebruikte context: de officiële prijstabel noemt buiten de piek $0,15 per miljoen inputtokens bij een cachemisser, $0,003 bij een cachetreffer en $0,60 per miljoen outputtokens. Tijdens de piekuren verdubbelen die bedragen. Ter vergelijking: V4-Pro staat in dezelfde prijstabel op $0,66 per miljoen inputtokens bij een cachemisser en $1,98 per miljoen outputtokens buiten de piek. De Flash-variant is daar ongeveer 77 procent goedkoper op input en 70 procent op output, voordat het verbruik per taak wordt meegerekend.

De API-prijs volgt de klok

De nieuwe tarieven gelden sinds 04:00 UTC op 10 september, dus sinds 06:00 Nederlandse zomertijd. Op werkdagen liggen de piekuren van 01:00 tot 04:00 en van 06:00 tot 10:00 UTC. Dat tweede blok valt in Nederland tussen 08:00 en 12:00 uur. Een interactieve agent die in de ochtend draait, krijgt daardoor een andere kostprijs dan dezelfde workflow buiten het piekvenster.

De cache maakt nog een tweede verschil. Een stabiele systeemprompt of vaste documentcontext kan als cachetreffer worden hergebruikt tegen $0,003 per miljoen inputtokens. Bij een misser is dat vijftig keer duurder. De prijs van een agent wordt daarmee bepaald door het gekozen model, de manier waarop de context wordt opgebouwd en het moment waarop het werk draait.

Een model voor tekst, beeld en tools

V4.1-Flash heeft volgens de technische modelkaart een MoE-architectuur met 552 miljard backbone-parameters. Door de nieuwe Causal Encoder-Decoder-architectuur activeert het model 8 miljard parameters per token tijdens het inlezen van input en 16 miljard tijdens het genereren van output. Het model ondersteunt tekst en beeld native, kan tot 1 miljoen tokens context verwerken en heeft een instelbare redeneerinspanning van 1 tot 100.

DeepSeek zegt dat de nieuwe architectuur ook het geheugen voor lange contexten verkleint. De KV-cache vraagt een kwart van het HBM-geheugen en een achtste van de SSD-opslag van de vorige generatie. Dat raakt vooral agents die dezelfde bestanden, instructies en tussenstappen over veel acties meenemen. Minder modelgeheugen verlaagt niet automatisch elke API-factuur, maar kan hoge doorvoer en lange agenttaken technisch minder zwaar maken.

De agentbenchmarks zijn concreet

In de officiële modelkaart van V4.1-Flash staan, gemeten met maximale redeneerinspanning, 90,6 op Terminal-Bench 2.1 tegenover 87,9 voor V4-Pro en 82,7 voor de vorige V4-Flash. Op DeepSWE v1.1 staat het model op 74,2, tegenover 62,7 voor V4-Pro. Op CyberGym komt het uit op 88,1, tegenover 83,3 voor Pro.

Officiële DeepSeek-grafiek vergelijkt V4.1-Flash met andere modellen op agentbenchmarks. Bron: DeepSeek via Hugging Face
Officiële DeepSeek-grafiek vergelijkt V4.1-Flash met andere modellen op agentbenchmarks. Bron: DeepSeek via Hugging Face

Die cijfers zijn geen onafhankelijke producttest. DeepSeek vermeldt dat de code-agentbenchmarks met DeepSeek Harness Minimal mode zijn gedraaid, met maximale redeneerinspanning, temperature=1.0 en top_p=0.95. De scores maken de prestatieclaim controleerbaar, maar zeggen nog niet hoeveel fouten een agent in een specifiek Nederlands proces maakt of wat één taak daar werkelijk kost.

Bestaande koppelingen blijven bruikbaar

Op de API heet het model deepseek-flash. De documentatie noemt ondersteuning voor tool calls, de Responses API, de OpenAI-indeling, de Anthropic-indeling en beeldinvoer. De oude modelnamen deepseek-v4-flash en deepseek-v4-flash-vision-exp blijven voor compatibiliteit tijdelijk naar V4.1-Flash routeren.

Vanaf 04:00 UTC op 14 september worden verzoeken aan deepseek-v4-pro eveneens naar V4.1-Flash gestuurd en tegen het Flash-tarief afgerekend, totdat V4.1-Pro verschijnt. Voor organisaties die Pro-verkeer gebruiken, verandert dan dus de feitelijke modelroute zonder dat de aanvraagnaam meteen verandert.

De gewichten staan onder een MIT-licentie op Hugging Face en de modelkaart beschrijft inzet met onder meer vLLM en SGLang. Tegelijk gaat het om een model met honderden miljarden parameters. DeepSeek noemt zelf een opslagcluster en 2.000 GPU's als voorbeeld voor grootschalige implementaties. Voor de meeste Nederlandse organisaties ligt de eerste toegang daarom bij de API; zelf hosten is een afzonderlijke infrastructuurkeuze.

De aangekondigde dubbele piektarieven in het Nederlandse ochtendblok krijgen met deze release een concrete ingangsdatum. V4.1-Flash maakt daarmee zichtbaar waar modelkeuze naartoe schuift: prestaties, beeldinvoer, caching, planning en databeheer bepalen samen de kosten van een agent, niet één leaderboardscore.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van model naar agent

Ik help je de stap van modelkeuze naar een werkende AI-agent zetten, van meedenken en ontwerp tot realiseren en automatiseren. Ik bouw de hele keten end-to-end en houd self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

DeepSeek verkleint GPU-druk met Engram in V4.1-Flash
Nieuws
4 min

11 sep 10:22

DeepSeek verkleint GPU-druk met Engram in V4.1-Flash

DeepSeek V4.1-Flash koppelt 196 miljard Engram-parameters aan een kleinere KV-cache. Daardoor verschuift de infrastructuur voor lange AI-agents van alleen GPU-geheugen naar een combinatie van GPU, systeemgeheugen en opslag.

DeepSeek zet gewichten van visiemodel V4-Flash-Vision-Exp online
Nieuws
4 min

1 sep 06:20

DeepSeek zet gewichten van visiemodel V4-Flash-Vision-Exp online

DeepSeek zette de gewichten van visiemodel V4-Flash-Vision-Exp onder de MIT-licentie op Hugging Face. Zelf hosten mag nu zonder regiobeperking, maar de repository weegt 167,8 gigabyte en is nagemeten op vier B200-kaarten.

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.

DeepSeek zet V4-Flash in publieke beta en rekent in piekuren straks het dubbele
Nieuws
5 min

31 jul 12:27

DeepSeek zet V4-Flash in publieke beta en rekent in piekuren straks het dubbele

DeepSeek zet V4-Flash in publieke beta met fors hogere scores op agent-taken, en kondigt aan dat de tarieven tijdens piekuren verdubbelen. Dat piekblok valt precies in de Nederlandse werkochtend.

DeepSeek zet experimenteel visiemodel live tegen Flash-tarief
Nieuws
5 min

21 aug 18:25

DeepSeek zet experimenteel visiemodel live tegen Flash-tarief

DeepSeek zet een experimenteel visiemodel live dat afbeeldingen leest voor het tarief van V4-Flash, met maximaal 384 tokens per afbeelding. De vergelijking met Claude Opus 4.8 komt uit DeepSeeks eigen benchmarktabel.

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter
Nieuws
5 min

14 aug 12:10

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter

Z.ai bracht GLM-5.3 uit via zijn API, maar de gewichten volgen pas over twee weken omdat de post-training onverwacht sterke exploitvaardigheden opleverde. Zelf hosten kan dus nog niet, meelopen via een Chinese API wel.