DeepSeek brengt op 10 september V4.1-Flash uit als multimodaal model voor agents en code, met een nieuw tariefschema vanaf 04:00 UTC, meldt het bedrijf.
Voor een Nederlands bedrijf verschuift de rekensom op twee punten. Eén API-model verwerkt tekst, code en afbeeldingen met een contextvenster van 1 miljoen tokens. Tegelijk hangt de prijs af van het tijdstip en van hergebruikte context: de officiële prijstabel noemt buiten de piek $0,15 per miljoen inputtokens bij een cachemisser, $0,003 bij een cachetreffer en $0,60 per miljoen outputtokens. Tijdens de piekuren verdubbelen die bedragen. Ter vergelijking: V4-Pro staat in dezelfde prijstabel op $0,66 per miljoen inputtokens bij een cachemisser en $1,98 per miljoen outputtokens buiten de piek. De Flash-variant is daar ongeveer 77 procent goedkoper op input en 70 procent op output, voordat het verbruik per taak wordt meegerekend.
De API-prijs volgt de klok
De nieuwe tarieven gelden sinds 04:00 UTC op 10 september, dus sinds 06:00 Nederlandse zomertijd. Op werkdagen liggen de piekuren van 01:00 tot 04:00 en van 06:00 tot 10:00 UTC. Dat tweede blok valt in Nederland tussen 08:00 en 12:00 uur. Een interactieve agent die in de ochtend draait, krijgt daardoor een andere kostprijs dan dezelfde workflow buiten het piekvenster.
De cache maakt nog een tweede verschil. Een stabiele systeemprompt of vaste documentcontext kan als cachetreffer worden hergebruikt tegen $0,003 per miljoen inputtokens. Bij een misser is dat vijftig keer duurder. De prijs van een agent wordt daarmee bepaald door het gekozen model, de manier waarop de context wordt opgebouwd en het moment waarop het werk draait.
Een model voor tekst, beeld en tools
V4.1-Flash heeft volgens de technische modelkaart een MoE-architectuur met 552 miljard backbone-parameters. Door de nieuwe Causal Encoder-Decoder-architectuur activeert het model 8 miljard parameters per token tijdens het inlezen van input en 16 miljard tijdens het genereren van output. Het model ondersteunt tekst en beeld native, kan tot 1 miljoen tokens context verwerken en heeft een instelbare redeneerinspanning van 1 tot 100.
DeepSeek zegt dat de nieuwe architectuur ook het geheugen voor lange contexten verkleint. De KV-cache vraagt een kwart van het HBM-geheugen en een achtste van de SSD-opslag van de vorige generatie. Dat raakt vooral agents die dezelfde bestanden, instructies en tussenstappen over veel acties meenemen. Minder modelgeheugen verlaagt niet automatisch elke API-factuur, maar kan hoge doorvoer en lange agenttaken technisch minder zwaar maken.
De agentbenchmarks zijn concreet
In de officiële modelkaart van V4.1-Flash staan, gemeten met maximale redeneerinspanning, 90,6 op Terminal-Bench 2.1 tegenover 87,9 voor V4-Pro en 82,7 voor de vorige V4-Flash. Op DeepSWE v1.1 staat het model op 74,2, tegenover 62,7 voor V4-Pro. Op CyberGym komt het uit op 88,1, tegenover 83,3 voor Pro.

Die cijfers zijn geen onafhankelijke producttest. DeepSeek vermeldt dat de code-agentbenchmarks met DeepSeek Harness Minimal mode zijn gedraaid, met maximale redeneerinspanning, temperature=1.0 en top_p=0.95. De scores maken de prestatieclaim controleerbaar, maar zeggen nog niet hoeveel fouten een agent in een specifiek Nederlands proces maakt of wat één taak daar werkelijk kost.
Bestaande koppelingen blijven bruikbaar
Op de API heet het model deepseek-flash. De documentatie noemt ondersteuning voor tool calls, de Responses API, de OpenAI-indeling, de Anthropic-indeling en beeldinvoer. De oude modelnamen deepseek-v4-flash en deepseek-v4-flash-vision-exp blijven voor compatibiliteit tijdelijk naar V4.1-Flash routeren.
Vanaf 04:00 UTC op 14 september worden verzoeken aan deepseek-v4-pro eveneens naar V4.1-Flash gestuurd en tegen het Flash-tarief afgerekend, totdat V4.1-Pro verschijnt. Voor organisaties die Pro-verkeer gebruiken, verandert dan dus de feitelijke modelroute zonder dat de aanvraagnaam meteen verandert.
De gewichten staan onder een MIT-licentie op Hugging Face en de modelkaart beschrijft inzet met onder meer vLLM en SGLang. Tegelijk gaat het om een model met honderden miljarden parameters. DeepSeek noemt zelf een opslagcluster en 2.000 GPU's als voorbeeld voor grootschalige implementaties. Voor de meeste Nederlandse organisaties ligt de eerste toegang daarom bij de API; zelf hosten is een afzonderlijke infrastructuurkeuze.
De aangekondigde dubbele piektarieven in het Nederlandse ochtendblok krijgen met deze release een concrete ingangsdatum. V4.1-Flash maakt daarmee zichtbaar waar modelkeuze naartoe schuift: prestaties, beeldinvoer, caching, planning en databeheer bepalen samen de kosten van een agent, niet één leaderboardscore.
Veelgestelde vragen
Van model naar agent
Ik help je de stap van modelkeuze naar een werkende AI-agent zetten, van meedenken en ontwerp tot realiseren en automatiseren. Ik bouw de hele keten end-to-end en houd self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
