Iemand rekent aan een bureau met een rekenmachine een maandelijkse kostenpost uit.
Nieuws31 juli · 12:275 min leestijd

DeepSeek zet V4-Flash in publieke beta en rekent in piekuren straks het dubbele

DeepSeek zet V4-Flash in publieke beta met fors hogere scores op agent-taken, en kondigt aan dat de tarieven tijdens piekuren verdubbelen. Dat piekblok valt precies in de Nederlandse werkochtend.

DeepSeek heeft zijn V4-Flash-API in publieke beta gezet, met fors hogere scores op agent-taken, en meldt op dezelfde dag dat de tarieven tijdens piekuren binnenkort verdubbelen.

Dat tweede deel raakt je maandrekening harder dan het eerste. Een agentproces dat 50 miljoen invoer- en 10 miljoen uitvoertokens per maand verstookt, kost op V4-Flash 9,80 dollar. Datzelfde proces kost op GPT-5.6 Luna 22 dollar, op Terra 220 dollar en op Claude Opus 4.8 rond de 500 dollar. Maar de piekuren die DeepSeek noemt lopen dagelijks van 9:00 tot 12:00 en van 14:00 tot 18:00 Pekingtijd, en dat tweede blok valt in de Nederlandse zomertijd precies tussen 8:00 en 12:00 's ochtends. Je drukste werkuren worden je duurste.

Piektarief in je ochtend

Op de eigen prijspagina staat dat de API "binnenkort" overgaat op piek- en daltarieven, waarbij in de piekuren het dubbele geldt voor alle facturabele onderdelen. De ingangsdatum hangt nog van een officiële aankondiging af, dus vandaag betaal je nog het gewone tarief: 0,14 dollar per miljoen invoertokens bij een cachemisser en 0,28 dollar per miljoen uitvoertokens. Bij een cachetreffer zakt de invoer naar 0,0028 dollar, vijftig keer minder. Wie zijn systeemprompt en context stabiel houdt, drukt de rekening dus veel harder dan wie op de kale tokenprijs let.

Voor een Nederlands team betekent het aangekondigde piekvenster iets heel praktisch. Batchwerk dat geen haast heeft, nachtelijke verrijking, het bijwerken van een index, het doorrekenen van een archief, verhuist beter naar de middag of de avond. Interactief werk in de ochtend wordt straks twee keer zo duur, en dat is precies het verkeer dat je niet kunt uitstellen.

Het logo van DeepSeek, een paarse walvis naast de merknaam. Bron: RoadMaster19 / Wikimedia Commons (CC BY 4.0)
Het logo van DeepSeek, een paarse walvis naast de merknaam. Bron: RoadMaster19 / Wikimedia Commons (CC BY 4.0)

De sprong zit in agent-taken

De nieuwe versie heet DeepSeek-V4-Flash-0731 en houdt dezelfde architectuur en omvang als de preview. Alleen de natraining is opnieuw gedaan. Dat levert volgens DeepSeek 82,7 op Terminal Bench 2.1, 76,7 op Cybergym, 70,3 op Toolathlon verified, 54,4 op DeepSWE en 54,2 op NL2Repo. Twee interne testsets, DSBench-FullStack en DSBench-Hard, komen uit op 68,7 en 59,6.

Bij die cijfers hoort een voorbehoud dat DeepSeek er zelf bij zet. De code-agent-tests draaiden op een eigen harnas, DeepSeek Harness minimal mode, dat nog niet is uitgebracht, op de hoogste inspanningsstand met temperature 1,0. Een score uit een eigen harnas laat zich niet zomaar naast een score uit een publiek harnas leggen.

Even belangrijk is waar DeepSeek de vergelijking níet mee maakt. In de release zet het bedrijf de scores af tegen zijn eigen V4-Pro-Preview, niet tegen Claude Opus 4.8 of een ander westers topmodel. De vergelijking met Opus komt van buiten, niet van DeepSeek zelf. Op de onafhankelijke Intelligence Index van Artificial Analysis staat V4-Flash op 50 tegen 56 voor Claude Opus 4.8, bij een gemengde prijs van 0,06 tegen 3,85 dollar per miljoen tokens. Dicht in de buurt, niet gelijk, en een fractie van de prijs.

Technisch is er nog iets dat telt als je met agents werkt: V4-Flash ondersteunt nu native het Responses API-formaat en is aangepast voor Codex. Je kunt je bestaande agent-gereedschap er dus op richten zonder de aanroepen te herschrijven. V4-Pro krijgt die ondersteuning pas begin augustus. De limiet op gelijktijdige verzoeken ligt bij Flash op 2.500 tegen 500 bij Pro, wat het lichtere model juist voor parallelle agentwerkstromen aantrekkelijk maakt.

Naast de tarieven van OpenAI en Anthropic

De timing is opvallend. Eén dag eerder verlaagde OpenAI de API-prijs van GPT-5.6 Luna met 80 procent en die van Terra met 20 procent, waarmee Luna op 0,20 dollar invoer en 1,20 dollar uitvoer kwam. Anthropic rekent voor Claude Opus 4.8 onveranderd 5 dollar invoer en 25 dollar uitvoer, en het dubbele in fast mode.

API-prijs per miljoen uitvoertokens in dollar, volgens de officiële prijspagina's van DeepSeek, OpenAI en Anthropic

Nikkei Asia plaatst de release in een wereldwijde prijsoorlog rond topmodellen die hierdoor verder oploopt. Die oorlog voert DeepSeek al langer op efficiëntie in plaats van op korting: eerder deze zomer gaf het bedrijf DSpark vrij, de open techniek die V4 tot 85 procent sneller laat antwoorden zonder kwaliteitsverlies. De piektarieven passen in datzelfde plaatje: niet de prijs verlagen, maar de vraag over de dag spreiden zodat de bestaande capaciteit verder reikt.

Eén ding hoort er wel bij. Wie zijn productie op een Chinees model zet, koopt naast een lage prijs ook regelgevende onzekerheid in, en die weegt in de modelkeuze mee naast de tokenprijs.

Waar de vergelijking kantelt

De interessante verschuiving zit niet in het cijfer op Terminal Bench, maar in wat er straks op je factuur staat. Zolang aanbieders één vast tarief per miljoen tokens hanteerden, was een modelvergelijking een simpele som. Met piek- en daltarieven, cachetreffers die vijftig keer schelen en fast modes tegen het dubbele tarief hangt de prijs van een taak ineens af van het uur waarop je hem draait en hoe je hem hebt opgebouwd.

Daarmee wordt het advies om modellen te vergelijken op kosten per taak in plaats van per token harder dan het was. Twee teams die exact hetzelfde model gebruiken kunnen straks een factor vier verschillen, puur door caching en planning. Dat is geen inkoopvraag meer, maar een ontwerpvraag.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Kosten die je kunt sturen

Een tokenprijs die per uur verschilt maakt van modelkeuze een ontwerpvraag. Ik denk met je mee over de opzet, bouw de agents en koppelingen en richt caching en planning zo in dat je rekening voorspelbaar blijft, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.

DeepSeek kondigt een brede prijsverhoging aan voor zijn API
Nieuws
5 min

6 aug 12:11

DeepSeek kondigt een brede prijsverhoging aan voor zijn API

DeepSeek kondigt op zijn eigen prijspagina een brede verhoging aan van alle API-tarieven, zonder bedrag of datum. De eerder aangekondigde piektarieven zijn van die pagina verdwenen, en elke tokenbegroting die op prijs rustte moet opnieuw door de rekenmachine.

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting
Nieuws
5 min

18 aug 06:23

Qwen3.8-27B evenaart GPT-5.6 Luna in onafhankelijke meting

Benchmarkbureau Artificial Analysis geeft Qwen3.8-27B een 52, gelijk aan GPT-5.6 Luna. Het model past in 17 GB op een enkele videokaart, maar verbruikt 160 miljoen tokens waar de mediaan op 43 miljoen ligt.

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager
Nieuws
5 min

15 aug 06:10

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager

Klanten van OpenAI en Anthropic betalen sinds midden juli bijna een kwart minder per miljoen tokens. Anthropic schrapte bovendien een verhoging die op 1 september zou ingaan, terwijl de topmodellen onveranderd duur blijven.

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code
Nieuws
4 min

10 sep 12:14

DeepSeek brengt V4.1-Flash uit voor multimodale agents en code

DeepSeek brengt V4.1-Flash uit met native beeldinvoer, 1 miljoen tokens context en een tijdgebonden API-prijs. De modelkaart toont hogere scores op agentbenchmarks, terwijl caching en Nederlandse piekuren de werkelijke kosten bepalen.

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet
Nieuws
4 min

26 aug 22:35

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet

Moonshot vraagt volgens Reuters tot 30 procent van de omzet die Microsoft, Amazon en Google met Kimi K3 zouden maken. De gesprekken bepalen of je het Chinese topmodel straks gewoon als clouddienst inkoopt.